Java/J2EE中文問題

wmlm發表於2007-05-17

和文明及黃小寧討論了字符集問題,在此補充個參考資料備用

[@more@]

Java/J2EE中文問題終極解決之道

2005/06/29

  Java中文問題一直困擾著很多初學者,如果瞭解了Java系統的中文問題原理,我們就可以對中文問題能夠採取根本的解決之道。

  最古老的解決方案是使用String的位元組碼轉換,這種方案問題是不方便,我們需要破壞物件封裝性,進行位元組碼轉換。

  還有一種方式是對J2EE容器進行編碼設定,如果J2EE應用系統脫離該容器,則會發生亂碼,而且指定容器配置不符合J2EE應用和容器分離的原則。

  在Java內部運算中,涉及到的所有字串都會被轉化為UTF-8編碼來進行運算。那麼,在被Java轉化之前,字串是什麼樣的字符集? Java總是根據作業系統的預設編碼字符集來決定字串的初始編碼,而且Java系統的輸入和輸出的都是採取作業系統的預設編碼。

  因此,如果能統一Java系統的輸入、輸出和作業系統3者的編碼字符集合,將能夠使Java系統正確處理和顯示漢字。這是處理Java系統漢字的一個原則,但是在實際專案中,能夠正確抓住和控制住Java系統的輸入和輸出部分是比較難的。J2EE中,由於涉及到外部瀏覽器和資料庫等,所以中文問題亂碼顯得非常突出。

  J2EE應用程式是執行在J2EE容器中。在這個系統中,輸入途徑有很多種:一種是透過頁面表單打包成請求(request)發往伺服器的;第二種是透過資料庫讀入;還有第3種輸入比較複雜,JSP在第一次執行時總是被編譯成Servlet,JSP中常常包含中文字元,那麼編譯使用javac時,Java將根據預設的作業系統編碼作為初始編碼。除非特別指定,如在Jbuilder/eclipse中可以指定預設的字符集。

  輸出途徑也有幾種:第一種是JSP頁面的輸出。由於JSP頁面已經被編譯成Servlet,那麼在輸出時,也將根據作業系統的預設編碼來選擇輸出編碼,除非指定輸出編碼方式;還有輸出途徑是資料庫,將字串輸出到資料庫。

  由此看來,一個J2EE系統的輸入輸出是非常複雜,而且是動態變化的,而Java是跨平臺執行的,在實際編譯和執行中,都可能涉及到不同的作業系統,如果任由Java自由根據作業系統來決定輸入輸出的編碼字符集,這將不可控制地出現亂碼。

  正是由於Java的跨平臺特性,使得字符集問題必須由具體系統來統一解決,所以在一個Java應用系統中,解決中文亂碼的根本辦法是明確指定整個應用系統統一字符集。

  指定統一字符集時,到底是指定ISO8859_1 、GBK還是UTF-8呢?

  (1)如統一指定為ISO8859_1,因為目前大多數軟體都是西方人編制的,他們預設的字符集就是ISO8859_1,包括作業系統Linux和資料庫MySQL等。這樣,如果指定Jive統一編碼為ISO8859_1,那麼就有下面3個環節必須把握:

  開發和編譯程式碼時指定字符集為ISO8859_1。

  執行作業系統的預設編碼必須是ISO8859_1,如Linux。

  在JSP頭部宣告:。

  (2)如果統一指定為GBK中文字符集,上述3個環節同樣需要做到,不同的是隻能執行在預設編碼為GBK的作業系統,如中文Windows。

  統一編碼為ISO8859_1和GBK雖然帶來編制程式碼的方便,但是各自只能在相應的作業系統上執行。但是也破壞了Java跨平臺執行的優越性,只在一定範圍內行得通。例如,為了使得GBK編碼在linux上執行,設定Linux編碼為GBK。

  那麼有沒有一種除了應用系統以外不需要進行任何附加設定的中文編碼根本解決方案呢?

  將Java/J2EE系統的統一編碼定義為UTF-8。UTF-8編碼是一種相容所有語言的編碼方式,惟一比較麻煩的就是要找到應用系統的所有出入口,然後使用UTF-8去“結紮”它。

  一個J2EE應用系統需要做下列幾步工作:

  1. 開發和編譯程式碼時指定字符集為UTF-8。JBuilder和Eclipse都可以在專案屬性中設定。
  2. 使用過濾器,如果所有請求都經過一個Servlet控制分配器,那麼使用Servlet的filter執行語句,將所有來自瀏覽器的請求(request)轉換為UTF-8,因為瀏覽器發過來的請求包根據瀏覽器所在的作業系統編碼,可能是各種形式編碼。關鍵一句:
    request.setCharacterEncoding("UTF-8")。
    網上有此filter的原始碼,中com.jdon.util.SetCharacterEncodingFilter
    需要配置web.xml 啟用該Filter。
  3. 在JSP頭部宣告:。
  4. 在Jsp的html程式碼中,宣告UTF-8:
  5. 設定資料庫連線方式是UTF-8。例如連線MYSQL時配置URL如下:
    jdbc:mysql://localhost:3306/test?useUnicode=true&characterEncoding=UTF-8
    注意,上述寫法是JBoss的mysql-ds.xml寫法,多虧網友提示,在tomcat中&要寫成&即可。一般其他資料庫都可以透過管理設定設定UTF-8
  6. 其他和外界互動時能夠設定編碼時就設定UTF-8,例如讀取檔案,操作XML等。
     筆者以前在Jsp/Servlet時就採取這個原則,後來使用Struts、Tapestry、EJB、Hibernate、Jdon等框架時,從未被亂碼困擾過,可以說適合各種架構。希望本方案供更多初學者分享,減少Java/J2EE的第一個攔路虎,也避免因為採取一些臨時解決方案,導致中文問題一直出現在新的技術架構中。

來自 “ ITPUB部落格 ” ,連結:http://blog.itpub.net/271063/viewspace-915313/,如需轉載,請註明出處,否則將追究法律責任。

相關文章