中文乱码

dinner_pig

浏览: 7694 次

最近访客更多访客>>

moran1989

dreamertn9527

eqzcy

pljj000

博主相关

博客

微博

相册

留言

关于我

文章分类

全部博客 (6)

社区版块

存档分类

（1）Java代码默认以unicode存储。但是在操作系统选用一定的开发环境编辑java文件，却使用操作系统默认的编码方式，从而源文件的编码方式与编辑平台相关。在中文windows平台下开发的源文件，将以GB2312方式编码。如果要将它以utf-8编码，在编译的时候要指它 -encoding GB2312 ,这样，编译后生成的字节文件编码为UTF-8，其中的硬编码信息也以UTF-8格式存储。

（2）分析下网上的一个例子：(实践出真知，真正运行下程序才明白怎么回事)

import java.io.FileInputStream;
import java.io.InputStreamReader;
import java.io.BufferedReader;
public class Decode{
public static void main (String []args) throws Exception{
   FileInputStream fis=new FileInputStream("./document.txt");      //文件字节流
InputStreamReader isr=new InputStreamReader(fis,"UTF-8");//字节流和字符流的桥梁，可以指定指定字符格式
   String str=null;

   //直接读取字符，只要编码问题没问题
   int c=0;
   while((c=isr.read())!=-1)
    System.out.print((char)c);             [   1   ]
   System.out.println(" first one______________________________________________________");

//将InputStreamReader 封装到缓冲流中，需要字符编码正确

   BufferedReader br=new BufferedReader(isr);
   str=br.readLine();
   while(str!=null)
   {
    System.out.println(str);
    str=br.readLine();
   }                                                            [   2 ]
   System.out.println(" second one______________________________________________________");

   //使用默认编码的InputStreamReader ，当为ANSI的时候没问题，但是读取UTF-8的时候出错。
   BufferedReader br2=new BufferedReader(new InputStreamReader(fis));
   str=br2.readLine();
   while(str!=null)
   {
    System.out.println(str);                    [   3   ]
    str=br2.readLine();
   }

System.out.println(" third one______________________________________________________");

}

}

    Decode.java :   ANSI

    document.txt : UTF-8（无BOM）

新建txt文档，复制此处代码，保存到txt中，为Decode.java，可以用nodtpad++看到采用ANSI编码，这里ANSI是和系统的默认字符集相关的，中文winodws下为GB2312,   运行 javac Decode.java， OK；然后运行java Decode: 【1】【2】正确输出中文，【3】输出乱码

   Decode.java :ANSI

document.txt :ANSI

【1】【2】输出乱码   ，【3】正确输出中文

Decode.java :UTF-8(无BOM)   document.txt :utf-8(无bom)

   javac Decode.java 有警告，编码的GBK不可映射。 java Decode:   【1】【2】正确输出，【3】输出乱码

   Decode.java :UTF-8(无BOM) document.txt:ANSI

javac Decode.java有警告，编码的GBK不可映射     java Decode:   【1】【2】输出乱码，【3】正确输出

    从实际运行的结果可以看出，1、当java文件编码为ANSI时，如果要读取的文件采用UTF-8编码，需要指明 new InputStreamReader(fis,"UTF-8")，这样才能正确读取UTF-8编码的中文，如果不指定，默认的InputStreamReader采用默认的字符集，这时就是ANSI了，无法读出UTF-8 编码的文件。但如果要读取的文件和java文件都一样采用默认的编码，刚可以用InputStreamReader的默认字符集。 2、当在Eclipse中为工程指定属性UTF-8后，我们的java源文件会采用UTF-8编码，这时读取的文件如果为ANSI，则采用 InputStreamReaderr的默认字符集。 3、到至读放流后，按字节读取，刚需要文件的编码与读入时设定的编码相同。

分享到：