Java：读者和编码

Java的默认编码是ASCII 。是？（见下面的编辑）

当文本文件以UTF-8编码时？读者如何知道他必须使用UTF-8 ？

我谈到的读者是：

FileReader
来自Socket的BufferedReader
来自System.in的Scanner
…

编辑

它转变为我们的编码取决于操作系统，这意味着在每个操作系统上都不是这样：

 'a'== 97

读者如何知道他必须使用UTF-8？

您通常在InputStreamReader指定自己。它有一个构造函数采用字符编码。例如

 Reader reader = new InputStreamReader(new FileInputStream("c:/foo.txt"), "UTF-8");

所有其他读者（据我所知）使用平台默认字符编码，这可能实际上不是正确的编码（例如-cough CP-1252 ）。

理论上，您还可以根据字节顺序标记自动检测字符编码。这将几种unicode编码与其他编码区分开来。遗憾的是，Java SE没有任何API，但您可以自制一个可用于替换InputStreamReader API，如上例所示：

 public class UnicodeReader extends Reader { private static final int BOM_SIZE = 4; private final InputStreamReader reader; /** * Construct UnicodeReader * @param in Input stream. * @param defaultEncoding Default encoding to be used if BOM is not found, * or null to use system default encoding. * @throws IOException If an I/O error occurs. */ public UnicodeReader(InputStream in, String defaultEncoding) throws IOException { byte bom[] = new byte[BOM_SIZE]; String encoding; int unread; PushbackInputStream pushbackStream = new PushbackInputStream(in, BOM_SIZE); int n = pushbackStream.read(bom, 0, bom.length); // Read ahead four bytes and check for BOM marks. if ((bom[0] == (byte) 0xEF) && (bom[1] == (byte) 0xBB) && (bom[2] == (byte) 0xBF)) { encoding = "UTF-8"; unread = n - 3; } else if ((bom[0] == (byte) 0xFE) && (bom[1] == (byte) 0xFF)) { encoding = "UTF-16BE"; unread = n - 2; } else if ((bom[0] == (byte) 0xFF) && (bom[1] == (byte) 0xFE)) { encoding = "UTF-16LE"; unread = n - 2; } else if ((bom[0] == (byte) 0x00) && (bom[1] == (byte) 0x00) && (bom[2] == (byte) 0xFE) && (bom[3] == (byte) 0xFF)) { encoding = "UTF-32BE"; unread = n - 4; } else if ((bom[0] == (byte) 0xFF) && (bom[1] == (byte) 0xFE) && (bom[2] == (byte) 0x00) && (bom[3] == (byte) 0x00)) { encoding = "UTF-32LE"; unread = n - 4; } else { encoding = defaultEncoding; unread = n; } // Unread bytes if necessary and skip BOM marks. if (unread > 0) { pushbackStream.unread(bom, (n - unread), unread); } else if (unread < -1) { pushbackStream.unread(bom, 0, 0); } // Use given encoding. if (encoding == null) { reader = new InputStreamReader(pushbackStream); } else { reader = new InputStreamReader(pushbackStream, encoding); } } public String getEncoding() { return reader.getEncoding(); } public int read(char[] cbuf, int off, int len) throws IOException { return reader.read(cbuf, off, len); } public void close() throws IOException { reader.close(); } }

编辑为您的修改回复：

所以编码取决于操作系统。 这意味着不是每个操作系统都是如此：
 'a'== 97 

不，这不是真的。 ASCII编码（包含128个字符， 0x00直到0x7F ）是所有其他字符编码的基础。只有ASCII字符集之外的字符可能会在另一种编码中以不同方式显示。 ISO-8859编码涵盖ASCII范围内具有相同代码点的ASCII 。 Unicode编码涵盖ISO-8859-1范围内具有相同代码点的字符。

您可能会发现每个博客都是有趣的读物：

绝对最低每个软件开发人员绝对必须知道关于Unicode和字符集（没有借口！）（更多理论上的两个）
Unicode - 如何使角色正确？（更实用的两个）

Java的默认编码取决于您的操作系统。对于Windows，它通常是“windows-1252”，对于Unix，它通常是“ISO-8859-1”或“UTF-8”。

读者知道正确的编码，因为您告诉它正确的编码。不幸的是，并非所有读者都允许这样做（例如， FileReader没有），所以通常你必须使用InputStreamReader 。

对于大多数读者来说，Java使用你的平台所做的任何编码和字符集 – 这可能是ASCII或UTF-8的某种风格，或者像JIS（日本）那样更具异国情调的东西。然后将此集中的字符转换为Java在内部使用的UTF-16。

如果平台编码与文件编码不同（我的问题 – UTF-8文件是标准文件，但我的平台使用Windows-1252编码），则有一种解决方法。创建一个使用指定编码的构造函数的InputStreamReader实例。

编辑：这样做：

 InputStreamReader myReader = new InputStreamReader(new FileInputStream(myFile),"UTF-8"); //read data myReader.close();

但是，IIRC有一些条款可以自动检测常见编码（例如UTF-8和UTF-16）。 UTF-16可以通过开头的字节顺序标记来检测。 UTF-8也遵循一定的规则，但通常你的平台编码和UTF-8的差异不重要，除非你使用国际字符代替拉丁语。

我想先介绍这一部分：

Java的默认编码是ASCII。是？

Java环境中至少有4种不同的东西可以称为“默认编码”：

“默认字符集”是Java在运行时用于将字节转换为字符（和byte[]到String ）的内容，当没有指定其他内容时。这个取决于平台，设置，命令行参数，……通常只是平台默认编码。
Java在char值和String对象中使用的内部字符编码。这个总是 UTF-16 ！没有办法改变它，它只是UTF-16！这意味着表示始终具有数值97的char和表示π的char始终具有数值960。
Java用于在.class文件中存储String常量的字符编码。这个总是 UTF-8。没有办法改变它。
Java编译器用于解释.java文件中的Java源代码的charset。这个默认为默认字符集，但可以在编译时配置。

读者如何知道他必须使用UTF-8？

它没有。如果您有一些纯文本文件，那么您必须知道编码才能正确读取它。如果你很幸运，你可以猜测（例如，你可以尝试平台默认编码），但这是一个容易出错的过程，在许多情况下你甚至都没有办法意识到你猜对了。这不是 Java特有的。对所有系统都是如此。

某些格式（如XML和所有基于XML的格式）在设计时考虑了这一限制，并包含一种指定数据编码的方法，因此不再需要猜测。

阅读每个软件开发人员的绝对最低要求，绝对必须知道关于Unicode和字符集（没有借口！）的详细信息。

你可以在这里开始了解Java Charset API的想法

请注意，根据文档，

Java编程语言的本机字符编码是UTF-16

编辑：

抱歉，在我完成此操作之前我已经被叫走了，也许我不应该发布部分答案。无论如何，其他答案解释了细节，重点是java将正确读取每个平台的本机文件字符集以及常见的备用字符集。

Java：读者和编码

编辑

编辑：这样做：

编辑：

写入文件但只保存最后一行

Java – Class Not Foundexception

使用FileChannel和ByteArrays读取ASCII文件

检查文件是否完整写入

如何使用Java将文件分成几部分？

FileNotFoundException与NoSuchFileException

未报告的exceptionjava.io.FileNotFoundException;？

如何使用java 读取文本文件中的最后一行

用Java读取和处理大文本文件？

Java中的缓冲和无缓冲流