JAXB 在 UTF-16 上阻塞 XML

JAXB chokes on UTF-16 XML

我的项目使用 JAXB 从各种来源解析 XML。这适用于大多数来源,但我无法解析来自某个特定来源的文档。我能找到的唯一区别是,有问题的文档报告其编码为 UTF-16,而据我所知,其他文档似乎是 UTF-8。

代码如下:

InputStream inputStream = new FileInputStream(inputFile);
DocumentBuilderFactory dbf = DocumentBuilderFactory.newInstance();
dbf.setNamespaceAware(true);
DocumentBuilder db = dbf.newDocumentBuilder();
Document doc = db.parse(inputStream);

这将引发以下异常:

[Fatal Error] :1:40: Content is not allowed in prolog.
org.xml.sax.SAXParseException; lineNumber: 1; columnNumber: 40; Content is not allowed in prolog.
    at com.sun.org.apache.xerces.internal.parsers.DOMParser.parse(DOMParser.java:257)
    at com.sun.org.apache.xerces.internal.jaxp.DocumentBuilderImpl.parse(DocumentBuilderImpl.java:339)
    at javax.xml.parsers.DocumentBuilder.parse(DocumentBuilder.java:121)
    at ... (my code)

违规文档以

开头
<?xml version="1.0" encoding="UTF-16"?>

紧接着是根元素的开始标记。我用十六进制编辑器检查了文件;在开始标记之前没有其他字符(甚至没有 BOM 或任何非打印字符)。

如果我将 encoding 属性更改为 UTF-8,代码将运行超过该点(尽管它会进一步抛出不相关的异常)。

JAXB 与 UTF-16 不兼容吗?或者还有什么问题?

运行 xmlstarlet fo 上的文件产生了以下错误:

/path/to/document.xml:1.38: Document labelled UTF-16 but has UTF-8 content

总而言之,带有错误消息 Content is not allowed in prologorg.xml.sax.SAXParseException 相当不明确,在某些情况下具有误导性.

虽然通常它表示在根元素之前遇到了非法的额外字符(包括非打印字符),但它也可能表示完全不同的东西——例如XML prolog 指定的编码与实际编码不匹配。