如何从XML字符串中加载org.w3c.dom.Document？

103

我在字符串中有一个完整的XML文档，想要一个Document对象。Google会产生各种垃圾。什么是最简单的解决方案？（在Java 1.5中）

解决方案感谢Matt McMinn，我决定完成此实现。对我来说，它具有适当级别的输入灵活性和异常粒度。（很高兴知道错误是来自格式错误的XML- SAXException还是来自错误的IO- IOException。）

public static org.w3c.dom.Document loadXMLFrom(String xml)
    throws org.xml.sax.SAXException, java.io.IOException {
    return loadXMLFrom(new java.io.ByteArrayInputStream(xml.getBytes()));
}

public static org.w3c.dom.Document loadXMLFrom(java.io.InputStream is) 
    throws org.xml.sax.SAXException, java.io.IOException {
    javax.xml.parsers.DocumentBuilderFactory factory =
        javax.xml.parsers.DocumentBuilderFactory.newInstance();
    factory.setNamespaceAware(true);
    javax.xml.parsers.DocumentBuilder builder = null;
    try {
        builder = factory.newDocumentBuilder();
    }
    catch (javax.xml.parsers.ParserConfigurationException ex) {
    }  
    org.w3c.dom.Document doc = builder.parse(is);
    is.close();
    return doc;
}

— 弗兰克·克鲁格
source

如果可以纠正解决方案，那就太好了。使用String.getByptes和InputStream会带来i18n问题。我的一位朋友从这里获取了代码，这是错误的。幸运的是，findbugs检测到了该问题。erickson提供的正确解决方案是使用InputSource。

— 肯尼思·许

80

在Java 1.5中，这对我有效-我去除了一些特殊的可读性。

import javax.xml.parsers.DocumentBuilderFactory;
import javax.xml.parsers.DocumentBuilder;
import org.w3c.dom.Document;
import java.io.ByteArrayInputStream;

public Document loadXMLFromString(String xml) throws Exception
{
    DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance();

    factory.setNamespaceAware(true);
    DocumentBuilder builder = factory.newDocumentBuilder();

    return builder.parse(new ByteArrayInputStream(xml.getBytes()));
}

— 马特·麦克明
source

28

正如sylvarking的答案所指出的，此代码在使用getBytes()时不考虑编码。

— McDowell

2

你是说埃里克森的答案吗？还是他重命名了个人资料？

— rogerdpack 2012年

1

不应该有演员return (Document) builder.parse(new ByteArrayInputStream(xml.getBytes()));吗？

— InfantPro'Aravind'2013年

150

哇！

此代码可能存在严重的问题，因为它会忽略String（默认为UTF-8）中指定的字符编码。调用String.getBytes()平台时，默认编码用于将Unicode字符编码为字节。因此，解析器可能认为它实际上正在获取UTF-8数据，而实际上它正在获取EBCDIC之类的东西……不漂亮！

相反，使用带InputSource的parse方法，可以使用Reader构造它，如下所示：

import java.io.StringReader;
import org.xml.sax.InputSource;
…
        return builder.parse(new InputSource(new StringReader(xml)));

看起来似乎没什么大不了，但是对字符编码问题的无知导致了类似于y2k的隐匿代码腐烂。

— 埃里克森
source

3

Google上的解决方案如此简单却难以捉摸。谢谢+1

— pat8719 '02

6

我现在意识到，我不应该只复制并粘贴已接受的答案，而应该通读。

— Vitaly Sazanovich

1

太棒了！使用以下安装文件在JDK8上挽救了我们的生命：encoding = ISO-8859_1，javax.servlet.request.encoding = UTF-8 PS标记为正确的答案对我们不起作用

— kosta5

9

只是有一个类似的问题，除了我需要一个NodeList而不是一个Document，这就是我的想法。它与以前的解决方案基本相同，但经过增强后可以将根元素作为NodeList删除，并使用erickson的建议使用InputSource代替字符编码问题。

private String DOC_ROOT="root";
String xml=getXmlString();
Document xmlDoc=loadXMLFrom(xml);
Element template=xmlDoc.getDocumentElement();
NodeList nodes=xmlDoc.getElementsByTagName(DOC_ROOT);

public static Document loadXMLFrom(String xml) throws Exception {
        InputSource is= new InputSource(new StringReader(xml));
        DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance();
        factory.setNamespaceAware(true);
        DocumentBuilder builder = null;
        builder = factory.newDocumentBuilder();
        Document doc = builder.parse(is);
        return doc;
    }

— 施泰默
source

1

为了用Java处理XML，我总是倾向于使用Transformer API：

import javax.xml.transform.Source;
import javax.xml.transform.TransformerException;
import javax.xml.transform.TransformerFactory;
import javax.xml.transform.dom.DOMResult;
import javax.xml.transform.stream.StreamSource;

public static Document loadXMLFrom(String xml) throws TransformerException {
    Source source = new StreamSource(new StringReader(xml));
    DOMResult result = new DOMResult();
    TransformerFactory.newInstance().newTransformer().transform(source , result);
    return (Document) result.getNode();
}

— 泽维尔·杜瑞（Xavier Dury）
source