将流缓冲区转换为utf8字符串


183

我想使用node.js进行HTTP请求,以从Web服务器加载一些文本。由于响应中可能包含很多文本(有些兆字节),因此我想分别处理每个文本块。我可以使用以下代码来实现:

var req = http.request(reqOptions, function(res) {
    ...
    res.setEncoding('utf8');
    res.on('data', function(textChunk) {
        // process utf8 text chunk
    });
});

这似乎没有问题。但是我想支持HTTP压缩,所以我使用zlib:

var zip = zlib.createUnzip();

// NO res.setEncoding('utf8') here since we need the raw bytes for zlib
res.on('data', function(chunk) {
    // do something like checking the number of bytes downloaded
    zip.write(chunk); // give the raw bytes to zlib, s.b.
});

zip.on('data', function(chunk) {
    // convert chunk to utf8 text:
    var textChunk = chunk.toString('utf8');

    // process utf8 text chunk
});

这可以是像多字节字符的问题'\u00c4',其由两个字节组成:0xC30x84。如果第一个字节被第一个块(Buffer)覆盖,第二个字节被第二个块覆盖,则将chunk.toString('utf8')在文本块的结尾/开头产生不正确的字符。如何避免这种情况?

提示:我仍然需要缓冲区(更具体地说是缓冲区中的字节数)来限制下载的字节数。因此res.setEncoding('utf8'),在上面的第一个示例代码中使用like来处理非压缩数据不符合我的需求。

Answers:


289

单缓冲器

如果只有一个Buffer,则可以使用其toString方法,该方法将使用特定的编码将全部或部分二进制内容转换为字符串。utf8如果您不提供参数,则默认为默认值,但是在此示例中,我已明确设置了编码。

var req = http.request(reqOptions, function(res) {
    ...

    res.on('data', function(chunk) {
        var textChunk = chunk.toString('utf8');
        // process utf8 text chunk
    });
});

流式缓冲区

如果您已像上述问题一样流式传输了缓冲区,则多字节字符的第一个字节UTF8可能包含在第一个Buffer(块)中,第二个字节包含在第二个(块中),Buffer则应使用a StringDecoder。:

var StringDecoder = require('string_decoder').StringDecoder;

var req = http.request(reqOptions, function(res) {
    ...
    var decoder = new StringDecoder('utf8');

    res.on('data', function(chunk) {
        var textChunk = decoder.write(chunk);
        // process utf8 text chunk
    });
});

这样,不完整字符的字节将被缓冲,StringDecoder直到将所有需要的字节写入解码器为止。


63
您也可以chunk.toString('utf8');
Zugwalt 2013年

1
请在您的答案中添加以上建议,作为其他人的更新。非常感谢 !
FacePalm 2014年

9
@joshperry:很抱歉,但是正如我的问题文本所解释的:chunk.toString('utf8')由于UTF8中使用多字节字符,因此并不总是有效。我不明白为什么您更改了答案,使用显式克服了这个问题StringDecoder。我在这里想念什么吗?有node改变吗?
Biggie

8
我更改了主题标题并编辑了答案。现在,它显示了两种解决方案:使用转换流缓冲区和单个缓冲区toString
Biggie

1
感谢您展示如何正确处理多字节字符跨块分割的情况。互联网上的许多其他资源都完全忽略了这一点,这会导致错误的代码,这些代码只有在投入生产后才会失败。
jlh

-4
var fs = require("fs");

function readFileLineByLine(filename, processline) {
    var stream = fs.createReadStream(filename);
    var s = "";
    stream.on("data", function(data) {
        s += data.toString('utf8');
        var lines = s.split("\n");
        for (var i = 0; i < lines.length - 1; i++)
            processline(lines[i]);
        s = lines[lines.length - 1];
    });

    stream.on("end",function() {
        var lines = s.split("\n");
        for (var i = 0; i < lines.length; i++)
            processline(lines[i]);
    });
}

var linenumber = 0;
readFileLineByLine(filename, function(line) {
    console.log(++linenumber + " -- " + line);
});
By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.