UTF-16バイト配列
JavaScriptは、C#と同様に文字列をUTF-16としてエンコードするUnicodeEncodingため、バイト配列はcharCodeAt()、を使用して正確に一致し、返された各バイトペアを次のように2つの別々のバイトに分割する必要があります。
function strToUtf16Bytes(str) {
const bytes = [];
for (ii = 0; ii < str.length; ii++) {
const code = str.charCodeAt(ii);
bytes.push(code & 255, code >> 8);
}
return bytes;
}
例えば:
strToUtf16Bytes('🌵');
ただし、UTF-8バイト配列を取得する場合は、バイトをトランスコードする必要があります。
UTF-8バイト配列
解決策はやや自明ではないように感じますが、トラフィックの多い本番環境で以下のコードを使用して大成功を収めました(元のソース)。
また、興味のある読者のために、PHPなどの他の言語で報告された文字列の長さを処理するのに役立つUnicodeヘルパーを公開しました。
export function strToUtf8Bytes(str) {
const utf8 = [];
for (let ii = 0; ii < str.length; ii++) {
let charCode = str.charCodeAt(ii);
if (charCode < 0x80) utf8.push(charCode);
else if (charCode < 0x800) {
utf8.push(0xc0 | (charCode >> 6), 0x80 | (charCode & 0x3f));
} else if (charCode < 0xd800 || charCode >= 0xe000) {
utf8.push(0xe0 | (charCode >> 12), 0x80 | ((charCode >> 6) & 0x3f), 0x80 | (charCode & 0x3f));
} else {
ii++;
charCode = 0x10000 + (((charCode & 0x3ff) << 10) | (str.charCodeAt(ii) & 0x3ff));
utf8.push(
0xf0 | (charCode >> 18),
0x80 | ((charCode >> 12) & 0x3f),
0x80 | ((charCode >> 6) & 0x3f),
0x80 | (charCode & 0x3f),
);
}
}
return utf8;
}