日韩性视频-久久久蜜桃-www中文字幕-在线中文字幕av-亚洲欧美一区二区三区四区-撸久久-香蕉视频一区-久久无码精品丰满人妻-国产高潮av-激情福利社-日韩av网址大全-国产精品久久999-日本五十路在线-性欧美在线-久久99精品波多结衣一区-男女午夜免费视频-黑人极品ⅴideos精品欧美棵-人人妻人人澡人人爽精品欧美一区-日韩一区在线看-欧美a级在线免费观看

歡迎訪問(wèn) 生活随笔!

生活随笔

當(dāng)前位置: 首頁(yè) > 前端技术 > javascript >内容正文

javascript

JavaScript 的内部字符编码是 UCS-2 还是 UTF-16

發(fā)布時(shí)間:2023/12/15 javascript 30 豆豆
生活随笔 收集整理的這篇文章主要介紹了 JavaScript 的内部字符编码是 UCS-2 还是 UTF-16 小編覺(jué)得挺不錯(cuò)的,現(xiàn)在分享給大家,幫大家做個(gè)參考.

對(duì)于 JavaScript 使用的是 UCS-2 還是 UTF-16 這個(gè)問(wèn)題,我找了很久,沒(méi)有發(fā)現(xiàn)一個(gè)權(quán)威的回答,我決定自己研究一下它。這個(gè)回答來(lái)自于你對(duì) JavaScript 引擎或者對(duì) JavaScript 語(yǔ)言的理解。

一、著名的 BMP(Basic Multilingual Plane)

Unicode 標(biāo)識(shí)符通過(guò)一個(gè)明確的名字和一個(gè)整數(shù)來(lái)作為它的碼位(code point).比如,“??” 字符的碼位可以用“版權(quán)標(biāo)志”和U+00A9(0xA9,也可以寫(xiě)作十進(jìn)制 169)來(lái)表示。

Unicode 字符分為 17 組平面,每個(gè)平面擁有 2^16 (65,536)個(gè)碼位.有一些碼位沒(méi)有分配字符,也有一些碼位被保留,成為私有的,也有一些碼位是永遠(yuǎn)被保留的,作為無(wú)字符的標(biāo)志。每一個(gè)碼位都可以用 16 進(jìn)制 xy0000 到 xyFFFF 來(lái)表示,這里的 xy 是表示一個(gè) 16 進(jìn)制的值,從 00 到 10。

這第一個(gè)位置(當(dāng) xy 是 00 的時(shí)候)被稱(chēng)為 BMP (基本多文種平面, Basic Multilingual Plane)。它包含了最常用的碼位從 U+0000 到 U+FFFF。

這里需要補(bǔ)充一點(diǎn)額外的平面知識(shí),以及術(shù)語(yǔ)的表格。

平面始末字符值中文名稱(chēng)英文名稱(chēng)
0號(hào)平面U+0000 - U+FFFF基本多文種平面BMP
1號(hào)平面U+10000 - U+1FFFF多文種補(bǔ)充平面SMP
2號(hào)平面U+20000 - U+2FFFF表意文字補(bǔ)充平面SIP
3號(hào)平面U+30000 - U+3FFFF表意文字第三平面TIP
4~13號(hào)平面U+40000 - U+DFFFF(尚未使用)
14號(hào)平面U+E0000 - U+EFFFF特別用途補(bǔ)充平面SSP
15號(hào)平面U+F0000 - U+FFFFF保留作為私人使用區(qū)(A區(qū))PUA-A
16號(hào)平面U+100000 - U+10FFFF保留作為私人使用區(qū)(B區(qū))PUA-B

引用自:wikipedia

其余 16號(hào)平面(U+100000 到 U+10FFFF)稱(chēng)為補(bǔ)充的平面。這里我將不討論它;只需要記住兩個(gè)概念:BMP 字符和非 BMP 字符,后者也被稱(chēng)為補(bǔ)充字符。

二、UCS-2 和 UTF-16 之間的不同

UCS-2 和 UTF-16 都是 Unicode 的字符編碼方式。

UCS-2(2個(gè)字節(jié)的通用字符集)是一種固定長(zhǎng)度的編碼格式,只需要使用編碼為 16 字節(jié)編碼單元來(lái)表示碼位。這樣的表示結(jié)果將和 UTF-16 在 0 到 0xFFFF (BMP)范圍內(nèi)大多數(shù)的結(jié)果一樣。

UTF-16(16 位 Unicode 轉(zhuǎn)換格式)是對(duì) UCS-2 的一個(gè)擴(kuò)展,它允許表示比 BMP 范圍內(nèi)更多的字符。它是一種可變長(zhǎng)度格式,它的每個(gè)碼位能夠使用 1 位或者 2 位 16字節(jié)編碼單元來(lái)表示。這種方式能夠編碼的碼位在 0 到 0x10FFFF 之間。

比如,在 UCS-2 和 UTF-16 中,對(duì)于 BMP 字符 U+00A9 版權(quán)標(biāo)志(??)都能被編碼為:0x00A9。

這里補(bǔ)充一下 UCS-2、UCS-4、BMP

CPU 處理多字節(jié)數(shù)的方式分為:“大尾”(big endian)和“小尾”(little endian),簡(jiǎn)單的理解就是一個(gè) Unicode 編碼,比如 6C49,寫(xiě)到文件里面 6C 49 或者 49 6C,兩種方式,前者就叫“大尾”,后者就叫“小尾”。
UCS 可以分為兩種格式:UCS-2 和 UCS-4。UCS-2 使用兩個(gè)字節(jié)編碼,UCS-4 使用4個(gè)字節(jié)(實(shí)際只有 31 位,最高位必須是 0)編碼。
轉(zhuǎn)換關(guān)系:UCS-4 中高兩個(gè)字節(jié)為 0 的碼位稱(chēng)為 BMP;UCS-4 的 BMP 去掉前面兩個(gè)零字節(jié)就得到 UCS-2;UCS-2 加上兩個(gè)零字節(jié)就得到 UCS-4 中的 BMP。

三、代理對(duì)(Surrogate pairs)

對(duì)于 BMP 之外的字符,比如 U+1D306 四條線(xiàn)居中(其實(shí)不好翻譯:tetragram for centre,?),只能使用 UTF-16 中兩個(gè) 16 字節(jié)來(lái)編碼:0xD834 0XDF06。這種就被稱(chēng)為代理對(duì)。值得注意的是一個(gè)代理對(duì)只代表一個(gè)單字符。

補(bǔ)充一下代理對(duì)的概念

實(shí)際上就是指上面的一個(gè) UTF-16 編碼,使用 2 個(gè) 16 字節(jié)來(lái)編碼。
那是因?yàn)橐粋€(gè) UTF-16 編碼不夠,然后就應(yīng)該使用 2 個(gè) UTF-16 編碼來(lái)表示更多的字符。然后這樣就會(huì)出現(xiàn):之前 2 個(gè)字節(jié)的空間表示一個(gè)字符,就會(huì)變成 4 個(gè)字節(jié)的空間。所以就規(guī)定只有一定范圍內(nèi)使用 2 個(gè) UTF-16 編碼來(lái)表示一個(gè)字符,這樣的方式就叫代理對(duì),其余的依然使用 2 個(gè)字節(jié)來(lái)表示。

代理對(duì)中的第一個(gè)字符單元總是在 0xD800 到 0xDBFF 之間,稱(chēng)為高位代理或者頂部代理(high surrogate or lead surrogate,暫時(shí)這樣,查到專(zhuān)業(yè)術(shù)語(yǔ)再翻譯)。第二個(gè)字符單元總是處于 0xDC00 到 0xDFFF 之間,稱(chēng)為低位代理或者尾部代理(low surrogate or trail surrogate)。

UCS-2 是缺乏對(duì)代理對(duì)的支持的,所以要表示之前的字符需要使用 2 個(gè)分隔的字符。

四、碼位(code points)和代理對(duì)(surrogate pairs)之間的轉(zhuǎn)換

Section 3.7 of The Unicode Standard 3.0(pdf) 中定義了一個(gè)轉(zhuǎn)換算法。

假設(shè):一個(gè)碼位 C 大于 0xFFFF 的編碼使用代理對(duì) <H, L> 來(lái)表示的公式為:

H = Math.floor((C - 0x10000) / 0x400) + 0xD800 L = (C - 0x10000) % 0x400 + 0xDC00

轉(zhuǎn)換公式變換后,比如從代理對(duì) <H, L> 轉(zhuǎn)換成一個(gè) Unicode 碼位 C,可以使用公式:

C = (H - 0xD800) * 0x400 + L - 0xDC00 + 0x10000

五、Ok,那么關(guān)于 JavaScript 的編碼問(wèn)題呢?

在 ECMAScript 中定義來(lái)怎樣解釋字符的問(wèn)題.

在 level 3 或者更高等級(jí)的實(shí)現(xiàn)中,遵循國(guó)際標(biāo)準(zhǔn),與 Unicode 3.0 標(biāo)準(zhǔn)或者更新的標(biāo)準(zhǔn),以及 ISO/IEC 10646-1,和 UCS-2 或者 UTF-16 作為編碼格式。如果采用的 ISO/IEC 10646-1 自己未被指定,它被認(rèn)定為 BMP 的自己,集合 300(這里沒(méi)懂)。如果沒(méi)有采用其它的編碼格式,那么將按照 UTF-16 進(jìn)行編碼。

換句話(huà)說(shuō),JavaScript 引擎是允許使用 UCS-2 或者 UTF-16 進(jìn)行編碼的。

然后按照 specific parts 規(guī)定,認(rèn)為引擎里面的編碼需要一些 UTF-16 的知識(shí)。

當(dāng)然,內(nèi)部引擎對(duì)于大多數(shù) JavaScript 開(kāi)發(fā)者來(lái)說(shuō)沒(méi)有實(shí)際影響。對(duì)于更多有趣的發(fā)現(xiàn)JavaScript 是如何考慮字符的 中,有一段:

盡管在本文檔的其它部分中,表示字符單元和文字字符將使用 16 位的無(wú)符號(hào)值,用來(lái)表示單個(gè) 16 位文本單元。Unicode 字符將使用抽象的語(yǔ)言或印刷單元(可超過(guò)16位,因此可以由多個(gè)代碼單元)來(lái)表示。碼位可以用 Unicode 標(biāo)準(zhǔn)值來(lái)表示。一個(gè)組合字符序列的成分可以有個(gè)別“Unicode 字符”,即使一個(gè)用戶(hù)可能會(huì)認(rèn)為整個(gè)序列是單個(gè)字符。

可能需要重新翻譯,原文

Throughout the rest of this document, the phrase code unit and the word character will be used to refer to a 16-bit unsigned value used to represent a single 16-bit unit of text.

The phrase Unicode character will be used to refer to the abstract linguistic or typographical unit represented by a single Unicode scalar value (which may be longer than 16 bits and thus may be represented by more than one code unit).
The phrase code point refers to such a Unicode scalar value.
Unicode character only refers to entities represented by single Unicode scalar values: the components of a combining character sequence are still individual “Unicode characters”, even though a user might think of the whole sequence as a single character.

JavaScript 使用單獨(dú)字符來(lái)處理字符單元,然后人們通常認(rèn)為是一組 Unicode 字符。當(dāng)使用 BMP 范圍外 Unicode 字符的時(shí)候,這樣會(huì)有一些不好的結(jié)果。比如代理對(duì)使用 2 個(gè)字符單元組成:'?'.length == 2,即使這里是只有一個(gè) Unicode 字符。如果是字符,代理對(duì)將暴露一部分:'?' == '\uD834\uDF06'。

在這里你想到了什么呢?對(duì)于這種方式,至少是 UCS-2 的替代方式(不同的地方是,UCS-2 不允許有代理字符,然后 JavaScript 字符串是這樣做的)。

你可以認(rèn)為它像 UTF-16 一樣在工作,特別是分成兩部分的方式是被允許的,代理的這種錯(cuò)誤排序是被允許的,代理被暴露成了分離的字符。我認(rèn)為你將更容易的理解成這種行為叫“UCS-2 的代理方式”(UCS-2 with surrogates,不好翻譯,也可以理解成伴隨著代理的 UCS-2)。

類(lèi)似 UCS-2 的行為對(duì)整個(gè)語(yǔ)言更有影響,比如 補(bǔ)充字符范圍的正則表達(dá)式 比那些支持 UTF-16 的語(yǔ)言要更難寫(xiě)。

代理對(duì)只是為了顯示在瀏覽器中(layout 的時(shí)候),對(duì)單個(gè) Unicode 字符的重新組合。這發(fā)生在 JavaScript 引擎的影響范圍之外。為了證明這個(gè),你能在 document.write() 的時(shí)候分開(kāi)寫(xiě)一個(gè)高位代理和地位代理字符.

document.write('\uD834'); document.write('\uDF06');

在結(jié)束后也將被渲染成一個(gè)圖案:?。

六、結(jié)論

JavaScript 引擎內(nèi)部是自由的使用 UCS-2 或者 UTF-16。我所知道的大多數(shù)引擎使用的是 UTF-16,無(wú)論它們使用什么方式實(shí)現(xiàn),它只是一個(gè)具體的實(shí)現(xiàn),這不將影響到語(yǔ)言的特性。

然后對(duì)于 ECMAScript/JavaScript 語(yǔ)言本身,實(shí)現(xiàn)的效果是通過(guò) UCS-2,而非 UTF-16。

如果你在任何時(shí)候需要 編碼一個(gè) Unicode 字符, 在必要的時(shí)候能夠替換成分離的代理,也可以免費(fèi)試用我的 JavaScript escaper 工具。

如果你想在一個(gè) JavaScript 字符串中獲取 Unicode 字符的長(zhǎng)度,或者創(chuàng)建一個(gè)基于 non-BMP Unicode 碼位的字符串,你能使用 Punycode.js 的工具方法,將 UCS-2 字符串轉(zhuǎn)換成 UTF-16 碼位。

// `String.length` 只是統(tǒng)計(jì)所以 Unicode 字符 punycode.ucs2.decode('?').length; // 1 // `String.fromCharCode` 能夠讓你直接使用非分離的代理 punycode.ucs2.encode([0x1D306]); // '?' punycode.ucs2.encode([119558]); // '?'

ECMAScript 6 在字符串中將支持一些新的編碼序列(現(xiàn)在看來(lái)已經(jīng) ok 了,可以查看一下資料簡(jiǎn)單了解下),名為 Unicode code point escapes 比如:\u{1D306}。另外,它將定義 String.fromCodePoint 和 String#codePointAt,這兩個(gè)方法都接受碼位(code points) 而不是字符單元(code units)

感謝:Jonas ‘nlogax’ Westerlund, Andrew ‘bobince’ Clover 以及 Tab Atkins Jr.。他們給了我調(diào)查的靈感和幫助我。

提示:如果你喜歡閱讀關(guān)于 JavaScript 的內(nèi)部字符編碼,可以 check out JavaScript has a Unicode problem,這里更詳細(xì)解釋了實(shí)際的問(wèn)題,以及提供了解決方法。


翻譯原文:https://mathiasbynens.be/notes/javascript-encoding
個(gè)人博客:http://www.60sky.com

總結(jié)

以上是生活随笔為你收集整理的JavaScript 的内部字符编码是 UCS-2 还是 UTF-16的全部?jī)?nèi)容,希望文章能夠幫你解決所遇到的問(wèn)題。

如果覺(jué)得生活随笔網(wǎng)站內(nèi)容還不錯(cuò),歡迎將生活随笔推薦給好友。

主站蜘蛛池模板: 麻豆视频精品 | 韩国三级在线视频 | 欧美交换 | 国产欧美大片 | 欧美自拍偷拍一区二区 | 污视频免费在线观看 | 婷婷色婷婷开心五月四房播播 | 最新av观看| 国产精品久久久久久久一区二区 | 狠狠干伊人| 久久精品亚洲一区二区 | 成人影视免费观看 | 一个人看的www日本高清视频 | 99在线视频精品 | 亚洲成人激情小说 | 亚洲av成人无码久久精品 | 男女国产精品 | 成人免费大全 | 无码av免费毛片一区二区 | 一起草国产| 五月婷婷七月丁香 | 夜夜成人| 色射视频| 天天躁日日躁aaaaxxxx | 日韩av影片在线观看 | 中文字幕久久av | 久久精品国产av一区二区三区 | 日韩欧美高清在线观看 | 日韩欧美精品在线视频 | 日本一级淫片免费放 | 天堂…中文在线最新版在线 | 成人做受视频试看60秒 | 国产三级日本三级在线播放 | 操日本女人 | 宅男午夜影院 | 禁漫天堂免费网站 | 日韩视频免费看 | 狠狠躁夜夜躁av无码中文幕 | 亚洲国产在 | 波多野结衣免费视频观看 | 欧美天天干 | 色在线免费| 色综合图片 | 欧美少妇一区二区三区 | 狠狠躁夜夜躁xxxxaaaa | 精品国产a线一区二区三区东京热 | 日本中文字幕在线观看视频 | 免费网站www在线观看 | 精品人妻伦一二三区久 | 天天舔夜夜操 | 黄色av小说在线观看 | 久久久久国产一区 | 99爱国产 | 中文字幕免费一区二区 | 91在线亚洲 | 色七七桃花综合影院 | 亚洲小视频在线观看 | 久久久久亚洲精品中文字幕 | 狠狠爱夜夜爱 | 国产成人精品一区二三区 | 91久精品| 国产成人精品无码片区在线 | 久久国产精品二区 | 日韩精品1区2区3区 欧美一本 | 顶级黄色片 | 日本高清xxxx | 午夜专区 | 欧美888| 男女扒开双腿猛进入爽爽免费 | 亚洲图片在线观看 | 精品九九九九九 | 国产中文在线观看 | 欧美熟妇另类久久久久久不卡 | 亚洲天堂三区 | 国产精品波多野结衣 | 99国产免费| 今天高清视频在线观看视频 | а√天堂8资源在线官网 | 无码人妻一区二区三区一 | 中文字幕无码精品亚洲资源网久久 | 在线视频观看你懂得 | 91色视频在线观看 | 伊人亚洲精品 | 亚洲三级图片 | 国产视频1区 | 欧美激情在线一区二区 | 成人毛片在线观看 | 久草视频在线免费 | 国产高清无密码一区二区三区 | 96福利视频 | 免费在线中文字幕 | 国产啪视频 | 免费黄色网址在线观看 | 欧美黄色一区二区三区 | 日本成人黄色片 | 二区三区 | 免费啊v在线观看 | 一级特黄aa大片欧美 | 亲嘴扒胸摸屁股免费视频日本网站 |