使用Node.js處理前端代碼文件的編碼問題
使用 NodeJS 編寫前端工具時(shí),操作得最多的是文本文件,因此也就涉及到了文件編碼的處理問題。我們常用的文本編碼有 UTF8 和 GBK 兩種,并且 UTF8 文件還可能帶有 BOM。在讀取不同編碼的文本文件時(shí),需要將文件內(nèi)容轉(zhuǎn)換為 JS 使用的 UTF8 編碼字符串后才能正常處理。
BOM 的移除
BOM 用于標(biāo)記一個(gè)文本文件使用 Unicode 編碼,其本身是一個(gè) Unicode 字符("\uFEFF"),位于文本文件頭部。在不同的 Unicode 編碼下,BOM 字符對(duì)應(yīng)的二進(jìn)制字節(jié)如下:
Bytes Encoding ---------------------------- FE FF UTF16BE FF FE UTF16LE EF BB BF UTF8
因此,我們可以根據(jù)文本文件頭幾個(gè)字節(jié)等于啥來判斷文件是否包含 BOM,以及使用哪種 Unicode 編碼。但是,BOM 字符雖然起到了標(biāo)記文件編碼的作用,其本身卻不屬于文件內(nèi)容的一部分,如果讀取文本文件時(shí)不去掉 BOM,在某些使用場景下就會(huì)有問題。例如我們把幾個(gè) JS 文件合并成一個(gè)文件后,如果文件中間含有 BOM 字符,就會(huì)導(dǎo)致瀏覽器 JS 語法錯(cuò)誤。因此,使用 NodeJS 讀取文本文件時(shí),一般需要去掉 BOM。例如,以下代碼實(shí)現(xiàn)了識(shí)別和去除 UTF8 BOM 的功能。
function readText(pathname) { var bin = fs.readFileSync(pathname); if (bin[0] === 0xEF && bin[1] === 0xBB && bin[2] === 0xBF) { bin = bin.slice(3); } return bin.toString('utf-8'); }
GBK 轉(zhuǎn) UTF8
NodeJS 支持在讀取文本文件時(shí),或者在 Buffer 轉(zhuǎn)換為字符串時(shí)指定文本編碼,但遺憾的是,GBK 編碼不在NodeJS自身支持范圍內(nèi)。因此,一般我們借助 iconv-lite 這個(gè)三方包來轉(zhuǎn)換編碼。使用 NPM 下載該包后,我們可以按下邊方式編寫一個(gè)讀取 GBK 文本文件的函數(shù)。
var iconv = require('iconv-lite'); function readGBKText(pathname) { var bin = fs.readFileSync(pathname); return iconv.decode(bin, 'gbk'); }
單字節(jié)編碼
有時(shí)候,我們無法預(yù)知需要讀取的文件采用哪種編碼,因此也就無法指定正確的編碼。比如我們要處理的某些 CSS 文件中,有的用 GBK 編碼,有的用 UTF8 編碼。雖然可以一定程度可以根據(jù)文件的字節(jié)內(nèi)容猜測出文本編碼,但這里要介紹的是有些局限,但是要簡單得多的一種技術(shù)。
首先我們知道,如果一個(gè)文本文件只包含英文字符,比如 Hello World,那無論用 GBK 編碼或是 UTF8 編碼讀取這個(gè)文件都是沒問題的。這是因?yàn)樵谶@些編碼下,ASCII0~128 范圍內(nèi)字符都使用相同的單字節(jié)編碼。
反過來講,即使一個(gè)文本文件中有中文等字符,如果我們需要處理的字符僅在 ASCII0~128 范圍內(nèi),比如除了注釋和字符串以外的JS代碼,我們就可以統(tǒng)一使用單字節(jié)編碼來讀取文件,不用關(guān)心文件的實(shí)際編碼是 GBK 還是 UTF8。以下示例說明了這種方法。
1. GBK編碼源文件內(nèi)容:
var foo = '中文';
2. 對(duì)應(yīng)字節(jié):
76 61 72 20 66 6F 6F 20 3D 20 27 D6 D0 CE C4 27 3B
3. 使用單字節(jié)編碼讀取后得到的內(nèi)容:
var foo = '{亂碼}{亂碼}{亂碼}{亂碼}';
4. 替換內(nèi)容:
var bar = '{亂碼}{亂碼}{亂碼}{亂碼}';
5. 使用單字節(jié)編碼保存后對(duì)應(yīng)字節(jié):
76 61 72 20 62 61 72 20 3D 20 27 D6 D0 CE C4 27 3B
6. 使用 GBK 編碼讀取后得到內(nèi)容:
var bar = '中文';
這里的訣竅在于,不管大于 0xEF 的單個(gè)字節(jié)在單字節(jié)編碼下被解析成什么亂碼字符,使用同樣的單字節(jié)編碼保存這些亂碼字符時(shí),背后對(duì)應(yīng)的字節(jié)保持不變。
NodeJS 中自帶了一種 binary 編碼可以用來實(shí)現(xiàn)這個(gè)方法,因此在下例中,我們使用這種編碼來演示上例對(duì)應(yīng)的代碼該怎么寫。
function replace(pathname) { var str = fs.readFileSync(pathname, 'binary'); str = str.replace('foo', 'bar'); fs.writeFileSync(pathname, str, 'binary'); }
相關(guān)文章
VsCode與Node.js知識(shí)點(diǎn)詳解
在本篇文章中小編給大家分享了關(guān)于VsCode與Node.js的相關(guān)知識(shí)點(diǎn)以及安裝等內(nèi)容,需要的朋友們可以參考下。2019-09-09Node.js視頻流應(yīng)用創(chuàng)建之后端的全過程
這篇文章主要給大家介紹了關(guān)于創(chuàng)建Node.js視頻流應(yīng)用之后端的相關(guān)資料,文中通過實(shí)例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2022-03-03Node.js+pm2+ssh2模塊實(shí)現(xiàn)簡單的自動(dòng)化部署腳本
本文將介紹如何使用Node.js和ssh2模塊實(shí)現(xiàn)一個(gè)簡單的部署腳本,將本地的項(xiàng)目文件上傳到遠(yuǎn)程服務(wù)器上,我們將使用dotenv模塊來管理環(huán)境變量,以及child_process模塊來執(zhí)行命令行操作2023-10-10Nodejs中讀取中文文件編碼問題、發(fā)送郵件和定時(shí)任務(wù)實(shí)例
這篇文章主要介紹了Nodejs中讀取中文文件編碼問題、發(fā)送郵件和定時(shí)任務(wù)實(shí)例,本文使用了3個(gè)模塊來解決這3個(gè)需求,并給出了代碼操作實(shí)例,需要的朋友可以參考下2015-01-01Nodejs中使用phantom將html轉(zhuǎn)為pdf或圖片格式的方法
這篇文章主要介紹了Nodejs中使用phantom將html轉(zhuǎn)為pdf或圖片格式的方法,需要的朋友可以參考下2017-09-09基于node+websocket+html實(shí)現(xiàn)騰訊課堂聊天室聊天功能
這篇文章主要介紹了基于node+websocket+html實(shí)現(xiàn)騰訊課堂聊天室聊天功能,本文通過截圖實(shí)例代碼給大家介紹的非常詳細(xì),對(duì)大家的工作或?qū)W習(xí)具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2020-03-03詳解electron如何攔截網(wǎng)絡(luò)請(qǐng)求并處理響應(yīng)
這篇文章主要為大家詳細(xì)介紹了electron如何攔截網(wǎng)絡(luò)請(qǐng)求并處理響應(yīng),文中的示例代碼講解詳細(xì),具有一定的借鑒價(jià)值,感興趣的小伙伴可以跟隨小編一起學(xué)習(xí)一下2023-12-12Node.js使用officecrypto-tool實(shí)現(xiàn)讀取加密的Excel和Word文檔
這篇文章主要為大家詳細(xì)介紹了Node.js如何使用officecrypto-tool實(shí)現(xiàn)讀取加密的Excel和Word文檔的功能,感興趣的小伙伴可以跟隨小編一起了解一下2023-09-09