「計算機原理」為什麼編碼有ASCII、Unicode、UTF-8之分？

2020-02-14 15:28:36 編碼之道

計算機只能處理數字，如果要處理文本，就必須先把文本轉換為數字才能處理。最早的計算機在設計時採用8個比特（bit）作為一個字節（byte），所以一個字節能表示的最大的整數就是255，如果要表示更大的整數，就必須用更多的字節。比如，兩個字節可以表示的最大整數是65535，4個字節可以表示的最大整數是4294967295等。

ASCII編碼

計算機是美國人發明的，最早只有大小寫英文字母、數字和一些符號等127個字符被編碼到計算機裡，這也即是我們知道的ASCII編碼（如下圖）。在ASCll編碼下，大寫字母A的編碼是65，小寫字母z的編碼是122，如下圖。

Unicode

從上文中我們知道，一個字節能表示的最大整數是255，但是《現代漢語常用字表》中有3500個漢字，因此，要處理中文顯然一個字節是不夠的，至少需要兩個字節。所以，中國就制定了GB2312編碼，用來把中文編進去。

你可以想得到的是，全世界有上百種語言，日本把日文編到Shift_JIS裡，韓國把韓文編到Euc-kr裡，各國有各國的標準，就會不可避免地出現衝突，結果就是在多語言混合的文本中，顯示出來會有亂碼。

鑑於此，Unicode編碼應運而生。Unicode的出現就是要把所有語言都統一到一套編碼裡，以確保在多語言混合的文本中不會再有亂碼問題。

UTF-8

Unicode的出現解決了亂碼問題，但是也帶來了新問題。編碼長度是不可變的，說使用2個字節它一定會使用2個字節。這樣如果你寫的文本基本上都是英文的話，用Unicode編碼比ASCII編碼可能需要多一倍的存儲空間，這在存儲和傳輸上就十分不划算。

所以本著節約的精神，科學家們有創造出了“可變長編碼”的UTF-8編碼。UTF-8編碼根據不同的數字大小把一個Unicode字符編碼成1-6個字節，比如，常用的英文字母被編碼成1個字節，漢字通常是3個字節，只有很生僻的字符才會被編碼成4-6個字節。如果你要傳輸的文本包含大量英文字符，用UTF-8編碼就能節省空間。

字符編碼的工作方式

1、在計算機內存中，統一使用Unicode編碼，當需要保存到硬盤或者需要傳輸的時候，就轉換為UTF-8編碼。

2、用記事本編輯的時候，從文件讀取的UTF-8字符將被轉換為Unicode字符到內存裡，編輯完成後，保存的時候再把Unicode轉換為UTF-8保存到文件：

3、瀏覽網頁的時候，服務器會先把動態生成的Unicode內容轉換為UTF-8，然後再傳輸到瀏覽器

所以，你看到很多網頁的源碼上會有類似的信息，這就表示該網頁正是用的UTF-8編碼。

分享到:

閱讀更多 編碼之道 的文章

關鍵字: 編到設計韓國

在字符串中統計中文字符個數的兩種實現方式的性能比較

ASCII；UTF-8；一篇文章說清文本編碼那些事

曝光 MySQL 的一個坑，不要再使用 UTF-8 了

03.03 曝光 MySQL 的一個坑，不要再使用 UTF-8 了

「計算機原理」為什麼編碼有ASCII、Unicode、UTF-8之分？

字符編碼與存儲實現：ASCII、GB2312、Unicode、UTF

12.16 字符編碼與存儲實現：ASCII、GB2312、Unicode、UTF

了不起的 Unicode

12.07 Unicode，UTF-8和UTF-16的區別與聯繫

Python報錯 Non-UTF-8 code starting with '\xef' in file xxx

「手把手教python3接口自動化」「第五章」：文件操作

RFC#2457——Rust 語言支持非 ASCII 碼標識符引起的激辯（一）

永遠不要在 MySQL 中使用 UTF-8

C語言編程預備知識--字節、ASCII

記住：永遠不要在 MySQL 中使用 UTF-8

ASCII：這裡誕生了互聯網上第一張表情包和黃圖

你知道“UTF-8”是什麼嗎？

你真的瞭解 Unicode 和 UTF-8 嗎？

三種常見字符編碼：ASCII、Unicode和UTF-8

Python 模塊 base64-使用 ASCII 編碼二進位數據

03.28 Modbus 通訊協議——每個工控人都應該瞭解的事

第二章 IoC容器和Bean配置

bean是一個對象，它是由Spring

運算裡不得不說的python模塊—math

Help

Devops度量--DevOps 現狀快速檢查表

今天主要分享一個DevOps

SOP是什麼（解讀）

SOP不是單個的，是一個體系，雖然我們可以單獨地定義每一個SOP，但真正從企業管理來看，SOP不可能只是單個的，必然是一個整體和體系，也是企業不可或缺的。

還不知道交換機上如何配置DHCP，趕緊過來圍觀吧，一分鐘包你學會

隨著終端設備的越來越多，人工干預配置IP地址，不僅工作效率低，而且，還很容易導致IP衝突，影響正常的網絡訪問。到此已經完成了，DHCP服務的配置了，我們可以在終端驗證。

還在手動配置IP地址嗎？太Low了，一分鐘教會您如何配置DHCP

Python爬蟲自學筆記：分析頭條文章網頁源文件

這兩天分析了一下頭條文章網頁的源文件，現在將分析的結果分享給大家。首先以一篇文章為例，其網址如下：https://www.toutiao.com/i6822245428176617998/如上圖網頁所示，文章中包含文字和圖片。

DNS偵查工具

我們只需要打開瀏覽器輸入例如:www.baidu.com就可以解析到該網站.為了便於記住不需要輸入長長的IP地址去訪問這就是DNS域名解析.關於域名域名的層次劃分用點來分割這時DNS把相對應的域名解析成IP地址高的在右邊.例如:www. NS簡介訪問某網站的時候最低在左邊

國人開源的異步 Python ORM：GINO

程序測評：Create React App 3.3中有哪些酷炫新功能？

Create

“明學”的魅力？我只要我覺得：駕馭終端，提高生產力

最後一個要介紹的命令是

（必收藏系列）Linux面試題——命令集

關注，後臺私信【Linux】分享Linux入門到進階電子書、Linux入門到精通視頻教程（免費）。文件管理命令cat

五分鐘學會如何在 IPFS 上部署網站

原文標題:五分鐘學會如何在

「正點原子NANO STM32F103開發板資料連載」第29章內存管理實驗

1）實驗平臺：【正點原子】

小白怎麼學Web前端開發如何成為技術達人

Web前端開發工程師已經成為了很多年輕人心中的理想工作，不僅入行門檻低、而且薪資待遇和發展前景都不錯，自然吸引了大批人加入行業。

如何開發一個web靜態服務器

我們都知道如今的web服務器有很多，比如著名的有apache，有nginx，有tomcat，有resin服務器，有sphere，有iis服務器等等，這些服務器都能提供web服務，並且幾乎都能和多種語言進行搭配使用，那麼一個web服務器都需要那些功能，開發一個web服務器都需要那些

學Java編程還有前景嗎如何才能拿到高薪

需求大、薪資高似乎是Java開發人員的標籤，不過學Java編程還有前景嗎？它架構在操作系統之上，屏蔽了底層的差異，真正實現了“Writeonce run

Python網絡爬蟲之配置篇（一）

pip

SpringBoot 整合SpringSecurity示例實現前後分離權限註解+JWT登錄認證

serverTimezone=UTC&useUnicode=true&characterEncoding=utf-8&zeroDateTimeBehavior=convertTo&useSSL=falseusername:rootpassword:

Python的運行效率太低？幾行代碼快速提升！

return的就是是你所需要的結果2.3、運行這一步就是最後一步了，只要像下面一樣輸入上述函數名，賦予參數值，點擊運行Run，就能得到你想要的結果arg1=5

python的優點是什麼？最新Python400集視頻（附教程）

2020，最新Python零基礎到精通資料教材，乾貨分享，新基礎Python教材，穩穩找到過萬工作，看這裡，這裡有你想要的所有資源哦，最強筆記，教你怎麼入門提升！獲取方式：私信小編“

MySQL中OOM故障應如何下手-愛可生

作者：孫祚龍愛可生南區分公司交付服務部成員，實習工程師。負責公司產品問題排查及日常運維工作。本文來源：原創投稿*愛可生開源社區出品，原創內容未經授權不得隨意使用，轉載請聯繫小編並註明來源。

像專家一樣使用 panic

|go

30種不同的編程語言怎麼寫“Hello, World”

printfn

percona QAN 介紹

一、背景QAN慢查詢日誌分析工具是PMM

面試官：你可以用純CSS判斷鼠標進入的方向嗎？

雖然沒什麼軟用，但是對付面試官應該是夠用了。感謝面試官提出的問題，讓我實現了這個功能，對CSS

網絡工程師職業生涯中，哪兩點是最重要的？

網絡工程師最重要的技能是紮實的基礎和非常開放的思維，微觀知識紮實、宏觀能力突出。項目經驗也會讓網絡工程師基礎更牢靠，網絡工程師是要實戰的，要避免紙上談兵，我認為對基礎理論的理解，比你清楚配置更重要。

交換機中相關術語代表什麼意思，有必要弄清楚

由淺入深瞭解以太坊 2.0：最常見問題和最全學習清單

有關以太坊2.0

【Linux簡單實用小命令001】CentOS 7、8的防火牆端口開放

yuminstall

吃透這些IPFS硬核知識點，日後搶頭礦隨時“彎道超車”

今天的你捉住IPFS機遇了嗎？我們都知道在Filecoin網絡中作為一名存儲礦工，信譽對於我們是非常重要的——信譽越高，爆塊幾率越大。那麼信譽系統現在怎麼樣了呢？

Hive分桶表

fieldsterminated

Spring中資源的加載原來是這麼一回事啊！

自己動手搭建郵件系統：怎樣讓Exchange Server 發出第一封郵件？

編輯Exchange

$【MySQL】RDS物理備份文件(.idb\.frm)恢復到MySQL自建數據庫$

【MySQL】RDS物理備份文件(.idb\.frm)恢復到MySQL自建數據庫

在阿里雲控制檯，我們能下載的文件是一個壓縮包，解壓之後，是.idb和.frm文件，你可能要問了，我可以直接把解壓好的問題件覆蓋到MySQL的data目錄下嗎？

NLP算法入門系列：隱含馬爾可夫鏈(HMM)模型的簡單介紹

即，最大化

第一章 Spring Framework概述

您可以在任何web

opencv人工智能深度學習這樣實現人臉的年齡檢測

前期的文章我們分享了人臉的識別以及如何進行人臉數據的訓練，本期文章我們結合人臉識別的模型進行人臉年齡的檢測人臉年齡的檢測步驟1、首先需要進行人臉的檢測2、把檢測到的人臉數據給年齡檢測模型去檢測3、把檢測結果呈現到圖片上人臉年齡檢測import

嵌入式linux網絡編程之——5年程序員給你深度講解socket套接字

圖8-1

深入瞭解ProcessFunction的狀態操作(Flink-1.10)

先反思為何會有上述疑惑上述疑惑產生的原因，應該是受到平時使用HashMap的影響，HashMap獲取值就是在調用get方法時指定key，設置值也是在put時指定key，所以看到state.value，看懂了這些，其實也是在瞭解DataStream/DataSetAPI的設計思路：

Redis內存分析工具--rdr安裝與使用

分析Redis

資深架構師教你源碼講解zookeeper實現分佈式鎖以及集群搭建步驟

//getData發現前一個子節點被刪除，拋出異常

一行代碼提升遷移性能

論文原址：https://arxiv.org/pdf/2003.12237.pdf開源地址：https://github.com/cuishuhao/BNM在發表在CVPR2020

利用相似幾何信息，做可泛化3D形狀分割模型

更具體的有以下三種典型的分割方案：FullyConvolutional-Like

這麼好用的開源計算器SpeedCrunch，沒有不嘗試一下的道理

介紹SpeedCrunch是一款高精度科學計算器，具有快速，鍵盤驅動的用戶界面。獲取方式在GitHub上搜索SpeedCrunch，就可以去到

分佈式緩存，真香

他是前易寶支付架構師、阿里雲MVP、騰訊雲

特徵工程的力量

在本文中，我希望教給您一些有關特徵工程的知識，以及如何使用它來對非線性決策邊界進行建模。為了說明這一點，假設恢復時間與身高和體重具有以下關係：Y=β₀+β₁+β2+β₃+noise從第三項來看，我們可以看到Y與身高和體重沒有線性關係。

java架構：天天寫面向接口編程，你考慮過性能嗎？大神都是這麼寫

public

SpringBoot如何優雅的使用RocketMQ

源碼編譯需要Maven3.2x，JDK8在根目錄進行打包:Copymvn-Prelease-all

css代碼規範工具stylelint

"mixin"

「計算機原理」為什麼編碼有ASCII、Unicode、UTF-8之分？

ASCII編碼

Unicode

UTF-8

字符編碼的工作方式

相關文章:

在字符串中統計中文字符個數的兩種實現方式的性能比較

ASCII；UTF-8；一篇文章說清文本編碼那些事

曝光 MySQL 的 一個坑，不要再使用 UTF-8 了

03.03 曝光 MySQL 的 一個坑，不要再使用 UTF-8 了

「計算機原理」為什麼編碼有ASCII、Unicode、UTF-8之分？

字符編碼與存儲實現：ASCII、GB2312、Unicode、UTF

12.16 字符編碼與存儲實現：ASCII、GB2312、Unicode、UTF

了不起的 Unicode

12.07 Unicode，UTF-8和UTF-16的區別與聯繫

Python報錯 Non-UTF-8 code starting with '\xef' in file xxx

「手把手教python3接口自動化」「第五章」：文件操作

RFC#2457——Rust 語言支持非 ASCII 碼標識符引起的激辯（一）

永遠不要在 MySQL 中使用 UTF-8

C語言編程預備知識--字節、ASCII

記住：永遠不要在 MySQL 中使用 UTF-8

ASCII：這裡誕生了互聯網上第一張表情包和黃圖

你知道“UTF-8”是什麼嗎？

你真的瞭解 Unicode 和 UTF-8 嗎？

三種常見字符編碼：ASCII、Unicode和UTF-8

Python 模塊 base64-使用 ASCII 編碼二進位數據

03.28 Modbus 通訊協議——每個工控人都應該瞭解的事

第二章 IoC容器和Bean配置

運算裡不得不說的python模塊—math

Devops度量--DevOps 現狀快速檢查表

SOP是什麼（解讀）

還不知道交換機上如何配置DHCP，趕緊過來圍觀吧，一分鐘包你學會

還在手動配置IP地址嗎？太Low了，一分鐘教會您如何配置DHCP

Python爬蟲自學筆記：分析頭條文章網頁源文件

DNS偵查工具

國人開源的異步 Python ORM：GINO

程序測評：Create React App 3.3中有哪些酷炫新功能？

“明學”的魅力？我只要我覺得：駕馭終端，提高生產力

（必收藏系列）Linux面試題——命令集

五分鐘學會如何在 IPFS 上部署網站

「正點原子NANO STM32F103開發板資料連載」第29章 內存管理實驗

小白怎麼學Web前端開發 如何成為技術達人

如何開發一個web靜態服務器

學Java編程還有前景嗎 如何才能拿到高薪

Python網絡爬蟲之配置篇（一）

SpringBoot 整合SpringSecurity示例實現前後分離權限註解+JWT登錄認證

Python的運行效率太低？幾行代碼快速提升！

python的優點是什麼？最新Python400集視頻（附教程）

MySQL中OOM故障應如何下手-愛可生

像專家一樣使用 panic

30種不同的編程語言怎麼寫“Hello, World”

percona QAN 介紹

面試官：你可以用純CSS判斷鼠標進入的方向嗎？

網絡工程師職業生涯中，哪兩點是最重要的？

交換機中相關術語代表什麼意思，有必要弄清楚

由淺入深瞭解以太坊 2.0：最常見問題和最全學習清單

【Linux簡單實用小命令001】CentOS 7、8的防火牆端口開放

吃透這些IPFS硬核知識點，日後搶頭礦隨時“彎道超車”

Hive分桶表

Spring中資源的加載原來是這麼一回事啊！

自己動手搭建郵件系統：怎樣讓Exchange Server 發出第一封郵件？

【MySQL】RDS物理備份文件(.idb\.frm)恢復到MySQL自建數據庫

NLP算法入門系列：隱含馬爾可夫鏈(HMM)模型的簡單介紹

第一章 Spring Framework概述

opencv人工智能深度學習這樣實現人臉的年齡檢測

嵌入式linux網絡編程之——5年程序員給你深度講解socket套接字

深入瞭解ProcessFunction的狀態操作(Flink-1.10)

Redis內存分析工具--rdr安裝與使用

資深架構師教你源碼講解zookeeper實現分佈式鎖以及集群搭建步驟

一行代碼提升遷移性能

利用相似幾何信息，做可泛化3D形狀分割模型

這麼好用的開源計算器SpeedCrunch，沒有不嘗試一下的道理

分佈式緩存，真香

特徵工程的力量

java架構：天天寫面向接口編程，你考慮過性能嗎？大神都是這麼寫

SpringBoot如何優雅的使用RocketMQ

css代碼規範工具stylelint

什麼時候口罩才能容易買到？你們是咋樣買到口罩的？

信用卡欠款2萬多現在沒有償還能力會坐牢嗎？

如何面對農村父母的「你不要比吃，不要比穿，就比學習」的想法？

曝光 MySQL 的一個坑，不要再使用 UTF-8 了

03.03 曝光 MySQL 的一個坑，不要再使用 UTF-8 了

「正點原子NANO STM32F103開發板資料連載」第29章內存管理實驗

小白怎麼學Web前端開發如何成為技術達人

學Java編程還有前景嗎如何才能拿到高薪