编码的工作原理
UTF-8
可变长度:ASCII用1字节,拉丁/希腊文用2字节,多数CJK用3字节,表情符号和罕见字符用4字节。每个字节的前导位表明它的作用:
0xxxxxxx—— 单字节(ASCII)110xxxxx 10xxxxxx—— 2字节1110xxxx 10xxxxxx 10xxxxxx—— 3字节11110xxx 10xxxxxx 10xxxxxx 10xxxxxx—— 4字节
灰色位是结构位,蓝色位承载码点。
UTF-16
基本多文种平面(U+0000到U+FFFF)内的字符固定占2字节,该平面包含所有常用汉字。U+FFFF以上的字符使用代理对(4字节)。
GB2312
1980年的旧式中文编码。将约7000个简体汉字映射为2字节编码。ASCII字符用1字节。此工具显示一组精选常用汉字的GB2312值。
维基百科对每种编码都有更详细的介绍:UTF-8、UTF-16和GB 2312。要查任意汉字的码位、读音和异体字,可以用Unihan数据库。