UTF8、UTF16 之间的转换
来源:互联网 发布:微信回调域名 编辑:程序博客网 时间:2024/05/17 01:44
原文:http://www.oschina.net/code/snippet_179574_15065
按照如下的编码方式,对UTF8和UTF16之间进行转换
从UCS-2到UTF-8的编码方式如下:
UCS-2编码(16进制)UTF-8 字节流(二进制)0000 - 007F0xxxxxxx0080 - 07FF110xxxxx 10xxxxxx0800 - FFFF1110xxxx 10xxxxxx 10xxxxxx1. [代码][C/C++]代码 跳至[1] [全屏预览]
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
typedef
unsigned
long
UTF32;
/* at least 32 bits */
typedef
unsigned
short
UTF16;
/* at least 16 bits */
typedef
unsigned
char
UTF8;
/* typically 8 bits */
typedef
unsigned
int
INT
;
/*
UCS-2编码 UTF-8 字节流(二进制)
0000 - 007F 0xxxxxxx
0080 - 07FF 110xxxxx 10xxxxxx
0800 - FFFF 1110xxxx 10xxxxxx 10xxxxxx
*/
#define UTF8_ONE_START (0xOOO1)
#define UTF8_ONE_END (0x007F)
#define UTF8_TWO_START (0x0080)
#define UTF8_TWO_END (0x07FF)
#define UTF8_THREE_START (0x0800)
#define UTF8_THREE_END (0xFFFF)
void
UTF16ToUTF8(UTF16* pUTF16Start, UTF16* pUTF16End, UTF8* pUTF8Start, UTF8* pUTF8End)
{
UTF16* pTempUTF16 = pUTF16Start;
UTF8* pTempUTF8 = pUTF8Start;
while
(pTempUTF16 < pUTF16End)
{
if
(*pTempUTF16 <= UTF8_ONE_END
&& pTempUTF8 + 1 < pUTF8End)
{
//0000 - 007F 0xxxxxxx
*pTempUTF8++ = (UTF8)*pTempUTF16;
}
else
if
(*pTempUTF16 >= UTF8_TWO_START && *pTempUTF16 <= UTF8_TWO_END
&& pTempUTF8 + 2 < pUTF8End)
{
//0080 - 07FF 110xxxxx 10xxxxxx
*pTempUTF8++ = (*pTempUTF16 >> 6) | 0xC0;
*pTempUTF8++ = (*pTempUTF16 & 0x3F) | 0x80;
}
else
if
(*pTempUTF16 >= UTF8_THREE_START && *pTempUTF16 <= UTF8_THREE_END
&& pTempUTF8 + 3 < pUTF8End)
{
//0800 - FFFF 1110xxxx 10xxxxxx 10xxxxxx
*pTempUTF8++ = (*pTempUTF16 >> 12) | 0xE0;
*pTempUTF8++ = ((*pTempUTF16 >> 6) & 0x3F) | 0x80;
*pTempUTF8++ = (*pTempUTF16 & 0x3F) | 0x80;
}
else
{
break
;
}
pTempUTF16++;
}
*pTempUTF8 = 0;
}
void
UTF8ToUTF16(UTF8* pUTF8Start, UTF8* pUTF8End, UTF16* pUTF16Start, UTF16* pUTF16End)
{
UTF16* pTempUTF16 = pUTF16Start;
UTF8* pTempUTF8 = pUTF8Start;
while
(pTempUTF8 < pUTF8End && pTempUTF16+1 < pUTF16End)
{
if
(*pTempUTF8 >= 0xE0 && *pTempUTF8 <= 0xEF)
//是3个字节的格式
{
//0800 - FFFF 1110xxxx 10xxxxxx 10xxxxxx
*pTempUTF16 |= ((*pTempUTF8++ & 0xEF) << 12);
*pTempUTF16 |= ((*pTempUTF8++ & 0x3F) << 6);
*pTempUTF16 |= (*pTempUTF8++ & 0x3F);
}
else
if
(*pTempUTF8 >= 0xC0 && *pTempUTF8 <= 0xDF)
//是2个字节的格式
{
//0080 - 07FF 110xxxxx 10xxxxxx
*pTempUTF16 |= ((*pTempUTF8++ & 0x1F) << 6);
*pTempUTF16 |= (*pTempUTF8++ & 0x3F);
}
else
if
(*pTempUTF8 >= 0 && *pTempUTF8 <= 0x7F)
//是1个字节的格式
{
//0000 - 007F 0xxxxxxx
*pTempUTF16 = *pTempUTF8++;
}
else
{
break
;
}
pTempUTF16++;
}
*pTempUTF16 = 0;
}
int
main()
{
UTF16 utf16[256] = {L
"你a好b吗234中国~!"
};
UTF8 utf8[256];
UTF16ToUTF8(utf16, utf16+wcslen(utf16), utf8, utf8+256);
memset
(utf16, 0,
sizeof
(utf16));
UTF8ToUTF16(utf8, utf8 +
strlen
(utf8), utf16, utf16+256);
return
0;
}
0 0
- UTF8、UTF16 之间的转换
- UTF8,UTF16,UTF32,UTF16-LE,UTF16-BE,GBK 之间的转换
- UTF8,UTF16,UTF32,UTF16-LE,UTF16-BE,GBK 之间的转换
- UTF8,UTF16,UTF32,UTF16-LE,UTF16-BE,GBK 之间的转换
- UTF8,UTF16,UTF32,UTF16-LE,UTF16-BE,GBK 之间的转换
- ANSI UTF16 UTF8转换
- UTF8和UTF16和UTF32之间的相互转化
- 文件编码的判定(UTF8,UTF16),及转换
- 文件编码的判定(UTF8,UTF16),及转换
- 【Oracle】 Blob转Clob的字符UTF16转换UTF8问题
- UTF8,UTF16的编码说明
- 完成 UTF8 和 UTF16 转换函数
- ANSI - Unicode UTF16 - Unicode UTF8 转换
- UTF8--UTF16
- GBK-UTF8之间的转换
- 中文乱码的解决之道,理清UTF8,UTF16,GB2312,Big5,Unicode之间的关系
- 中文乱码的解决之道,理清UTF8,UTF16,GB2312,Big5,Unicode之间的关系
- UNICODE与UTF8,UTF16的含义
- 从照片库选择多张图片到collectionView
- canvas基础练习
- hdu 1058 Humble Numbers(优先队列+set)
- 详解Ajax技术
- LaTeX 矩阵
- UTF8、UTF16 之间的转换
- PHP开发工具及配置过程
- final
- IOS中类和对象还有,nil/Nil/NULL的区别
- MySql root 用户密码忘记后重置root密码
- 两条线段是否相交
- docker环境下的python服务器端开发
- 手把手教你把Vim改装成一个IDE编程环境(图文)
- nyoj 笨蛋难题四 739 (简单数学题)