【Java】如何检测、替换4个字节的utf-8编码(此范围编码包含emoji表情)

来源:互联网 发布:polycom网络设置 编辑:程序博客网 时间:2024/06/01 09:05

项目有个需求,是保存从手机端H5页面提交的信息。

大家知道,手机端输入法中经常有自带的表情,其中emoji表情非常流行,如果用户输入emoji表情,由于有部分emoji表情是4个字节的utf-8编码,我们的MySQL数据库在现有版本和编码设置下只能保存3个字节的utf-8编码(如要保存4个字节的utf-8编码则需升级版本和设置另一种编码)。相关信息可见文章《十分钟搞清字符集和字符编码》。

我们的需求不需要支持emoji表情,如果遇到emoji弹出提示或过滤即可。

msg.replaceAll(“[\ud800\udc00-\udbff\udfff\ud800-\udfff]”, “”);

0 0
原创粉丝点击