0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看技术视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

MySQL中utf8和utf8mb4有什么区别

汽车玩家 来源:IT生涯 作者:IT生涯 2020-04-12 19:21 次阅读
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

一、简介

MySQL在5.5.3之后增加了这个utf8mb4的编码,mb4就是most bytes 4的意思,专门用来兼容四字节的unicode。utf8mb4是utf8的超集,除了将编码改为utf8mb4外不需要做其他转换。当然,为了节省空间,一般情况下使用utf8也就够了。

二、内容描述

那上面说了既然utf8能够存下大部分中文汉字,那为什么还要使用utf8mb4呢? 原来mysql支持的 utf8 编码最大字符长度为 3 字节,如果遇到 4 字节的宽字符就会插入异常了。三个字节的 UTF-8 最大能编码的 Unicode 字符是 0xffff,也就是 Unicode 中的基本多文种平面(BMP)。也就是说,任何不在基本多文本平面的 Unicode字符,都无法使用 Mysql 的 utf8 字符集存储。包括 Emoji 表情(Emoji是一种特殊的 Unicode 编码,常见于 iosandroid 手机上),和很多不常用的汉字,以及任何新增的 Unicode 字符等等(utf8的缺点)。

通常,计算机在存储字符时,会根据不同类型的字符以及编码方式分配存储空间。例如以下几种编码方式;

①ASCII编码中,一个英文字母(不分大小写)占用一个字节的空间,一个中文汉字占用两个字节的空间。一个二进制的数字序列,在计算机中作为一个数字单元存储时,一般为8位二进制数,换算为十进制。最小值0,最大值255。

②UTF-8编码中,一个英文字符占用一个字节的存储空间,一个中文(含繁体)占用三个字节的存储空间。

③Unicode编码中,一个英文占用两个字节的存储空间,一个中文(含繁体)占用两个字节的存储空间。

④UTF-16编码中,一个英文字母字符或一个汉字字符存储都需要占用2个字节的存储空间(Unicode扩展区的一些汉字存储需要4个字节)。

⑤UTF-32编码中,世界上任何字符的存储都需要占用4个字节的存储空间。

既然utf8能兼容绝大部分的字符,为什么要扩展utf8mb4?

随着互联网的发展,产生了许多新类型的字符,例如emoji这种类型的符号,也就是我们通常在聊天时发的小黄脸表情,这种字符的出现不在基本多平面的Unicode字符之中,导致无法在MySQL中使用utf8存储,MySQL于是对utf8字符进行了扩展,增加了utf8mb4这个编码。

所以,设计数据库时如果想要允许用户使用特殊符号,最好使用utf8mb4编码来存储,使得数据库有更好的兼容性,但是这样设计会导致耗费更多的存储空间。

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • MySQL
    +关注

    关注

    1

    文章

    897

    浏览量

    29209
收藏 人收藏
加入交流群
微信小助手二维码

扫码添加小助手

加入工程师交流群

    评论

    相关推荐
    热点推荐

    请问jtag和jlink什么区别啊?

    jtag和jlink什么区别啊?
    发表于 11-28 06:46

    微波雷达和毫米波雷达什么区别

    。今天就和大家说谁微波雷达和毫米波雷达什么区别 微波雷达和毫米波雷达的区别 其实微波雷达和毫米波雷达主要的区别就在于频段,两者本质上其实是一样的,但是从名称
    的头像 发表于 10-30 16:56 1150次阅读
    微波雷达和毫米波雷达<b class='flag-5'>有</b><b class='flag-5'>什么区别</b>

    labview怎么读取UTF-16 LE 文本数据

    各位大佬 请问labview怎么读取UTF-16 LE 文本数据 直接读数据出来会有空格 但是空格无法删除,请问怎么获取UTF-16 LE格式数据
    发表于 10-10 11:23

    rt-thread程序的汉字字符串,如何提取汉字的gb2312编码?

    我希望程序的汉字字串“欢迎光临”取出来的字节数组是GB2312码:“BB B6 D3 AD B9 E2 C1 D9 00”, 而实际出来的是UTF-8码:“E6 AC A2 E8 BF 8
    发表于 09-29 07:14

    求助各位大佬,关于如何读写编码格式为UTF-16LE的配置文件?

    如题,小白求助各位大佬,要怎么实现对编码为UTF-16LE的配置文件的读写。 使用读配置文件的vi读不出内容。 使用读文本的方式写入异常,文件的编码变成UTF-8且内容也不对。
    发表于 09-14 12:54

    终端GBK编码显示错误的原因?怎么解决?

    RT-thread studio终端,使用UTF8编码中文显示正常,使用GBK编码时终端显示乱码。(以使用其他串口助手等核验过串口数据,例如GBK下输出“中文”D6 D0 CE C4,在
    发表于 09-11 07:50

    如何使用 UTF-8 编码?

    如何使用 UTF-8 编码?
    发表于 09-04 06:21

    【创龙TL3562-MiniEVM开发板试用体验】8、FreeType显示矢量文字

    [utf_8_len] <<4)& 0xf0) ; word[len] = (unicode[0]<<8) | unicode[1
    发表于 08-05 11:54

    求助,关于STM32Cubemx 6.15版本生成工程的文件编码的问题求解

    之前升级6.13和6.14版本的时候重新生成工程会将文件编码强制转换成UTF-8格式,导致中文注释乱码。但是在安装文件夹下面的STM32CubeMX.l4j.ini文件里面添加一行
    发表于 07-29 12:31

    GD32与STM32什么区别

    电子发烧友网站提供《GD32与STM32什么区别.docx》资料免费下载
    发表于 04-03 17:27 0次下载

    DLPvideo模式与pattern模式什么区别

    你好,请问,在DLP相关文档提到video模式与 pattern模式,请问这两种模式什么区别
    发表于 03-03 08:32

    私有云和公有云什么区别

    私有云和公有云在多个方面存在显著的区别,以下是具体的比较,主机推荐小编为您整理发布私有云和公有云什么区别
    的头像 发表于 02-20 10:38 1481次阅读

    AIGC和AI什么区别

    AIGC是AI在内容生成领域的一个特定应用方向,AI的技术发展为AIGC提供了基础和支撑。那么,AIGC和AI什么区别呢?下面,AI部落小编带您详细了解。
    的头像 发表于 02-20 10:33 1643次阅读

    windows服务器备份mysql脚本

    一、linux备份 使用python脚本,要求python3和mysqldump #! /usr/bin/python36# -*- coding: utf-8 -*-import
    的头像 发表于 01-02 09:14 667次阅读

    ADS1256的SYSGCAL系统增益校准和SELFGCAL增益自动校准什么区别

    请问一个问题:ADS1256的SYSGCAL系统增益校准和SELFGCAL 增益自动校准什么区别?SELFCAL 偏移和增益自动校准又有何区别?SELFOCAL偏移自动校准又何
    发表于 12-13 12:22