Python利用 utf-8-sig 编码格式解决写入 csv 文件乱码问题
先举个例子,分别以不指定编码、指定编码为utf-8、指定编码为utf-8-sig三种方式来做比较,再将写入csv文件和txt文件来做个对比
一、不指定编码方式,直接存入csv文件
importcsv withopen('test.csv','w')asfp: writer=csv.writer(fp) writer.writerow(['汉语','俄语','韩语','日语','英语']) writer.writerow(['爱你','люблютебя','사랑해요','愛しています','loveyou'])
此时运行程序会报以下错误:
UnicodeEncodeError:'gbk'codeccan'tencodecharacter'\uc0ac'inposition14:illegalmultibytesequence
二、指定编码为utf-8,再存入csv文件
接下来尝试将内容以utf-8编码方式存入test.csv文件中,可以看到除了英文,其他的全都是乱码:
importcsv withopen('test.csv','w',encoding='utf-8')asfp: writer=csv.writer(fp) writer.writerow(['汉语','俄语','韩语','日语','英语']) writer.writerow(['爱你','люблютебя','사랑해요','愛しています','loveyou'])
三、指定编码为utf-8-sig,再存入csv文件
当将编码方式换成utf-8-sig之后,显示为正常:
importcsv withopen('test.csv','w',encoding='utf-8-sig')asfp: writer=csv.writer(fp) writer.writerow(['汉语','俄语','韩语','日语','英语']) writer.writerow(['爱你','люблютебя','사랑해요','愛しています','loveyou'])
四、不指定编码方式,直接存入txt文件
withopen('test.txt','w')asfp: fp.write('爱你,люблютебя,사랑해요,愛しています,loveyou')
和存入csv文件一样,也会报以下错误:
UnicodeEncodeError:'gbk'codeccan'tencodecharacter'\uc0ac'inposition16:illegalmultibytesequence
五、指定编码为utf-8/utf-8-sig,再存入txt文件
以utf-8或者utf-8-sig编码方式存入test.txt文件中,内容都是完全正常的:
ithopen('test.txt','w',encoding='utf-8')asfp: fp.write('爱你,люблютебя,사랑해요,愛しています,loveyou') withopen('test.txt','w',encoding='utf-8-sig')asfp: fp.write('爱你,люблютебя,사랑해요,愛しています,loveyou')
utf-8与utf-8-sig有什么区别?
- utf-8以字节为编码单元,它的字节顺序在所有系统中都是一样的,没有字节序问题,也因此它实际上并不需要BOM;
- uft-8-sig中sig全拼为signature,即带有签名的utf-8(UTF-8withBOM);
- BOM全称ByteOrderMark,字节顺序标记,出现在文本文件头部,Unicode编码标准中用于标识文件是采用哪种格式的编码。
为什么写入csv文件要用utf-8-sig编码?
- Excel在读取csv文件的时候是通过读取文件头上的BOM来识别编码的,如果文件头无BOM信息,则默认按照Unicode编码读取。
- 当我们使用utf-8编码来生成csv文件的时候,并没有生成BOM信息,Excel就会自动按照Unicode编码读取,就会出现乱码问题了。
为什么写入txt文件要用utf-8编码?
在写入txt文件时,Windows会默认转码成gbk,遇到某些gbk不支持的字符就会报错,在打开文件时就声明编码方式为utf-8就能避免这个错误。
知识点扩展:
utf-8和utf-8-sig的区别
前言:在写入csv文件中,出现了乱码的问题。
解决:utf-8改为utf-8-sig
区别如下:
1、”utf-8“是以字节为编码单元,它的字节顺序在所有系统中都是一样的,没有字节序问题,因此它不需要BOM,所以当用"utf-8"编码方式读取带有BOM的文件时,它会把BOM当做是文件内容来处理,也就会发生类似上边的错误.
2、“uft-8-sig"中sig全拼为signature也就是"带有签名的utf-8”,因此"utf-8-sig"读取带有BOM的"utf-8文件时"会把BOM单独处理,与文本内容隔离开,也是我们期望的结果.
总结
以上所述是小编给大家介绍的Python利用utf-8-sig编码格式解决写入csv文件乱码问题,希望对大家有所帮助,也非常感谢大家对毛票票网站的支持!
声明:本文内容来源于网络,版权归原作者所有,内容由互联网用户自发贡献自行上传,本网站不拥有所有权,未作人工编辑处理,也不承担相关法律责任。如果您发现有涉嫌版权的内容,欢迎发送邮件至:czq8825#qq.com(发邮件时,请将#更换为@)进行举报,并提供相关证据,一经查实,本站将立刻删除涉嫌侵权内容。