当前位置： > 网站运营 > 建站经验 > 文章内容

python读文件utf-8(python读文件的三种方法)

http://www.itjxue.com 2023-04-11 01:50 来源:未知 点击次数:

python解决csv文件用excel打开乱码问题

【问题】

python输出的csv文件用excel打开，里面的中文会变成乱码，但用window下的记事本或mac下的numbers打开就正常显示。

原因是python输出的文件是utf-8编码写入的，excel默认以gbk方式读取，导致乱码发生。

【解决方法1】文件产出时encoding设置为utf-8-sig????

用excel打开csv时，excel会先检查文件的第一个字符，来了解这个文件是什么编码方式，如果这个字符是BOM，excel就知道用utf-8的方式打开这个文件。python自带了处理BOM的编码方式uft-8-sig，因此只需要在文件产出时将encoding设置为utf-8-sig。

如果文件不是由python产出的，只需要以utf-8方式读入再以utf-8-sig方式存储即可

【解决方法2】懒人法，适用只含简体中文的文件

用记事本打开，点击另存为，右下角编码方式选择“ANSI”，这个过程是把这个文件改成gbk编码格式，excel就是默认用gbk方式打开的。

参考： Python写的csv文件，如何让 Excel 双击打开不乱码？ - 云+社区 - 腾讯云

对编码格式一窍不通的可以阅读以下网页

python笔记——二进制和文件编码_砍柴姑娘Jourosy的博客-CSDN博客

编码方式之ASCII、ANSI、Unicode概述 - 蓝海人 - 博客园

【简单总结】：

1. 首先需要了解字符集和字符编码两个概念，字符集定义了字符和二进制的一一对应关系，字符编码规定了如何将字符的编号存储到计算机中。

2. Unicode是字符集，包含了全球文字的唯一编码，utf-8是编码方式，将unicode以某种方式存储到计算机中。

3. 有些字符集和编码是结合在一起的，称作字符集还是编码都无所谓，比如ASCII，GBK

4. ANSI是各个国家地区不同扩展编码方式的总称，互不兼容（可以看出来通用性没有utf好）

5. 不同编码方式在转换时，通常需要以unicode作为中间编码，即先将其他编码的字符串解码（decode）成unicode，再从unicode编码（encode）成另一种编码。

python读取文件解决‘utf8’ codec can’t decode byte 0xa1的问题

一般这种文件存在类似字符：

如果UTF-8搞不定，可以采取ISO-8859-1编码方式解决：

最早的编码是iso8859-1，和ascii编码相似。但为了方便表示各种各样的语言，逐渐出现了很多标准编码，重要的有如下几个。

很明显，iso8859-1编码表示的字符范围很窄，无法表示中文字符。但是，由于是单字节编码，和计算机最基础的表示单位一致，所以很多时候，仍旧使用iso8859-1编码来表示。而且在很多协议上，默认使用该编码。比如，虽然"中文"两个字不存在iso8859-1编码，以gb2312编码为例，应该是"d6d0 cec4"两个字符，使用iso8859-1编码的时候则将它拆开为4个字节来表示："d6 d0 ce c4"（事实上，在进行存储的时候，也是以字节为单位处理的）。而如果是UTF编码，则是6个字节"e4 b8 ad e6 96 87"。很明显，这种表示方法还需要以另一种编码为基础。

需要说明的是，定长编码便于计算机处理（注意GB2312/GBK不是定长编码），而unicode又可以用来表示所有字符，所以在很多软件内部是使用unicode编码来处理的，比如java。

注意，虽然说utf是为了使用更少的空间而使用的，但那只是相对于unicode编码来说，如果已经知道是汉字，则使用GB2312/GBK无疑是最节省的。不过另一方面，值得说明的是，虽然utf编码对汉字使用3个字节，但即使对于汉字网页，utf编码也会比unicode编码节省，因为网页中包含了很多的英文字符。

python 读取带中文的文件

如果碰上中文文件名，必须用cp936或gb18030去解码它。如果你写了一个中文的文件名，而python根据utf-8规则去把它翻译成字节，就会在底层的文件名上不匹配，因为该中文在cp936的规则下翻译成另外的字节。报错是找不到该文件。

我参照了很多网上内容，有以下三种解决方法，前两种类似，是用unicode：

怎么在Python里使用UTF-8编码

概述

在python代码即.py文件的头部声明即可

解析

py文件中的编码

Python 默认脚本文件都是 ANSCII 编码的，当文件中有非 ANSCII 编码范围内的字符的时候就要使用"编码指示"来修正一个 module 的定义中，如果.py文件中包含中文字符（严格的说是含有非anscii字符），则需要在第一行或第二行指定编码声明：

# -*- coding=utf-8 -*-

#coding=utf-8

# 以上两种选其一即可

其他的编码如：gbk、gb2312也可以；否则会出现:

SyntaxError: Non-ASCII character '\xe4' in file test.py on line 3, but no encoding declared; see for details

python中的编码与解码

先说一下python中的字符串类型，在python中有两种字符串类型，分别是 str 和 unicode，他们都是basestring的派生类；

str类型是一个包含Characters represent (at least) 8-bit bytes的序列；

unicode 的每个 unit 是一个 unicode obj;

在str的文档中有这样的一句话：

The string data type is also used to represent arrays of bytes, e.g., to hold data read from a file.

也就是说在读取一个文件的内容，或者从网络上读取到内容时，保持的对象为str类型；如果想把一个str转换成特定编码类型，需要把str转为Unicode,然后从unicode转为特定的编码类型如：utf-8、gb2312等。

拓展内容

utf-8编码

UTF-8（8-bit Unicode Transformation Format）是一种针对Unicode的可变长度字符编码，也是一种前缀码。它可以用来表示Unicode标准中的任何字符，且其编码中的第一个字节仍与ASCII兼容，这使得原来处理ASCII字符的软件无须或只须做少部分修改，即可继续使用。因此，它逐渐成为电子邮件、网页及其他存储或发送文字的应用中，优先采用的编码。

UTF-8使用一至六个字节为每个字符编码（尽管如此，2003年11月UTF-8被RFC 3629重新规范，只能使用原来Unicode定义的区域，U+0000到U+10FFFF，也就是说最多四个字节）：

1、128个US-ASCII字符只需一个字节编码（Unicode范围由U+0000至U+007F）。

2、带有附加符号的拉丁文、希腊文、西里尔字母、亚美尼亚语、希伯来文、阿拉伯文、叙利亚文及它拿字母则需要两个字节编码（Unicode范围由U+0080至U+07FF）。

3、其他基本多文种平面（BMP）中的字符（这包含了大部分常用字，如大部分的汉字）使用三个字节编码（Unicode范围由U+0800至U+FFFF）。

4、其他极少使用的Unicode?辅助平面的字符使用四至六字节编码（Unicode范围由U+10000至U+1FFFFF使用四字节，Unicode范围由U+200000至U+3FFFFFF使用五字节，Unicode范围由U+4000000至U+7FFFFFFF使用六字节）。

对上述提及的第四种字符而言，UTF-8使用四至六个字节来编码似乎太耗费资源了。但UTF-8对所有常用的字符都可以用三个字节表示，而且它的另一种选择，UTF-16编码，对前述的第四种字符同样需要四个字节来编码，所以要决定UTF-8或UTF-16哪种编码比较有效率，还要视所使用的字符的分布范围而定。不过，如果使用一些传统的压缩系统，比如DEFLATE，则这些不同编码系统间的的差异就变得微不足道了。若顾及传统压缩算法在压缩较短文字上的效果不大，可以考虑使用Unicode标准压缩格式（SCSU）。

互联网工程工作小组（IETF）要求所有互联网协议都必须支持UTF-8编码。互联网邮件联盟（IMC）建议所有电子邮件软件都支持UTF-8编码。

python读写文件

读文件

? ? 1）使用open()方法打开文件，返回一个文件对象

? ? ? ? 原型：open(file, mode='r', buffering=None, encoding=None, errors=None, newline=None, closefd=True)

? ? ? ? 举例：f = open('test.txt', 'r')

? ? ? ? test.txt表示文件路径(包含文件名，这个file参数可以是绝对或者相对路径)

? ??????r表示是读文本文件，rb是读二进制文本文件。（这个mode参数默认值就是r）

????2）使用close()方法关闭文件

? ??????f.close()

? ? ? ? 打开后的文件必须关闭，因为文件对象会占用系统资源，系统打开文件数量也就有限了

? ??3）打开文件时的异常处理

? ??????f=open('test.txt', 'r')

? ? ? ? f.read()

? ? ? ? f.close()

????????FileNotFoundError: [Errno 2] No such file or directory: 'test.txt'

????????文件读写时都有可能产生异常IOError(比如文件不存在)，这样其后面的f.read()，f.close()就不会调用。为保证无论是否异常都可以关闭文件，一般使用try ... finally来处理：

? ??????try:

? ? ????????f = open('test.txt', 'r')

? ? ? ? ? ? f.read()

????????finally:

? ? ????????if f:

? ? ? ? ????????f.close()

????????但这种写法过于繁琐，所以Python引入了with语句来自动调用close()方法：

????????with open('test.txt', 'r') as f:

????????????f.read()

? ? 4）读文件 - read()、readline() 和 readlines()

????????read() 一次读取整个文件，它通常用于将文件内容放到一个字符串变量中。如果文件过大，内存不够，可以通过反复调用read(size)方法，每次最多读取size个字节的内容。

????????readline() 一次读取文件中一行内容，可反复调用

????????readlines() 一次读取所有内容并按行返回列表，该列表可以由for ... in ... 结构再进一步处理。

? ? ? ? 特别注意：

????????这三种方法是把每行末尾的'\n'也读进来了，如有需要就得我们手动去掉'\n'

????????with open('test.txt', 'r') as f:

? ? ????????list = f.readlines()

????????for i in range(0, len(list)):

? ? ????????list[i] = list[i].rstrip('\n')

写文件

? ? 1）写文件和读文件是一样的，唯一区别是open文件时，传入标识符不同，即'w'或者'wb'表示写文本文件或写二进制文件

????f = open('test.txt', 'w')

????f = open('test.txt', 'wb')

????f = open('test.txt', 'a')

? ? f.close()

? ? 特别注意：

? ? 1. 如果没有这个文件，会自动创建一个新文件；如果有，就会先把原文件的内容清空再写入；若不想清空原来的内容而是直接在后面追加新的内容，就用'a'这个模式

? ? 2. 写文件，操作系统往往不会立刻把数据写入磁盘，而是放到内存缓存起来，空闲的时候再慢慢写入。只有调用close()方法时，操作系统才保证把没有写入的数据全部写入磁盘。忘记调用close()的后果是数据可能只写了一部分到磁盘，剩下的丢失了。

? ??2）写文件 - write()、writelines()

? ??write()方法和read()、readline()方法对应，是将字符串写入到文件中。

????writelines()方法和readlines()方法对应，也是针对列表的操作。它接收一个字符串列表作为参数，将他们写入到文件中。

? ? 特别注意：

? ? 换行符不会自动的加入，需要显式的加入换行符。

? ??f = open('test.txt', 'w')

????f.writelines(["111\n", "222\n", "333\n"])

补充说明：

1）对于非默认编码(utf-8)的文件，需要open时添加encording参数，选择对应的编码方式

2）r+, w+, a+，可读可写

3）seek()方法，移动文件指针

seek(offset[, whence]) ，offset是相对于某个位置的偏移量。位置由whence决定，默认whence=0，从开头起；whence=1，从当前位置算起；whence=2相对于文件末尾移动，通常offset取负值。

python读文件utf-8(python读文件的三种方法)

(责任编辑：IT教学网)

复制链接发给好友收藏本文关闭此页

上一篇：微商客源人脉软件是真的吗(微商做客源的真的假的)

下一篇：少儿编程培训哪个机构好(少儿编程教学哪家机构比较好)

python读文件utf-8(python读文件的三种方法)

python解决csv文件用excel打开乱码问题

python读取文件解决‘utf8’ codec can’t decode byte 0xa1的问题

python 读取带中文的文件

怎么在Python里使用UTF-8编码

python读写文件

(责任编辑：IT教学网)

相关建站经验文章

阅读排行

专题教程

推荐建站经验文章

最新更新建站经验