Python3之乱码\xe6\x97\xa0\xe6\xb3\x95处理方式

脚本专栏 2024/9/29 佚名

3 1 2

查看字符编码：

import chardet
response = chardet.detect(b'\xe5\xbd\x93\xe5\x89\x8d\xe7\x9b\xae\xe5\xbd\x95\xe4\xb8\x8b\xe6\x89\x80\xe6\x9c\x89\xe6\x96\x87\xe4\xbb\xb6\xe5\x90\x8d\xe6\xb1\x87\xe6\x80\xbb\xe5\x88\x97\xe8\xa1\xa8')
print(response)

{'encoding': 'utf-8', 'confidence': 0.99, 'language': ''}

乱码字符转换：

response = b'\xe5\xbd\x93\xe5\x89\x8d\xe7\x9b\xae\xe5\xbd\x95\xe4\xb8\x8b\xe6\x89\x80\xe6\x9c\x89\xe6\x96\x87\xe4\xbb\xb6\xe5\x90\x8d\xe6\xb1\x87\xe6\x80\xbb\xe5\x88\x97\xe8\xa1\xa8'
print(response.decode('utf8'))

# def decode_char(*args):
#   response = args[0]
#   print(response.decode('utf8'))
#
# c = b'\a8\xe5\x90\xa7\xef\xbc\x81'
#
# decode_char(c)

补充知识：python3 中怎么把类似这样的'\xe5\xae\x9d\xe9\xb8\xa1\xe5\xb8\x82'转换成汉字输出

在编程的过程中遇到了类似的困扰，网上查了很多解决思路，终于算是明白了一些，这里和大家分享一下。

python3相对于python2最重要的新特性之一就是对字符串（文本）和二进制数据流做了明确的区分，文本总是Unicode，由字符类型表示，而二进制数据则由bytes类型表示，python3不会以任意隐式方式混用字节型和字符型，也不能拼接字符串和字节流（python2中可以，会自动进行转换），也不能在字节流中搜索字符串，也不能将字符串传入参数为字节流的函数。

str和bytes类型之间的相互转换

字符串类str有一个encode()方法，它是字符串向比特流的编码过程。

bytes类则有一个decode()方法，它是比特流向字符串的解码过程

$Python3之乱码\xe6\x97\xa0\xe6\xb3\x95处理方式$

encode过程

s = '绝地求生'
ss = s.encode()
print(type(ss))
print(ss)

运行结果：

$Python3之乱码\xe6\x97\xa0\xe6\xb3\x95处理方式$

decode过程

s = b'\xe7\xbb\x9d\xe5\x9c\xb0\xe6\xb1\x82\xe7\x94\x9f'
ss = s.decode()
print(type(ss))
print(ss)

运行结果：

$Python3之乱码\xe6\x97\xa0\xe6\xb3\x95处理方式$

了解过基本的转化过程，下面回到主题，如何将'\xe7\xbb\x9d\xe5\x9c\xb0\xe6\xb1\x82\xe7\x94\x9f'转换成汉字输出呢？

要解决的问题是将bytes类型的内容以汉字的形式输出，但是该部分内容是字符串类型。因此首先需要将该str转换成bytes类型，再decode解码为str输出。这里需要用到的方法是encode(‘raw_unicode_escape')。当然，也可以使用decode(‘raw_unicode_escape')方法输出内容为bytes形式的字符串

s = '\xe7\xbb\x9d\xe5\x9c\xb0\xe6\xb1\x82\xe7\x94\x9f'
ss = s.encode('raw_unicode_escape')
print(type(ss))
print(ss)

sss = ss.decode()
print(sss)

结果：

$Python3之乱码\xe6\x97\xa0\xe6\xb3\x95处理方式$

方法补充：如果我们直接定义bytes类型的变量，也可以直接使用str(s, ‘utf8')的方式输出汉字

s = b'\xe7\xbb\x9d\xe5\x9c\xb0\xe6\xb1\x82\xe7\x94\x9f'

print(type(s))
print(s)

ss = str(s, 'utf8')
print(ss)

结果：

$Python3之乱码\xe6\x97\xa0\xe6\xb3\x95处理方式$

第二种方法可以输出从网络上直接抓取的网页中包含的中文字符。

我们使用如下代码，抓取网页www.baidu.com。

import urllib.request
response = urllib.request.urlopen('http://www.baidu.com')
html = response.read()
print(html)

显示的结果中，中文部分会以\xe7\x99\xbe\xe5\xba\xa6\xe4\xb8\x80代替，这里可以使用方法二进行转换。

import urllib.request
response = urllib.request.urlopen('http://www.baidu.com')
html =str(response.read(),'utf-8')
print(html)

结果如下：

$Python3之乱码\xe6\x97\xa0\xe6\xb3\x95处理方式$

以上这篇Python3之乱码\xe6\x97\xa0\xe6\xb3\x95处理方式就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持。

Python3,乱码

华山资源网 Design By www.eoogi.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除！

华山资源网 Design By www.eoogi.com

评论“Python3之乱码\xe6\x97\xa0\xe6\xb3\x95处理方式”

暂无评论...

《魔兽世界》大逃杀！60人新游玩模式《强袭风暴》3月21日上线

暴雪近日发布了《魔兽世界》10.2.6 更新内容，新游玩模式《强袭风暴》即将于3月21 日在亚服上线，届时玩家将前往阿拉希高地展开一场 60 人大逃杀对战。

艾泽拉斯的冒险者已经征服了艾泽拉斯的大地及遥远的彼岸。他们在对抗世界上最致命的敌人时展现出过人的手腕，并且成功阻止终结宇宙等级的威胁。当他们在为即将于《魔兽世界》资料片《地心之战》中来袭的萨拉塔斯势力做战斗准备时，他们还需要在熟悉的阿拉希高地面对一个全新的敌人──那就是彼此。在《巨龙崛起》10.2.6 更新的《强袭风暴》中，玩家将会进入一个全新的海盗主题大逃杀式限时活动，其中包含极高的风险和史诗级的奖励。
《强袭风暴》不是普通的战场，作为一个独立于主游戏之外的活动，玩家可以用大逃杀的风格来体验《魔兽世界》，不分职业、不分装备（除了你在赛局中捡到的），光是技巧和战略的强弱之分就能决定出谁才是能坚持到最后的赢家。本次活动将会开放单人和双人模式，玩家在加入海盗主题的预赛大厅区域前，可以从强袭风暴角色画面新增好友。游玩游戏将可以累计名望轨迹，《巨龙崛起》和《魔兽世界：巫妖王之怒经典版》的玩家都可以获得奖励。

更新日志

2024年09月29日

Python3之乱码\xe6\x97\xa0\xe6\xb3\x95处理方式

python将unicode和str互相转化的实现

Python urllib.request对象案例解析

评论“Python3之乱码\xe6\x97\xa0\xe6\xb3\x95处理方式”

《魔兽世界》大逃杀！60人新游玩模式《强袭风暴》3月21日上线

更新日志

友情链接