python数据清洗系列之字符串处理详解

脚本专栏 2024/11/16 佚名

3 1 2

前言

数据清洗是一项复杂且繁琐(kubi)的工作，同时也是整个数据分析过程中最为重要的环节。有人说一个分析项目80%的时间都是在清洗数据，这听起来有些匪夷所思，但在实际的工作中确实如此。数据清洗的目的有两个，第一是通过清洗让数据可用。第二是让数据变的更适合进行后续的分析工作。换句话说就是有”脏”数据要洗，干净的数据也要洗。

在数据分析中，特别是文本分析中，字符处理需要耗费极大的精力，因而了解字符处理对于数据分析而言，也是一项很重要的能力。

字符串处理方法

首先我们先了解下都有哪些基础方法

首先我们了解下字符串的拆分split方法

str='i like apple,i like bananer'
print(str.split(','))

对字符str用逗号进行拆分的结果：

['i like apple', 'i like bananer']

print(str.split(' '))

根据空格拆分的结果：

['i', 'like', 'apple,i', 'like', 'bananer']

print(str.index(','))
print(str.find(','))

两个查找结果都为：

找不到的情况下index返回错误，find返回-1

print(str.count('i'))

结果为：

connt用于统计目标字符串的频率

print(str.replace(',', ' ').split(' '))

结果为：

['i', 'like', 'apple', 'i', 'like', 'bananer']

这里replace把逗号替换为空格后，在用空格对字符串进行分割，刚好能把每个单词取出来。

除了常规的方法以外，更强大的字符处理工具费正则表达式莫属了。

正则表达式

在使用正则表达式前我们还要先了解下，正则表达式中的诸多方法。

下面我来看下个方法的使用，首先了解下match和search方法的区别

str = "Cats are smarter than dogs"
pattern=re.compile(r'(.*) are (.*"htmlcode">

pattern=re.compile(r'are (.*"htmlcode">

str = "138-9592-5592 # number"
pattern=re.compile(r'#.*$')
number=re.sub(pattern,'',str)
print(number)


结果为：


138-9592-5592


以上是通过把#号后面的内容替换为空实现提取号码的目的。


我们还可以进一步对号码的横杆进行替换


print(re.sub(r'-*','',number))


结果为：


13895925592


我们还可以用find的方法把找到的字符串打印出来


str = "138-9592-5592 # number"
pattern=re.compile(r'5')
print(pattern.findall(str))


结果为：


['5', '5', '5']
正则表达式的整体内容比较多，需要我们对匹配的字符串的规则有足够的了解，下面是具体的匹配规则。

矢量化字符串函数
清理待分析的散乱数据时，常常需要做一些字符串规整化工作。


data = pd.Series({'li': '120@qq.com','wang':'5632@qq.com',
 'chen': '8622@xinlang.com','zhao':np.nan,'sun':'5243@gmail.com'})
print(data)


结果为：

可以通过规整合的一些方法对数据做初步的判断，比如用contains 判断每个数据中是否含有关键词


print(data.str.contains('@'))


结果为：

也可以对字符串进行分拆，把需要的字符串提取出来


data = pd.Series({'li': '120@qq.com','wang':'5632@qq.com',
     'chen': '8622@xinlang.com','zhao':np.nan,'sun':'5243@gmail.com'})
pattern=re.compile(r'(\d*)@([a-z]+)\.([a-z]{2,4})')
result=data.str.match(pattern) #这里用fillall的方法也可以result=data.str.findall(pattern)
print(result)


结果为：


chen [(8622, xinlang, com)]

li [(120, qq, com)]

sun [(5243, gmail, com)]

wang [(5632, qq, com)]

zhao NaN

dtype: object


此时加入我们需要提取邮箱前面的名称


print(result.str.get(0))


结果为：

或者需要邮箱所属的域名


print(result.str.get(1))


结果为：

当然也可以用切片的方式进行提取，不过提取的数据准确性不高


data = pd.Series({'li': '120@qq.com','wang':'5632@qq.com',
    'chen': '8622@xinlang.com','zhao':np.nan,'sun':'5243@gmail.com'})
print(data.str[:6])


结果为：

最后我们了解下矢量化的字符串方法

总结
以上就是python数据清洗之字符串处理的全部内容了，希望本文的内容对大家的学习或者工作能带来一定的帮助，如果有疑问大家可以留言交流。

python,字符串处理,python,数据清洗,python的字符串处理

华山资源网 Design By www.eoogi.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除！

华山资源网 Design By www.eoogi.com

评论“python数据清洗系列之字符串处理详解”

暂无评论...

www.eoogi.com 华山资源网

120,135影音资源

344,641技术资源

22,817软件资源

435,032站长资源

最新文章

柏菲·万山红《花开原野1》限量开盘母带ORMC

2024/11/16

柏菲·万山红《花开原野2》限量开盘母带ORMC

2024/11/16

潘安邦《思念精选集全纪录》5CD［WAV+CUE]

2024/11/16

杨千嬅《千嬅新唱金牌金曲》金牌娱乐 [WAV+

2024/11/16

杨钰莹《依然情深》首版[WAV+CUE][1G]

2024/11/16

一句话新闻

苹果官宣WWDC 2024！预计会有大批AI功能 - 2024/11/16

3月27日消息，苹果宣布2024年全球开发者大会（WWDC）将于6月10日至6月14日举行，巧合的是，这次大会与端午假期重合。

苹果官方表示：

在线参加 Apple 每年规模最大的开发者盛会。亲眼见证 Apple 最新平台、技术和工具的发布。了解如何创建和改进你的 App 和游戏。与 Apple 设计师和工程师互动交流，与全球开发者社区建立联系。以上活动均免费在线举行。

探索各种新的工具、框架和功能，助力你打造出理想的 App 和游戏。通过视频讲座学习新技能，与 Apple 专家进行一对一会面，以推进你的项目，完善你的构思。

Swift Student Challenge 旨在支持和鼓舞下一代开发者、创作者和企业家。太平洋时间 3 月 28 日，我们将公布今年的获奖者名单。获奖者将有资格参加在 Apple Park 举办的特别活动。我们还会选出 50 名杰出获胜者，他们将受邀前往库比提诺，获得为期三天的非凡体验，包括参加 Apple Park 的特别活动。

RTX 5090要首发性能要翻倍！三星展示GDDR7显存

三星在GTC上展示了专为下一代游戏GPU设计的GDDR7内存。

首次推出的GDDR7内存模块密度为16GB，每个模块容量为2GB。其速度预设为32 Gbps（PAM3），但也可以降至28 Gbps，以提高产量和初始阶段的整体性能和成本效益。
据三星表示，GDDR7内存的能效将提高20%，同时工作电压仅为1.1V，低于标准的1.2V。通过采用更新的封装材料和优化的电路设计，使得在高速运行时的发热量降低，GDDR7的热阻比GDDR6降低了70%。

更新日志

2024年11月16日

python数据清洗系列之字符串处理详解

Python实现多线程HTTP下载器示例

Python pip安装lxml出错的问题解决办法

评论“python数据清洗系列之字符串处理详解”

RTX 5090要首发性能要翻倍！三星展示GDDR7显存

更新日志

友情链接

python数据清洗系列之字符串处理详解

Python实现多线程HTTP下载器示例

Python pip安装lxml出错的问题解决办法

评论“python数据清洗系列之字符串处理详解”

RTX 5090要首发 性能要翻倍！三星展示GDDR7显存

更新日志

友情链接

RTX 5090要首发性能要翻倍！三星展示GDDR7显存