python数据分析数据标准化及离散化详解

脚本专栏 2024/11/16 佚名

3 1 2

本文为大家分享了python数据分析数据标准化及离散化的具体内容，供大家参考，具体内容如下

标准化

1、离差标准化

是对原始数据的线性变换，使结果映射到[0,1]区间。方便数据的处理。消除单位影响及变异大小因素影响。
基本公式为：

x'=（x-min）/（max-min）

代码：

#！／user/bin/env python
#-*- coding:utf-8 -*-
#author:M10
import numpy as np
import pandas as pd
import matplotlib.pylab as plt
import mysql.connector
conn = mysql.connector.connect(host='localhost',
            user='root',
            passwd='123456',
            db='python')#链接本地数据库
sql = 'select price,comment from taob'#sql语句
data = pd.read_sql(sql,conn)#获取数据
#离差标准化
data1 = (data-data.min())/(data.max()-data.min())
print(data1)

运行结果

2、标准差标准化

消除单位影响以及变量自身变异影响。（零-均值标准化）
基本公式为：

x'=（x-平均数）/标准差

python代码：

#！／user/bin/env python
#-*- coding:utf-8 -*-
#author:M10
import numpy as np
import pandas as pd
import matplotlib.pylab as plt
import mysql.connector
conn = mysql.connector.connect(host='localhost',
            user='root',
            passwd='123456',
            db='python')#链接本地数据库
sql = 'select price,comment from taob'#sql语句
data = pd.read_sql(sql,conn)#获取数据
#标准差标准化
data1 = (data-data.mean())/data.std()
print(data1)

运行结果：

3、小数定标标准化

消除单位影响
基本公式为：
其中j=lg(max(|x|)),即以10为底的x的绝对值最大的对数

x' = x/10^j

实现代码为：

#！／user/bin/env python
#-*- coding:utf-8 -*-
#author:M10
import numpy as np
import pandas as pd
import matplotlib.pylab as plt
import mysql.connector
conn = mysql.connector.connect(host='localhost',
            user='root',
            passwd='123456',
            db='python')#链接本地数据库
sql = 'select price,comment from taob'#sql语句
data = pd.read_sql(sql,conn)#获取数据
#标准差标准化
j = np.ceil(np.log10(data.abs().max()))#进一取整，abs()为取绝对值
data1 = data/10**j
print(data1)

结果：

离散化

离散化是程序设计中一个常用的技巧，它可以有效的降低时间复杂度。其基本思想就是在众多可能的情况中，只考虑需要用的值。离散化可以改进一个低效的算法，甚至实现根本不可能实现的算法

1、等宽离散化

将连续数据按照等宽区间标准离散化数据，好处之一是处理的数据是有限个数据而不是无限多。
使用pandas的cut方法。非等宽只需要更改cut的第二个参数，例如：第二个参数为[1,100,3000,10000,200000]，即划分为了四个区间。

#！／user/bin/env python
#-*- coding:utf-8 -*-
#author:M10
import numpy as np
import pandas as pd
import matplotlib.pylab as plt
import mysql.connector
conn = mysql.connector.connect(host='localhost',
            user='root',
            passwd='123456',
            db='python')#链接本地数据库
sql = 'select price,comment from taob'#sql语句
data = pd.read_sql(sql,conn)#获取数据
#离散化
data1 = data['price'].T.values#获取价格的一维数组
lable=['很低','低','中','高','很高']
data2 = pd.cut(data1,5,labels=lable)
print(data2)

执行结果：

2、等频率离散化

将相同数量的数据放进一个区间。

3、一维聚类离散化

按属性对数据进行聚类离散。

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

python数据分析数据标准化,python数据分析数据离散化,python数据分析

华山资源网 Design By www.eoogi.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除！

华山资源网 Design By www.eoogi.com

评论“python数据分析数据标准化及离散化详解”

暂无评论...

www.eoogi.com 华山资源网

120,135影音资源

344,641技术资源

22,817软件资源

435,032站长资源

最新文章

李蕙敏.2014-记得·销魂新歌+精丫乐意唱片】

2024/11/16

谢金燕.1995-含泪跳恰蔷冠登】【WAV+CUE】

2024/11/16

于文文.2024-天蝎座【华纳】【FLAC分轨】

2024/11/16

黄雨勳《魔法列车首部曲》[FLAC/分轨][173.

2024/11/16

群星《歌手2024 第13期》[320K/MP3][50.09M

2024/11/16

一句话新闻

苹果官宣WWDC 2024！预计会有大批AI功能 - 2024/11/16

3月27日消息，苹果宣布2024年全球开发者大会（WWDC）将于6月10日至6月14日举行，巧合的是，这次大会与端午假期重合。

苹果官方表示：

在线参加 Apple 每年规模最大的开发者盛会。亲眼见证 Apple 最新平台、技术和工具的发布。了解如何创建和改进你的 App 和游戏。与 Apple 设计师和工程师互动交流，与全球开发者社区建立联系。以上活动均免费在线举行。

探索各种新的工具、框架和功能，助力你打造出理想的 App 和游戏。通过视频讲座学习新技能，与 Apple 专家进行一对一会面，以推进你的项目，完善你的构思。

Swift Student Challenge 旨在支持和鼓舞下一代开发者、创作者和企业家。太平洋时间 3 月 28 日，我们将公布今年的获奖者名单。获奖者将有资格参加在 Apple Park 举办的特别活动。我们还会选出 50 名杰出获胜者，他们将受邀前往库比提诺，获得为期三天的非凡体验，包括参加 Apple Park 的特别活动。

python数据分析数据标准化及离散化详解

深入理解Python 关于supper 的用法和原理

TensorFlow实现RNN循环神经网络

评论“python数据分析数据标准化及离散化详解”

RTX 5090要首发性能要翻倍！三星展示GDDR7显存

更新日志

友情链接

python数据分析数据标准化及离散化详解

深入理解Python 关于supper 的 用法和原理

TensorFlow实现RNN循环神经网络

评论“python数据分析数据标准化及离散化详解”

RTX 5090要首发 性能要翻倍！三星展示GDDR7显存

更新日志

友情链接

深入理解Python 关于supper 的用法和原理

RTX 5090要首发性能要翻倍！三星展示GDDR7显存