阅读设置
第319章 困死我了 (2/3)
发现所有错误y但效率低下在大数据量的情况下y手工清洗数据几乎
是不可能的
?
2?自动清洗x自动清洗是通过专门编写的计算机应用程序来进行数据
清洗这种方法能解决某个特定的问题y但不够灵活y特别是在清理过
程需要反复进行时?一般来说,数据清理一遍就达到要求的很少?y程序
复杂y清理过程变化时工作量大而且y这种方法也没有充分利用目前
数据库提供的强大的数据处理能力。
数据清洗主要是对缺失值重复值异常值和数据类型有误的数据
进行处理y数据清洗的内容主要包括四点
?
1?缺失值处理由于调查编码和录入误差y数据中可能存在
一些缺失值y需要给予适当的处理常用的处理方法有x估算
整例删除变量删除和成对删除
?
2?异常值处理根据每个变量的合理取值范围和相互关系y检
查数据是否合乎要求y发现超出正常范围逻辑上不合理或者相
互矛盾的数据。
数据清洗主要是对缺失值重复值异常值和数据类型有误的数据
进行处理y数据清洗的内容主要包括四点
?
3?数据类型转换数据类型往往会影响到后续的数据处理分析
环节y因此y需要明确每个字段的数据类型y比如y来自a表的
学号是字符型y而来自b表的字段是日期型y在数据清洗的时候
就需要对二者的数据类型进行统一处理
?
4?重复值处理重复值的存在会影响数据分析和挖掘结果的准
确性y所以y在数据分析和建模之前需要进行数据重复性检验y
如果存在重复值y还需要进行重复值的删除。
在进行数据清洗时y需要注意如下事项x
?
1?数据清洗时优先进行缺失值异常值和数据类型转换的操作y最后进
行重复值的处理
?
2?在对缺失值异常值进行处理时y要根据业务的需求进行处理y这些
处理并不是一成不变的y常见的填充包括x统计值填充?常用的统计值有
均值中位数众数?前\/后值填充?一般使用在前后数据存在关联的情
况下y比如数据是按照时间进行记录的?零值填充。
在进行数据清洗时y需要注意如下事项x
?
其他最近更新
- 《公子风流世无双》作者:天鬼山的艾晴
- 《这个杀手是赘婿》作者:雨夜徒步
- 《观影:给诸天万界一点点崩铁震撼》作者:沐子休
- 《农家有蓁宝》作者:冰棠要吃松子
- 《快穿之大佬来了,渣渣要倒霉了》作者:微生青烟
- 《四合院:从民国三十年开始!》作者:心雨未霁
- 《四合院:我当兵回来了》作者:搁浅时光
- 《综影视:我不是提线木偶》作者:珈蓝锦年1
- 《小马宝莉之荒原影魔勇闯小马利亚》作者:MYLIMIT
- 《【水官解厄】月麟》作者:月下丝竹
- 《穿越异世之修仙》作者:寂静无诲
- 《斩神,笙笙来也》作者:久啾咪
- 《逆天神鼎》作者:夜郎不大
- 《婚不可待:高冷凤少也折腰》作者:跳楼的可爱多
- 《重生60饥荒年孤女是异能女王》作者:樱挑
- 《娇美人揣崽去逼婚,震惊家属院!》作者:竹苑青青