2022-01-06 14:43

关注

Python数据分析与处理——处理中国地区信息

预处理地区信息

2.1数据的爬取

代码：

import pandas as pd data=pd.read_csv("example_data.csv",header=1)

print(data) data1=pd.read_csv("北京地区信息.csv",header=1,encoding='gbk') data2=pd.read_csv("天津地区信息.csv",encoding='gbk')

print(data1)

print(data2)

代码运行结果：

首先使用pandas的read_csv()方法进行数据的读取，然后就能够看到相应的表格信息。

2.2检查重复数据

# 2.2检查重复数据 dupnum=data.duplicated() print(dupnum)

\# 对重复值进行处理 caldup=data.drop_duplicates() print(caldup)

代码运行结果：

主要是是使用这个duplicated()方法进行数据的查重，返回一个布尔序列，仅对唯一元素而言为True。如果有重复的数据就会在该数值的部分返货Flase。

然后我们就可以使用drop_duplicates()进行重复值删除。

2.3检查缺失值

代码：

from pandas import Series from numpy import NAN

\# import pandas as pd series_obj=Series([1,None]) pd.notnull(series_obj)

\# 上面做的是测试 pd.notnull(data) pd.notnull(data1) pd.notnull(data2)

代码运行结果：

使用pd.notnull(data1)进行非空数值的返回，返回值是布尔型的矩阵，再取df[布尔型矩阵]返回的是id为非空的行。

2.4 检查异常值

import numpy as np

\# 2.4 检查异常值 def three_sig(ser1): mean_value=ser1.mean()

\#   标准差 std_value=ser1.std()

\#   位于3σ范围外的都是异常值 \# 数值大于u+3σ小雨u-3σ rule=(mean_value-3*std_value>ser1)|(ser1.mean()+3*ser1.std()<ser1)

  index=np.arange(ser1.shape[0])[rule]

  outrange=ser1.iloc[index] return outrange

three_sig(data2["女性"])

代码运行结果：

3σ原则又称为拉依达准则，该准则具体来说，就是先假设一组检测数据只含有随机误差，对原始数据进行计算处理得到标准差，然后按一定的概率确定一个区间，认为误差超过这个区间的就属于异常值。

通俗理解就是正态分布。

全部评论

推荐最新楼层

昨天 16:57

门头沟学院测试开发

1024-影石程序员专属礼物来了!!

今年影石发的1024程序员节的礼物如下,专属程序员才有,其他岗位无,还是非常用心的,我选的是磁吸充电器,以后刷手机再也不用担心没电了 还有黄金键帽和键盘,不过只有部分员工有, 可惜, 还得努力,争取明年拿到黄金键帽.

投递影石Insta360等公司10个岗位

点赞评论收藏

分享

10-20 12:21

联想_算法工程师(准入职员工)

联想内推，联想内推码

优点:wlb 真的不加班，假期也很多年假15天，平时请假也很简单，有的时候和领导说一下都不用走请假流程。领导和同事都很nice，不存在PUA，领导也懂技术，交流起来很顺畅，领导也支持新技术探索，我就在联想的时候开始写技术博客和开源项目。上下班不用打卡，平时项目也不急，下班基本不找你。福利好，12病假，有房补餐补，能排户口（最吸引我的点，但不一定） 🔻联想的福利 五险一金、企业年金、员工内购股票 节假日的各种礼盒 旅游补贴：工作满五年，1.5w/年的旅游补贴 带薪病假和生育假：很体贴员工，尊重女性！ 🔻团队氛围超级nice 部门的同事都超级好，定期团建聚餐以及旅游 联想就是家文化，和其他部...

联想公司福利 1477人发布

点赞评论收藏

分享

10-14 15:17

门头沟学院运营

反秋招实习化

又不是啥大公司还搞这套，文字游戏真是玩明白了

notbeentak...：真的nc，算毕业6月份，要给这种b公司打半年多白工😅

点赞评论收藏

分享

10-21 10:13

三一重能_机械工程师(准入职员工)

三一重能内推，三一重能内推码

测评：感觉没啥好说的，中规中矩🤣英语：当时没记录，忘了题型有啥了，但我基本上就是六级勉强425水平，完全没问题，感觉有四级水平就不用慌了笔试：算法工程师这个岗笔试题是选择，单选+多选，基本上是机器学习的内容，会涉及一丁点python，没学过的话就刷一下牛客网的机器学习题库，有原题的一面：视频单独面试，15-20min        1.自我介绍+非常简单的过一遍项目，不会深究项目        2.大数组如何去重？用哈希表。哈希表内部是如何实现的？不会。        3.你对大数据处理方法有了解么？会用数据库么？不会(提了一下我投的算法岗不是数据分析岗)。        然后就过了。说实话...

点赞评论收藏

分享

评论

点赞

收藏

全站热榜

更多

创作者周榜

更多

正在热议

更多

# 怎么给家人解释你的工作？ #

11244次浏览 74人参与

# 应届生被毁约被毁意向了怎么办 #

46053次浏览 280人参与

# 快手技术岗信息交流阵地 #

3324次浏览 29人参与

# 你的mentor是什么样的人？ #

16173次浏览 110人参与

# 牛客周边新品开箱 #

10384次浏览 90人参与

# 帮我看看，领导说这话什么意思？ #

20973次浏览 98人参与

# 求职中的尴尬瞬间 #

3883次浏览 42人参与

# 牛友的志愿填报指南 #

34908次浏览 185人参与

# 国企还是互联网，你怎么选？ #

170066次浏览 1273人参与

# 牛客树洞，我想对你说 #

9021次浏览 98人参与

# 机械人集合！你是什么工程师？ #

19882次浏览 91人参与

# 如何KTV领导 #

72658次浏览 502人参与

# 大疆工作体验 #

18757次浏览 85人参与

# 今年形式下双非本找得到工作吗 #

237597次浏览 1433人参与

# 三一集团提前批进度交流 #

38392次浏览 225人参与

# 求职低谷期你是怎么度过的 #

12818次浏览 250人参与

# 26届秋招公司红黑榜 #

28217次浏览 115人参与

# 校招泡的最久的公司是哪家？ #

12956次浏览 82人参与

# 从哪些方向判断这个offer值不值得去？ #

17001次浏览 189人参与

# 得物app工作体验 #

28381次浏览 66人参与

# 大厂无回复，继续等待还是奔赴小厂 #

248109次浏览 1634人参与

牛客网
牛客网在线编程
牛客网题解
牛客企业服务