Python对多属性的重复数据去重实例

(编辑:jimmy 日期: 2024/9/28 浏览:2)

python中的pandas模块中对重复数据去重步骤:

1)利用DataFrame中的duplicated方法返回一个布尔型的Series,显示各行是否有重复行,没有重复行显示为FALSE,有重复行显示为TRUE;

2)再利用DataFrame中的drop_duplicates方法用于返回一个移除了重复行的DataFrame。

注释:

如果duplicated方法和drop_duplicates方法中没有设置参数,则这两个方法默认会判断全部咧,如果在这两个方法中加入了指定的属性名(或者称为列名),例如:frame.drop_duplicates(['state']),则指定部分列(state列)进行重复项的判断。

具体实例如下:

> import pandas as pd 
> data={'state':[1,1,2,2],'pop':['a','b','c','d']} 
> frame=pd.DataFrame(data) 
> frame 
 pop state 
0 a  1 
1 b  1 
2 c  2 
3 d  2 
> IsDuplicated=frame.duplicated() 
> print IsDuplicated 
0 False 
1 False 
2 False 
3 False 
dtype: bool 
> frame=frame.drop_duplicates(['state']) 
> frame 
 pop state 
0 a  1 
2 c  2 
> IsDuplicated=frame.duplicated(['state']) 
> print IsDuplicated 
0 False 
2 False 
dtype: bool 
> 

以上这篇Python对多属性的重复数据去重实例就是小编分享给大家的全部内容了,希望能给大家一个参考,也希望大家多多支持。

一句话新闻

微软与英特尔等合作伙伴联合定义“AI PC”:键盘需配有Copilot物理按键
几个月来,英特尔、微软、AMD和其它厂商都在共同推动“AI PC”的想法,朝着更多的AI功能迈进。在近日,英特尔在台北举行的开发者活动中,也宣布了关于AI PC加速计划、新的PC开发者计划和独立硬件供应商计划。
在此次发布会上,英特尔还发布了全新的全新的酷睿Ultra Meteor Lake NUC开发套件,以及联合微软等合作伙伴联合定义“AI PC”的定义标准。