詳解python pandas 分組統(tǒng)計的方法
首先,看看本文所面向的應用場景:我們有一個數(shù)據(jù)集df,現(xiàn)在想統(tǒng)計數(shù)據(jù)中某一列每個元素的出現(xiàn)次數(shù)。這個在我們前面文章《如何畫直方圖》中已經(jīng)介紹了方法,利用value_counts()就可以實現(xiàn)(具體回看文章)
但是,現(xiàn)在,我們考慮另外一個場景,我們假如要想統(tǒng)計其中兩列元素出現(xiàn)次數(shù)呢?舉個栗子:
在df數(shù)據(jù)集中,如果我們想統(tǒng)計A、B兩列的元素的出現(xiàn)情況,也就是說,得到如下表。
從上面的最后一列可以看到,在A、B兩列中,1 2 出現(xiàn)了2次,1 4 出現(xiàn)1次 ,1 6出現(xiàn)1次,2 3出現(xiàn)了2次, 2 4 出現(xiàn)1次, 3 1出現(xiàn)了1次
具體實現(xiàn)的代碼:
import pandas as pd df=pd.DataFrame([[1,2,2],[1,4,5],[1,2,4],[1,6,3],[2,3,1],[2,4,1],[2,3,5],[3,1,1]],columns=['A','B','C'])
gp=df.groupby(by=['A','B']) gp.size()
所以,如果想統(tǒng)計更多列,只要在groupby()中的by參數(shù)添加就可以,例如統(tǒng)計3列。
gp=df.groupby(by=['A','B','C'])
由gp.size()得到的是可以mulitiindex Series。
下面,要轉(zhuǎn)化成DataFrame的結(jié)構(gòu)。
newdf=gp.size() newdf.reset_index(name='times')
其中name中參數(shù)就是我們可以為最后一列添加新的名字,例如這里的“times”
這個時候newdf已經(jīng)是DataFrame的類型了。
以上就是本文的全部內(nèi)容,希望對大家的學習有所幫助,也希望大家多多支持腳本之家。
相關(guān)文章
python直接調(diào)用和使用swig法方調(diào)用c++庫
這篇文章主要介紹了python直接調(diào)用和使用swig法方調(diào)用c++庫,c++運算速度快于python,python簡單易寫。很多時候?qū)τ谝延械腸++代碼也不想用python重寫,此時就自然而然地想到用python調(diào)用c或者c++,兩全其美,需要的朋友可以參考一下2022-03-03keras讀取h5文件load_weights、load代碼操作
這篇文章主要介紹了keras讀取h5文件load_weights、load代碼操作,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧2020-06-06Python機器學習庫sklearn(scikit-learn)的基礎(chǔ)知識和高級用法
Scikit-Learn是 Python 最流行的機器學習庫之一,它提供了各種工具來實現(xiàn)、評估和探索各種學習算法,用于,各種機器學習任務(wù),在本教程中,我們將介紹 Scikit-Learn 的基礎(chǔ)知識和一些高級用法,并提供一些實例代碼來幫助我們更好地理解2023-07-07python在windows下實現(xiàn)ping操作并接收返回信息的方法
這篇文章主要介紹了python在windows下實現(xiàn)ping操作并接收返回信息的方法,實例分析了Python實現(xiàn)ping操作的技巧,具有一定參考借鑒價值,需要的朋友可以參考下2015-03-03Python第三方庫undetected_chromedriver的使用
這篇文章主要給大家介紹了關(guān)于Python第三方庫undetected_chromedriver的使用方法,文中通過實例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下2023-01-01