python缺失值的解決方法總結(jié)
1、解決方法
(1)忽視元組。
缺少類別標(biāo)簽時(shí),通常這樣做(假設(shè)挖掘任務(wù)與分類有關(guān)),除非元組有多個(gè)屬性缺失值,否則該方法不太有效。當(dāng)個(gè)屬性缺值的百分比變化很大時(shí),其性能特別差。
(2)人工填寫缺失值。
一般來說,這種方法需要很長(zhǎng)時(shí)間,當(dāng)數(shù)據(jù)集大且缺少很多值時(shí),這種方法可能無法實(shí)現(xiàn)。
(3)使用全局常量填充缺失值。
將缺失的屬性值用同一常數(shù)(如Unknown或負(fù)無限)替換。如果缺失值都是用unknown替換的話,挖掘程序可能會(huì)認(rèn)為形成有趣的概念。因?yàn)橛型瑯拥膬r(jià)值unknown。因此,這種方法很簡(jiǎn)單,但不可靠。
(4)使用與給定元組相同類型的所有樣本的屬性平均值。
(5)使用最可能的值填充缺失值。
可以通過回歸、使用貝葉斯形式化的基于推理的工具和決策樹的總結(jié)來決定。
2、實(shí)例
import numpy as np from sklearn.preprocessing import Imputer imp = Imputer(missing_values='NaN', strategy='mean', axis=0) import numpy as np from sklearn.preprocessing import Imputer ###1.使用均值填充缺失值 imp = Imputer(missing_values='NaN', strategy='mean', axis=0) imp.fit([[1, 2], [np.nan, 3], [7, 6]]) X = [[np.nan, 2], [6, np.nan], [7, 6]] print(imp.transform(X)) [[4. 2. ] [6. 3.66666667] [7. 6. ]]
知識(shí)點(diǎn)擴(kuò)充:
缺失值的處理方法
由于各種各樣的原因,真實(shí)世界中的許多數(shù)據(jù)集都包含缺失數(shù)據(jù),這些數(shù)據(jù)經(jīng)常被編碼成空格、nans或者是其他的占位符。但是這樣的數(shù)據(jù)集并不能被scikit - learn算法兼容,因?yàn)榇蠖鄶?shù)的學(xué)習(xí)算法都會(huì)默認(rèn)數(shù)組中的元素都是數(shù)值,因此素偶有的元素都有自己的代表意義。
使用不完整的數(shù)據(jù)集的一個(gè)基本策略就是舍棄掉整行或者整列包含缺失值的數(shù)值,但是這樣處理會(huì)浪費(fèi)大量有價(jià)值的數(shù)據(jù)。下面是處理缺失值的常用方法:
1.忽略元組
當(dāng)缺少類別標(biāo)簽時(shí)通常這樣做(假定挖掘任務(wù)涉及分類時(shí)),除非元組有多個(gè)屬性缺失值,否則該方法不是很有效。當(dāng)每個(gè)屬性缺少值的百分比變化很大時(shí),它的性能特別差。
2.人工填寫缺失值
一般該方法很費(fèi)時(shí),并且當(dāng)數(shù)據(jù)集很大,缺少很多值時(shí),該方法可能行不通。
3.使用一個(gè)全局常量填充缺失值
將缺失的屬性值用同一個(gè)常數(shù)(如“Unknown”或 負(fù)無窮)替換。如果缺失值都用“unknown”替換,則挖掘程序可能會(huì)認(rèn)為它們形成一個(gè)有趣的概念,因?yàn)樗鼈兌季哂邢嗤闹怠皍nknown”。因此,雖然該方法很簡(jiǎn)單,但是它十分不可靠。
4.使用與給定元組屬同一類的所有樣本的屬性均值
例如:將顧客按照credit_risk分類,則使用具有相同信用度的給定元組的顧客的平均收入替換income中的缺失值。
Python客棧送紅包、紙質(zhì)書
5.使用最可能的值填充缺失值
可以用回歸、使用貝葉斯形式化的基于推理的工具或決策樹歸納確定。例如,利用數(shù)據(jù)集中其他顧客的屬性,可以構(gòu)造一顆決策樹來預(yù)測(cè)income的缺失值。
到此這篇關(guān)于python缺失值的解決方法總結(jié)的文章就介紹到這了,更多相關(guān)如何解決python缺失值內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
- python缺失值填充方法示例代碼
- Python數(shù)據(jù)預(yù)處理時(shí)缺失值的不同處理方式總結(jié)
- Python?數(shù)據(jù)清洗刪除缺失值替換缺失值詳情
- python?sklearn與pandas實(shí)現(xiàn)缺失值數(shù)據(jù)預(yù)處理流程詳解
- Python處理缺失值的8種不同方法實(shí)例
- Python缺失值處理方法
- Python3?DataFrame缺失值的處理方法
- python如何去除異常值和缺失值的插值
- Python?Pandas中缺失值NaN的判斷,刪除及替換
- Python數(shù)據(jù)分析之缺失值檢測(cè)與處理詳解
- Python數(shù)據(jù)分析的八種處理缺失值方法詳解
- Python中查找缺失值的三種方法
相關(guān)文章
手把手教你YOLOv5如何進(jìn)行區(qū)域目標(biāo)檢測(cè)
YOLOV5和YOLOV4有很多相同的地方,最大的改變還是基礎(chǔ)架構(gòu)的變化,下面這篇文章主要給大家介紹了關(guān)于YOLOv5如何進(jìn)行區(qū)域目標(biāo)檢測(cè)的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),需要的朋友可以參考下2022-12-12Python實(shí)現(xiàn)判斷給定列表是否有重復(fù)元素的方法
這篇文章主要介紹了Python實(shí)現(xiàn)判斷給定列表是否有重復(fù)元素的方法,列舉了2種列表判斷方法,涉及Python針對(duì)列表的遍歷、統(tǒng)計(jì)、判斷等相關(guān)操作技巧,需要的朋友可以參考下2018-04-04利用Python提取PDF文本的簡(jiǎn)單方法實(shí)例
日常工作中我們經(jīng)常會(huì)用到pdf格式的文件,大多數(shù)情況下是瀏覽或者編輯pdf信息,但有時(shí)候需要提取pdf中的文本,下面這篇文章主要給大家介紹了關(guān)于利用Python提取PDF文本的簡(jiǎn)單方法,需要的朋友可以參考下2022-07-07使用memory_profiler監(jiān)測(cè)python代碼運(yùn)行時(shí)內(nèi)存消耗方法
今天小編就為大家分享一篇使用memory_profiler監(jiān)測(cè)python代碼運(yùn)行時(shí)內(nèi)存消耗方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧2018-12-12ubuntu20.04運(yùn)用startup application開機(jī)自啟動(dòng)python程序的腳本寫法
這篇文章主要介紹了ubuntu20.04運(yùn)用startup application開機(jī)自啟動(dòng)python程序的腳本寫法,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2023-10-10python開發(fā)之thread線程基礎(chǔ)實(shí)例入門
這篇文章主要介紹了python開發(fā)之thread線程基礎(chǔ),以三個(gè)實(shí)例形式分析了Python中thread線程的基本使用方法,涉及串行與并行程序的執(zhí)行原理及線程的操作技巧,需要的朋友可以參考下2015-11-11Python OpenCV對(duì)本地視頻文件進(jìn)行分幀保存的實(shí)例
今天小編就為大家分享一篇Python OpenCV對(duì)本地視頻文件進(jìn)行分幀保存的實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧2019-01-01