欧美bbbwbbbw肥妇,免费乱码人妻系列日韩,一级黄片

python使用sklearn實現(xiàn)決策樹的方法示例

 更新時間:2019年09月12日 09:23:55   作者:枯萎的海風  
這篇文章主要介紹了python使用sklearn實現(xiàn)決策樹的方法示例,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧

1. 基本環(huán)境

安裝 anaconda 環(huán)境, 由于國內(nèi)登陸不了他的官網(wǎng) https://www.continuum.io/downloads, 不過可以使用國內(nèi)的鏡像站點: https://mirrors.tuna.tsinghua.edu.cn/anaconda/archive/

添加繪圖工具 Graphviz http://www.graphviz.org/Download_windows.php

安裝后, 將bin 目錄內(nèi)容添加到環(huán)境變量path 即可

參考blog : http://www.dbjr.com.cn/article/169878.htm

官網(wǎng)技術(shù)文檔 : http://scikit-learn.org/stable/modules/tree.html#tree-algorithms-id3-c4-5-c5-0-and-cart

2. 遇到的一些問題

csv 文件讀取 https://docs.python.org/3.5/library/csv.html?highlight=csv#module-csv

https://docs.python.org/2/library/csv.html?highlight=csv#module-csv

3. 實現(xiàn)

數(shù)據(jù)文件:

這里寫圖片描述 

這是一個給定 4 個屬性, age, income, student, credit_rating 以及 一個 標記屬性 class_buys_computer 的數(shù)據(jù)集, 我們需要根據(jù)這個數(shù)據(jù)集進行分析并構(gòu)建一顆決策樹

代碼實現(xiàn):

核心就是調(diào)用 tree 的 DecisionTreeClassifier 方法對數(shù)據(jù)進行 訓練得到一顆決策樹

# -*- coding: utf-8 -*-
"""
Created on Sun Dec 25 11:25:40 2016

@author: Administrator
"""

from sklearn.feature_extraction import DictVectorizer
import csv
from sklearn import tree
from sklearn import preprocessing
from sklearn.externals.six import StringIO
import pydotplus
from IPython.display import Image

# Read in the csv file and put features into list of dict and list of class label
allElectornicsData = open('AllElectronics.csv', 'r')
reader = csv.reader(allElectornicsData)
# headers = reader.next()  python2.7 supported  本質(zhì)獲取csv 文件的第一行數(shù)據(jù)
#headers = reader.__next__()  python 3.5.2 
headers = next(reader)

print(headers)

featureList = []
labelList = []

for row in reader:
  labelList.append(row[len(row) - 1])
  rowDict = {}
  for i in range(1, len(row) - 1):
    rowDict[headers[i]] = row[i]
  featureList.append(rowDict)

print(featureList)
print(labelList)

# Vetorize features
vec = DictVectorizer()
dummyX = vec.fit_transform(featureList).toarray()

print("dummyX: " + str(dummyX))
print(vec.get_feature_names())
print("labelList: " + str(labelList))

# vectorize class labels
lb = preprocessing.LabelBinarizer()
dummyY = lb.fit_transform(labelList)
print("dummyY: ", str(dummyY))

# Using decision tree for classification    ===========【此處調(diào)用為算法核心】============
#clf = tree.DecisionTreeClassifier(criterion='entropy')
clf = tree.DecisionTreeClassifier(criterion='gini')
clf = clf.fit(dummyX, dummyY)
print("clf: ", str(clf))

# Visualize model
# dot -Tpdf iris.dot -o ouput.pdf
with open("allElectronicInformationGainOri.dot", 'w') as f:
  f = tree.export_graphviz(clf, feature_names = vec.get_feature_names(), out_file = f)


# predict
oneRowX = dummyX[0, :]
print("oneRowX: " + str(oneRowX))

newRowX = oneRowX
newRowX[0] = 1
newRowX[2] = 0
print("newRowX: " + str(newRowX))

predictedY = clf.predict(newRowX)
print("predictedY: " + str(predictedY))

輸出結(jié)果:

ID3 算法

這里寫圖片描述

CART 算法

這里寫圖片描述

4. 決策樹的優(yōu)缺點

決策樹的優(yōu)勢

  1. 簡單易用,而且輸出的結(jié)果易于解釋,樹能夠被圖形化,加深了直觀的理解。
  2. 幾乎不需要對數(shù)據(jù)進行預處理。
  3. 算法的開銷不大,而且決策樹一旦建立,對于未知樣本的分類十分快,最壞情況下的時間復雜度是O(w),w是樹的最大深度。
  4. 能夠用于多類的分類。
  5. 能夠容忍噪點。

決策樹的劣勢

  1. 容易過擬合。
  2. 容易被類別中占多數(shù)的類影響而產(chǎn)生bias,所以推薦在送入算法之間先平衡下數(shù)據(jù)中各個類別所占的比例。
  3. 決策樹采用的是自頂向下的遞歸劃分法,因此自定而下到了末端枝葉包含的數(shù)據(jù)量會很少,我們會依據(jù)很少的數(shù)據(jù)量取做決策,這樣的決策是不具有統(tǒng)計意義的,這就是數(shù)據(jù)碎片的問題。

以上就是本文的全部內(nèi)容,希望對大家的學習有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

  • python環(huán)境功能強大的pip-audit安全漏洞掃描工具

    python環(huán)境功能強大的pip-audit安全漏洞掃描工具

    這篇文章主要為大家介紹了python環(huán)境中功能強大的pip-audit安全漏洞掃描工具的功能介紹及安裝使用說明,有需要的朋友可以借鑒參考下,希望能夠有所幫助
    2022-02-02
  • Python如何利用IMAP實現(xiàn)郵箱客戶端功能

    Python如何利用IMAP實現(xiàn)郵箱客戶端功能

    IMAP是另一種讀取電子郵件的協(xié)議,IMAP是讀取郵件服務器的電子郵件與公布欄信息的方法,也就是說IMAP 允許客戶端的郵件程序存取遠程的信息,這篇文章主要給大家介紹了關(guān)于Python如何利用IMAP實現(xiàn)郵箱客戶端功能的相關(guān)資料,需要的朋友可以參考下
    2021-09-09
  • vue常用指令代碼實例總結(jié)

    vue常用指令代碼實例總結(jié)

    這篇文章主要介紹了vue常用指令代碼實例,需要的朋友可以參考下
    2020-03-03
  • Python常用的日期時間處理方法示例

    Python常用的日期時間處理方法示例

    這篇文章主要介紹了Python常用的日期時間處理方法示例,本文直接給出實現(xiàn)代碼,包含如給定日期向后N天的日期、昨天、今天、將字符串轉(zhuǎn)換成datetime類型等方法,需要的朋友可以參考下
    2015-02-02
  • python無限生成不重復(字母,數(shù)字,字符)組合的方法

    python無限生成不重復(字母,數(shù)字,字符)組合的方法

    今天小編就為大家分享一篇python無限生成不重復(字母,數(shù)字,字符)組合的方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-12-12
  • python開發(fā)之list操作實例分析

    python開發(fā)之list操作實例分析

    這篇文章主要介紹了python開發(fā)之list操作方法,結(jié)合實例形式分析了list操作的具體用法與相關(guān)注意事項,需要的朋友可以參考下
    2016-02-02
  • Python排序算法實例代碼

    Python排序算法實例代碼

    這篇文章主要為大家詳細介紹了Python實現(xiàn)排序算法的相關(guān)代碼,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2017-08-08
  • Python判斷三段線能否構(gòu)成三角形的代碼

    Python判斷三段線能否構(gòu)成三角形的代碼

    這篇文章主要介紹了Python判斷三段線能否構(gòu)成三角形的代碼,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-04-04
  • 一步步解析Python斗牛游戲的概率

    一步步解析Python斗牛游戲的概率

    這篇文章主要帶著大家一步步解析Python斗牛游戲的概率,計算出斗牛游戲的概率,感興趣的朋友可以參考一下
    2016-02-02
  • 關(guān)于阿里云oss獲取sts憑證 app直傳 python的實例

    關(guān)于阿里云oss獲取sts憑證 app直傳 python的實例

    今天小編就為大家分享一篇關(guān)于阿里云oss獲取sts憑證 app直傳 python的實例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-08-08

最新評論