欧美bbbwbbbw肥妇,免费乱码人妻系列日韩,一级黄片

python提取內(nèi)容關鍵詞的方法

 更新時間:2015年03月16日 10:29:09   作者:上大王  
這篇文章主要介紹了python提取內(nèi)容關鍵詞的方法,適用于英文關鍵詞的提取,非常具有實用價值,需要的朋友可以參考下

本文實例講述了python提取內(nèi)容關鍵詞的方法。分享給大家供大家參考。具體分析如下:

一個非常高效的提取內(nèi)容關鍵詞的python代碼,這段代碼只能用于英文文章內(nèi)容,中文因為要分詞,這段代碼就無能為力了,不過要加上分詞功能,效果和英文是一樣的。

復制代碼 代碼如下:

# coding=UTF-8
import nltk
from nltk.corpus import brown
# This is a fast and simple noun phrase extractor (based on NLTK)
# Feel free to use it, just keep a link back to this post
# http://thetokenizer.com/2013/05/09/efficient-way-to-extract-the-main-topics-of-a-sentence/
# Create by Shlomi Babluki
# May, 2013
 
# This is our fast Part of Speech tagger
#############################################################################
brown_train = brown.tagged_sents(categories='news')
regexp_tagger = nltk.RegexpTagger(
    [(r'^-?[0-9]+(.[0-9]+)?$', 'CD'),
     (r'(-|:|;)$', ':'),
     (r'\'*$', 'MD'),
     (r'(The|the|A|a|An|an)$', 'AT'),
     (r'.*able$', 'JJ'),
     (r'^[A-Z].*$', 'NNP'),
     (r'.*ness$', 'NN'),
     (r'.*ly$', 'RB'),
     (r'.*s$', 'NNS'),
     (r'.*ing$', 'VBG'),
     (r'.*ed$', 'VBD'),
     (r'.*', 'NN')
])
unigram_tagger = nltk.UnigramTagger(brown_train, backoff=regexp_tagger)
bigram_tagger = nltk.BigramTagger(brown_train, backoff=unigram_tagger)
#############################################################################
# This is our semi-CFG; Extend it according to your own needs
#############################################################################
cfg = {}
cfg["NNP+NNP"] = "NNP"
cfg["NN+NN"] = "NNI"
cfg["NNI+NN"] = "NNI"
cfg["JJ+JJ"] = "JJ"
cfg["JJ+NN"] = "NNI"
#############################################################################
class NPExtractor(object):
    def __init__(self, sentence):
        self.sentence = sentence
    # Split the sentence into singlw words/tokens
    def tokenize_sentence(self, sentence):
        tokens = nltk.word_tokenize(sentence)
        return tokens
    # Normalize brown corpus' tags ("NN", "NN-PL", "NNS" > "NN")
    def normalize_tags(self, tagged):
        n_tagged = []
        for t in tagged:
            if t[1] == "NP-TL" or t[1] == "NP":
                n_tagged.append((t[0], "NNP"))
                continue
            if t[1].endswith("-TL"):
                n_tagged.append((t[0], t[1][:-3]))
                continue
            if t[1].endswith("S"):
                n_tagged.append((t[0], t[1][:-1]))
                continue
            n_tagged.append((t[0], t[1]))
        return n_tagged
    # Extract the main topics from the sentence
    def extract(self):
        tokens = self.tokenize_sentence(self.sentence)
        tags = self.normalize_tags(bigram_tagger.tag(tokens))
        merge = True
        while merge:
            merge = False
            for x in range(0, len(tags) - 1):
                t1 = tags[x]
                t2 = tags[x + 1]
                key = "%s+%s" % (t1[1], t2[1])
                value = cfg.get(key, '')
                if value:
                    merge = True
                    tags.pop(x)
                    tags.pop(x)
                    match = "%s %s" % (t1[0], t2[0])
                    pos = value
                    tags.insert(x, (match, pos))
                    break
        matches = []
        for t in tags:
            if t[1] == "NNP" or t[1] == "NNI":
            #if t[1] == "NNP" or t[1] == "NNI" or t[1] == "NN":
                matches.append(t[0])
        return matches
# Main method, just run "python np_extractor.py"
def main():
    sentence = "Swayy is a beautiful new dashboard for discovering and curating online content."
    np_extractor = NPExtractor(sentence)
    result = np_extractor.extract()
    print "This sentence is about: %s" % ", ".join(result)
if __name__ == '__main__':
    main()

希望本文所述對大家的Python程序設計有所幫助。

相關文章

  • 使用Python代碼實現(xiàn)對Excel單元格的鎖定

    使用Python代碼實現(xiàn)對Excel單元格的鎖定

    在Excel表格中,我們可以通過鎖定特定的單元格或區(qū)域,防止對單元格內(nèi)容進行隨意修改,確保關鍵數(shù)據(jù)、公式或格式不被誤改,本文將介紹如何使用Python代碼來實現(xiàn)對Excel單元格的鎖定,實現(xiàn)批量操作以及自動化,需要的朋友可以參考下
    2024-06-06
  • python列表推導式操作解析

    python列表推導式操作解析

    這篇文章主要介紹了python列表推導式操作解析,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2019-11-11
  • Python實現(xiàn)求一個集合所有子集的示例

    Python實現(xiàn)求一個集合所有子集的示例

    今天小編就為大家分享一篇Python 實現(xiàn)求一個集合所有子集的示例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-05-05
  • python Matplotlib模塊的使用

    python Matplotlib模塊的使用

    這篇文章主要介紹了python Matplotlib模塊的使用,幫助大家更好的利用python處理圖像,感興趣的朋友可以了解下
    2020-09-09
  • python根據(jù)用戶需求輸入想爬取的內(nèi)容及頁數(shù)爬取圖片方法詳解

    python根據(jù)用戶需求輸入想爬取的內(nèi)容及頁數(shù)爬取圖片方法詳解

    這篇文章主要介紹了python根據(jù)用戶需求輸入想爬取的內(nèi)容及頁數(shù)爬取圖片方法詳解,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2020-08-08
  • python基礎教程之字典操作詳解

    python基礎教程之字典操作詳解

    這篇文章主要介紹了python中的字典操作詳解,需要的朋友可以參考下
    2014-03-03
  • Python選課系統(tǒng)開發(fā)程序

    Python選課系統(tǒng)開發(fā)程序

    這篇文章主要為大家詳細介紹了Python選課系統(tǒng)開發(fā)程序,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2016-09-09
  • python動態(tài)性強類型用法實例

    python動態(tài)性強類型用法實例

    這篇文章主要介紹了python動態(tài)性強類型用法,對比C#實例分析了python動態(tài)性強類型的使用方法,需要的朋友可以參考下
    2015-05-05
  • 使用Python3實現(xiàn)判斷函數(shù)的圈復雜度

    使用Python3實現(xiàn)判斷函數(shù)的圈復雜度

    編寫函數(shù)最重要的原則就是:別寫太復雜的函數(shù),那什么樣的函數(shù)才能算是過于復雜?一般會通過兩個標準來判斷,長度和圈復雜度,下面我們就來看看如何使用Python判斷函數(shù)的圈復雜度吧
    2024-04-04
  • Python實現(xiàn)獲取網(wǎng)頁信息并解析

    Python實現(xiàn)獲取網(wǎng)頁信息并解析

    這篇文章主要為大家詳細介紹了如何使用Python實現(xiàn)獲取網(wǎng)頁信息并解析功能,文中的示例代碼講解詳細,感興趣的小伙伴可以跟隨小編一起學習一下
    2025-05-05

最新評論