python 使用pdfminer3k 讀取PDF文檔的例子
1、安裝 pdfminer3k
通過pip安裝: pip install pdfminer3k
下載安裝:在網(wǎng)頁 https://pypi.org/project/pdfminer3k/1.3.1/#files 進行下載,解壓。然后cmd命令進入到當前文件夾:
可以直接在資源管理器的路徑欄直接輸入cmd進入到當前目錄。然后執(zhí)行 python setup.py install 等待安裝完成
2.讀取pdf中的TXT代碼示例:
from pdfminer.converter import PDFPageAggregator from pdfminer.layout import LAParams from pdfminer.pdfparser import PDFParser, PDFDocument from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter from pdfminer.pdfdevice import PDFDevice # 可以使用此方法獲取網(wǎng)絡(luò)上的pdf from urllib.request import urlopen fp = urlopen("https://******/articles/800348152163.pdf") #獲取文檔對象 #fp = open("****.pdf", "rb") #創(chuàng)建一個一個與文檔關(guān)聯(lián)的解釋器 parser = PDFParser(fp) #PDF文檔的對象 doc = PDFDocument() #連接解釋器和文檔對象 parser.set_document(doc) doc.set_parser(parser) #初始化文檔,當前文檔沒有密碼,設(shè)為空字符串 doc.initialize("") #創(chuàng)建PDF資源管理器 resource = PDFResourceManager() #參數(shù)分析器 laparam = LAParams() #創(chuàng)建一個聚合器 device = PDFPageAggregator(resource, laparams=laparam) #創(chuàng)建PDF頁面解釋器 interpreter = PDFPageInterpreter(resource, device) #使用文檔對象得到頁面的集合 for page in doc.get_pages(): # 使用頁面解釋器讀取 interpreter.process_page(page) # 使用聚合器來獲得內(nèi)容 layout = device.get_result() for out in layout: if hasattr(out, "get_text"): print(out.get_text())
以上這篇python 使用pdfminer3k 讀取PDF文檔的例子就是小編分享給大家的全部內(nèi)容了,希望能給大家一個參考,也希望大家多多支持腳本之家。
相關(guān)文章
Python 批量驗證和添加手機號碼為企業(yè)微信聯(lián)系人
你是否也有過需要添加很多微信好友的時候,一個個輸入添加太麻煩了,本篇文章手把手教你用Python替我們完成這繁瑣的操作,大家可以在過程中查缺補漏,看看自己掌握程度怎么樣2021-10-10Python使用Redis實現(xiàn)作業(yè)調(diào)度系統(tǒng)(超簡單)
Redis作為內(nèi)存數(shù)據(jù)庫的一個典型代表,已經(jīng)在很多應(yīng)用場景中被使用,這里僅就Redis的pub/sub功能來說說怎樣通過此功能來實現(xiàn)一個簡單的作業(yè)調(diào)度系統(tǒng)。這里只是想展現(xiàn)一個簡單的想法,所以還是有很多需要考慮的東西沒有包括在這個例子中,比如錯誤處理,持久化等2016-03-03python?pandas?數(shù)據(jù)排序的幾種常用方法
這篇文章主要介紹了python?pandas數(shù)據(jù)排序的幾種常用方法,文章圍繞主題展開詳細的內(nèi)容介紹,具有一定的參考價值,需要的小伙伴可以參考一下2022-09-09