10個高效的Python爬蟲框架

Michelle170916發表於2024-09-27

原文網址 : https://www.cnblogs.com/Michelle0916/p/18435930

Python爬蟲框架

前言
小型爬蟲需求，requests庫+bs4庫就能解決；大型爬蟲資料，尤其涉及非同步抓取、內容管理及後續擴充套件等功能時，就需要用到爬蟲框架了。

下面介紹了10個爬蟲框架，大家可以學習使用！

Scrapy scrapy

官網：https://scrapy.org/

scrapy中文文件：https://www.osgeo.cn/scrapy/intro/o

Scrapy是一個為了爬取網站資料，提取結構性資料而編寫的應用框架。可以應用在包括資料探勘，資訊處理或儲存歷史資料等一系列的程式中。

其最初是為了頁面抓取 (更確切來說, 網路抓取 )所設計的，也可以應用在獲取API所返回的資料(例如 Amazon Associates Web Services ) 或者通用的網路爬蟲。

Scrapy框架是一套比較成熟的Python爬蟲框架，可以高效的爬取web頁面並提取出結構化資料，用這個框架可以輕鬆爬下來如亞馬遜商品資訊之類的資料。

PySpider

PySpider 中文網：http://www.pyspider.cn

PySpider 官網：http://docs.pyspider.org

PySpider 演示：http://demo.pyspider.org

PySpider 原始碼：https://github.com/binux/pyspider

PySpider是一個國人編寫的強大的網路爬蟲系統並帶有強大的WebUI，其用python實現的功能強大的網路爬蟲系統，能在瀏覽器介面上進行指令碼的編寫，功能的排程和爬取結果的實時檢視，後端使用常用的資料庫進行爬取結果的儲存，還能定時設定任務與任務優先順序等。

pyspider 是一個用python實現的功能強大的網路爬蟲系統，能在瀏覽器介面上進行指令碼的編寫，功能的排程和爬取結果的實時檢視，後端使用常用的資料庫進行爬取結果的儲存，還能定時設定任務與任務優先順序等。

Crawley

Crawley可以高速爬取對應網站的內容，支援關係和非關聯式資料庫，資料可以匯出為JSON、XML等。

Portia

官網：https://portia.scrapinghub.com/

Portia是一個開源視覺化爬蟲工具，可讓您在不需要任何程式設計知識的情況下爬取網站！簡單地註釋您感興趣的頁面，Portia將建立一個蜘蛛來從類似的頁面提取資料。其主要特徵是： Portia是一款不需要任何程式設計知識就能爬取網頁的爬蟲框架，只要將相關資訊填好之後，就可以爬取網站了。基於 scrapy 核心

視覺化爬取內容，不需要任何開發專業知識

動態匹配相同模板的內容

5. Newspaper

官方文件：Quickstart - newspaper 0.0.2 documentation

github地址：https://github.com/codelucas/newspaper

Newspaper可以用來提取新聞、文章和內容分析。使用多執行緒，支援10多種語言等。作者從requests庫的簡潔與強大得到靈感，使用python開發的可用於提取文章內容的程式。支援10多種語言並且所有的都是unicode編碼。 Newspaper框架是一個用來提取新聞、文章以及內容分析的Python爬蟲框架。

Beautiful Soup

官方文件：Beautiful Soup 4.4.0 文件

Beautiful Soup 是一個可以從HTML或XML檔案中提取資料的Python庫.它能夠透過你喜歡的轉換器實現慣用的文件導航,查詢,修改文件的方式.Beautiful Soup會幫你節省數小時甚至數天的工作時間。這個我是使用的特別頻繁的。在獲取html元素，都是bs4完成的。

Beautiful Soup整合了一些常用的爬蟲需求，可以從HTML或XML檔案中提取資料的Python庫。它能夠透過你喜歡的轉換器實現慣用的文件導航、查詢、修改文件的方式，會幫你節省數小時甚至數天的工作時間。

Grab

官網：https://grablib.org/en/latest/

Grab是一個用於構建Web刮板的Python框架。藉助Grab，您可以構建各種複雜的網頁抓取工具，從簡單的5行指令碼到處理數百萬個網頁的複雜非同步網站抓取工具。 Grab提供一個API用於執行網路請求和處理接收到的內容，例如與HTML文件的DOM樹進行互動。

Grab可以構建各種複雜的網頁抓取工具，從簡單的5行指令碼到處理數百萬個網頁的複雜非同步網站抓取工具。

Cola

github地址：https://github.com/qinxuye/cola

Cola是一個分散式的爬蟲框架，對於使用者來說，只需編寫幾個特定的函式，而無需關注分散式執行的細節。任務會自動分配到多臺機器上，整個過程對使用者是透明的。

Selenium

官網：https://www.selenium.dev/

Selenium 是自動化測試工具。它支援各種瀏覽器，包括 Chrome，Safari，Firefox 等主流介面式瀏覽器，如果在這些瀏覽器裡面安裝一個 Selenium 的外掛，可以方便地實現Web介面的測試. Selenium 支援瀏覽器驅動。

Selenium支援多種語言開發，比如 Java，C，Ruby等等，PhantomJS 用來渲染解析JS，Selenium 用來驅動以及與 Python 的對接，Python 進行後期的處理。

它支援各種主流介面式瀏覽器，如果在這些瀏覽器裡面安裝一個 Selenium 的外掛，可以方便地實現Web介面的測試。

Python-goose

github地址：https://github.com/goose3/goose

Python-goose框架可提取包括文章內容、文章圖片、文章中嵌入的任何影片、元描述、元標籤。

8個高效的Python爬蟲框架分享！
2021-12-08
Python爬蟲框架
【推薦】最高效的Python爬蟲框架！
2021-05-25
Python爬蟲框架
8個最高效的Python爬蟲框架，你用過幾個？
2018-07-14
Python爬蟲框架
六種高效爬蟲框架
2022-06-07
爬蟲框架
8個Python爬蟲框架，你知道幾個?
2021-07-21
Python爬蟲框架
python爬蟲Scrapy框架
2018-11-21
Python爬蟲框架
Python爬蟲—Scrapy框架
2020-10-04
Python爬蟲框架
【總結】10款Python爬蟲框架！Python入門
2021-05-20
Python爬蟲框架
高效率爬蟲框架之 pyspider
2018-07-06
爬蟲框架IDE
2個月精通Python爬蟲——3大爬蟲框架+6場實戰+反爬蟲技巧+分散式爬蟲
2018-06-28
Python爬蟲框架分散式
什麼是Python爬蟲？Python爬蟲常用框架有哪些？
2020-12-24
Python爬蟲框架
Python爬蟲深造篇(四)——Scrapy爬蟲框架啟動一個真正的專案
2021-11-08
Python爬蟲框架
什麼是爬蟲？Python爬蟲框架有哪些？
2022-04-18
爬蟲Python框架
常用python爬蟲框架整理
2018-07-16
Python爬蟲框架
Python爬蟲的框架有哪些？推薦這五個！
2021-05-07
Python爬蟲框架
Python爬蟲教程-30-Scrapy 爬蟲框架介紹
2018-09-06
Python爬蟲框架
python網路爬蟲（14）使用Scrapy搭建爬蟲框架
2019-07-27
Python爬蟲框架
Python微型非同步爬蟲框架
2019-02-16
Python非同步爬蟲框架
python爬蟲初探--第一個python爬蟲專案
2018-05-18
Python爬蟲
python 爬蟲對 scrapy 框架的認識
2020-07-17
Python爬蟲框架
Python爬蟲教程-31-建立 Scrapy 爬蟲框架專案
2018-09-04
Python爬蟲框架
【Python學習】爬蟲爬蟲爬蟲爬蟲~
2018-05-03
Python爬蟲
Python爬蟲 | 一條高效的學習路徑
2021-09-09
Python爬蟲
Python爬蟲 --- 2.3 Scrapy 框架的簡單使用
2018-12-19
Python爬蟲框架
如何高效的學習Python爬蟲技術？Python入門
2021-05-18
Python爬蟲
python網路爬蟲_Python爬蟲：30個小時搞定Python網路爬蟲視訊教程
2020-10-21
Python爬蟲
python爬蟲-33個Python爬蟲專案實戰(推薦)
2020-10-28
Python爬蟲
Python相關爬蟲的框架有哪些?Python知識
2020-09-24
Python爬蟲框架
Python爬蟲和java爬蟲哪個效率高
2023-10-12
Python爬蟲Java
分享個人開源爬蟲框架
2019-03-01
爬蟲框架
（python）爬蟲----八個專案帶你進入爬蟲的世界
2021-07-17
Python爬蟲
Python3爬蟲（十八） Scrapy框架（二）
2018-10-26
Python爬蟲框架
Python爬蟲 ---scrapy框架初探及實戰
2020-04-16
Python爬蟲框架
Python爬蟲：流程框架和常用模組
2021-09-11
Python爬蟲框架
Python中爬蟲框架或模組的區別！
2021-04-30
Python爬蟲框架
Python中爬蟲框架或模組的區別
2021-04-07
Python爬蟲框架
聊聊 Python 的應用 - 健壯高效的網路爬蟲
2018-10-19
Python爬蟲
打造高效的分散式爬蟲系統：利用Scrapy框架實現
2023-10-12
分散式爬蟲框架

10個高效的Python爬蟲框架

相關文章