好程式設計師Python學習路線之python爬蟲入門
好程式設計師 Python 學習路線之 python 爬蟲入門 , 隨著網路的迅速發展,全球資訊網成為大量資訊的載體,如何有效地提取並利用這些資訊成為一個巨大的挑戰。搜尋引擎 (Search Engine) ,例如傳統的通用搜尋引擎 AltaVista , Yahoo! 和 Google 等,作為一個輔助人們檢索資訊的工具成為使用者訪問全球資訊網的入口和指南。但是,這些通用性搜尋引擎也存在著一定的侷限性 .
1. 什麼是爬蟲,即網路爬蟲,大家可以理解為在網路上爬行的一直蜘蛛,網際網路就比作一張大網,而爬蟲便是在這張網上爬來爬去的蜘蛛咯,如果它遇到資源,那麼它就會抓取下來。想抓取什麼?這個由你來控制它咯。
比如它在抓取一個網頁,在這個網中他發現了一條道路,其實就是指向網頁的超連結,那麼它就可以爬到另一張網上來獲取資料。這樣,整個連在一起的大網對這之蜘蛛來說觸手可及,分分鐘爬下來不是事兒。
2. 瀏覽網頁的過程
在使用者瀏覽網頁的過程中,我們可能會看到許多好看的圖片,我們會看到幾張的圖片以及百度搜尋框,這個過程其實就是使用者輸入網址之後,經過 DNS 伺服器,找到伺服器主機,向伺服器發出一個請求,伺服器經過解析之後,傳送給使用者的瀏覽器 HTML 、 JS 、 CSS 等檔案,瀏覽器解析出來,使用者便可以看到形形色色的圖片了。
因此,使用者看到的網頁實質是由 HTML 程式碼構成的,爬蟲爬來的便是這些內容,透過分析和過濾這些 HTML 程式碼,實現對圖片、文字等資源的獲取。
3.URL 的含義
URL ,即統一資源定位符,也就是我們說的網址,統一資源定位符是對可以從網際網路上得到的資源的位置和訪問方法的一種簡潔的表示,是網際網路上標準資源的地址。網際網路上的每個檔案都有一個唯一的 URL ,它包含的資訊指出檔案的位置以及瀏覽器應該怎麼處理它。
URL 的格式由三部分組成:
①第一部分是協議 ( 或稱為服務方式 ) 。
②第二部分是存有該資源的主機 IP 地址 ( 有時也包括埠號 ) 。
③第三部分是主機資源的具體地址,如目錄和檔名等。
爬蟲爬取資料時必須要有一個目標的 URL 才可以獲取資料,因此,它是爬蟲獲取資料的基本依據,準確理解它的含義對爬蟲學習有很大幫助。
4. 環境的配置
學習 Python ,當然少不了環境的配置,最初我用的是 Notepad++ ,不過發現它的提示功能實在是太弱了,於是,在 Windows 下我用了 PyCharm ,在 Linux 下我用了 Eclipse for Python ,另外還有幾款比較優秀的 IDE.
來自 “ ITPUB部落格 ” ,連結:http://blog.itpub.net/69913892/viewspace-2653690/,如需轉載,請註明出處,否則將追究法律責任。
相關文章
- 好程式設計師Python培訓分享零基礎Python爬蟲學習線路程式設計師Python爬蟲
- 好程式設計師分享Python從入門到精通最佳學習路線程式設計師Python
- 好程式設計師Python培訓分享Python之初識網路爬蟲程式設計師Python爬蟲
- 學習Python爬蟲難嗎?入門好學嗎?Python爬蟲
- Python爬蟲入門學習線路圖2019最新版(附Python爬蟲視訊教程)Python爬蟲
- 好程式設計師Java學習路線分享Redis快速入門程式設計師JavaRedis
- 為什麼學習python及爬蟲,Python爬蟲[入門篇]?Python爬蟲
- 好程式設計師Python培訓分享Python爬蟲工具列表大全程式設計師Python爬蟲
- 好程式設計師Python培訓分享Python爬蟲相關框架程式設計師Python爬蟲框架
- 好程式設計師Python學習路線分享用pprint代替print程式設計師Python
- 好程式設計師Python學習路線分享Beeprint怎麼用程式設計師Python
- 好程式設計師Python培訓分享網路爬蟲的分類程式設計師Python爬蟲
- 好程式設計師Java學習路線之集程式設計師Java
- python程式設計真的好學嗎?python入門Python程式設計
- 如何學習Python?Python學習入門路線Python
- 好程式設計師Python學習路線分享Linux和資料庫部分程式設計師PythonLinux資料庫
- 如何高效的學習Python爬蟲技術?Python入門Python爬蟲
- 好程式設計師Java學習路線之SpringMVC之基本配置程式設計師JavaSpringMVC
- python爬蟲 之 BeautifulSoup庫入門Python爬蟲
- Python爬蟲學習線路圖丨Python爬蟲需要掌握哪些知識點Python爬蟲
- Python爬蟲入門Python爬蟲
- 好程式設計師Python學習路線分享實現快速排序演算法程式設計師Python排序演算法
- Python網路爬蟲4 - scrapy入門Python爬蟲
- 北郵《Python程式設計與實踐》——爬蟲學習Python程式設計爬蟲
- 好程式設計師大資料培訓分享Hadoop入門學習線路圖程式設計師大資料Hadoop
- python入門之爬蟲工具有哪些?Python爬蟲
- 【Python學習】爬蟲爬蟲爬蟲爬蟲~Python爬蟲
- 好程式設計師大資料學習路線之mapreduce概述程式設計師大資料
- 好程式設計師Java學習路線分享MyBatis之Spring整合程式設計師JavaMyBatisSpring
- 好程式設計師Java學習路線分享MyBatis之基本使用程式設計師JavaMyBatis
- 好程式設計師Java學習路線分享SpringMVC之MVC概述程式設計師JavaSpringMVC
- Python爬蟲入門學習實戰專案(一)Python爬蟲
- 好程式設計師Java學習路線JSP物件程式設計師JavaJS物件
- 好程式設計師Java學習路線分享SpringCloud程式設計師JavaSpringGCCloud
- python-爬蟲入門Python爬蟲
- 好程式設計師Python培訓分享Python入門基礎知識程式設計師Python
- 好程式設計師Java學習路線之Spring框架之動態代理程式設計師JavaSpring框架
- 好程式設計師Python培訓分享python中爬蟲常用到的正規表示式程式設計師Python爬蟲