Python爬蟲入門（2）：爬蟲基礎瞭解

崔慶才發表於2015-04-25

1.什麼是爬蟲

爬蟲，即網路爬蟲，大家可以理解為在網路上爬行的一直蜘蛛，網際網路就比作一張大網，而爬蟲便是在這張網上爬來爬去的蜘蛛咯，如果它遇到資源，那麼它就會抓取下來。想抓取什麼？這個由你來控制它咯。

比如它在抓取一個網頁，在這個網中他發現了一條道路，其實就是指向網頁的超連結，那麼它就可以爬到另一張網上來獲取資料。這樣，整個連在一起的大網對這之蜘蛛來說觸手可及，分分鐘爬下來不是事兒。

2.瀏覽網頁的過程

在使用者瀏覽網頁的過程中，我們可能會看到許多好看的圖片，比如 http://image.baidu.com/ ，我們會看到幾張的圖片以及百度搜尋框，這個過程其實就是使用者輸入網址之後，經過DNS伺服器，找到伺服器主機，向伺服器發出一個請求，伺服器經過解析之後，傳送給使用者的瀏覽器 HTML、JS、CSS 等檔案，瀏覽器解析出來，使用者便可以看到形形色色的圖片了。

因此，使用者看到的網頁實質是由 HTML 程式碼構成的，爬蟲爬來的便是這些內容，通過分析和過濾這些 HTML 程式碼，實現對圖片、文字等資源的獲取。

3.URL的含義

URL，即統一資源定位符，也就是我們說的網址，統一資源定位符是對可以從網際網路上得到的資源的位置和訪問方法的一種簡潔的表示，是網際網路上標準資源的地址。網際網路上的每個檔案都有一個唯一的URL，它包含的資訊指出檔案的位置以及瀏覽器應該怎麼處理它。

URL的格式由三部分組成：
①第一部分是協議(或稱為服務方式)。
②第二部分是存有該資源的主機IP地址(有時也包括埠號)。
③第三部分是主機資源的具體地址，如目錄和檔名等。

爬蟲爬取資料時必須要有一個目標的URL才可以獲取資料，因此，它是爬蟲獲取資料的基本依據，準確理解它的含義對爬蟲學習有很大幫助。

4. 環境的配置

學習Python，當然少不了環境的配置，最初我用的是Notepad++，不過發現它的提示功能實在是太弱了，於是，在Windows下我用了 PyCharm，在Linux下我用了Eclipse for Python，另外還有幾款比較優秀的IDE，大家可以參考這篇文章學習Python推薦的IDE 。好的開發工具是前進的推進器，希望大家可以找到適合自己的IDE

下一節，我們就正式步入 Python 爬蟲學習的殿堂了，小夥伴準備好了嘛？

打賞支援我寫出更多好文章，謝謝！
打賞作者

打賞支援我寫出更多好文章，謝謝！

任選一種支付方式

Python爬蟲入門（2）：爬蟲基礎瞭解

爬蟲入門基礎-Python
2020-05-09
爬蟲Python
爬蟲（1） - 爬蟲基礎入門理論篇
2022-06-30
爬蟲
Python爬蟲入門
2020-11-30
Python爬蟲
Python：基礎&爬蟲
2023-10-29
Python爬蟲
【爬蟲】python爬蟲從入門到放棄
2018-12-20
爬蟲Python
什麼是Python爬蟲？python爬蟲入門難嗎？
2021-12-27
Python爬蟲
python-爬蟲入門
2024-09-22
Python爬蟲
Python分散式爬蟲(三) - 爬蟲基礎知識
2019-03-21
Python分散式爬蟲
Python爬蟲之路-爬蟲基礎知識(理論)
2021-01-04
Python爬蟲
python爬蟲基礎概念
2020-05-11
Python爬蟲
python_爬蟲基礎
2024-07-30
Python爬蟲
簡單瞭解python爬蟲
2020-10-13
Python爬蟲
【Python學習】爬蟲爬蟲爬蟲爬蟲~
2018-05-03
Python爬蟲
Python爬蟲入門，8個常用爬蟲技巧盤點
2018-12-12
Python爬蟲
python網路爬蟲（9）構建基礎爬蟲思路
2019-06-09
Python爬蟲
Python爬蟲入門教程 50-100 Python3爬蟲爬取VIP視訊-Python爬蟲6操作
2019-02-14
Python爬蟲
爬蟲入門
2024-04-13
爬蟲
爬蟲基礎
2019-03-30
爬蟲
為什麼學習python及爬蟲，Python爬蟲[入門篇]？
2018-11-21
Python爬蟲
python3 爬蟲入門
2021-09-09
Python爬蟲
Python爬蟲基礎之selenium
2022-07-13
Python爬蟲
python爬蟲基礎之urllib
2020-11-26
Python爬蟲
python爬蟲2
2019-01-07
Python爬蟲
Python爬蟲--2
2024-03-24
Python爬蟲
[Python3網路爬蟲開發實戰] 2-爬蟲基礎 2-網頁基礎
2018-03-08
Python爬蟲網頁
不踩坑的Python爬蟲：Python爬蟲開發與專案實戰，從爬蟲入門 Python
2021-12-17
Python爬蟲
Python超簡單超基礎的免費小說爬蟲！爬蟲入門從這開始！
2020-10-23
Python爬蟲
爬蟲開發知識入門基礎（1）
2020-06-22
爬蟲
帶你入門Python爬蟲，8個常用爬蟲技巧盤點
2018-08-06
Python爬蟲
Python爬蟲入門【9】：圖蟲網多執行緒爬取
2019-07-31
Python爬蟲執行緒
Python爬蟲入門【5】：27270圖片爬取
2019-07-30
Python爬蟲
python爬蟲之 BeautifulSoup庫入門
2019-12-09
Python爬蟲
Python3爬蟲入門(一)
2020-12-05
Python爬蟲
爬蟲基礎---1
2019-01-06
爬蟲
爬蟲基礎篇
2020-07-31
爬蟲
python爬蟲---網頁爬蟲，圖片爬蟲，文章爬蟲，Python爬蟲爬取新聞網站新聞
2019-01-04
Python爬蟲網頁網站
【0基礎學爬蟲】爬蟲基礎之資料儲存
2023-04-14
爬蟲
【0基礎學爬蟲】爬蟲基礎之檔案儲存
2023-04-07
爬蟲
Python爬蟲入門教程 2-100 妹子圖網站爬取
2018-12-13
Python爬蟲網站

Python爬蟲入門（2）：爬蟲基礎瞭解

1.什麼是爬蟲

2.瀏覽網頁的過程

3.URL的含義

4. 環境的配置

打賞支援我寫出更多好文章，謝謝！

相關文章