聽說你的爬蟲被封了?

一隻寫程式的猿發表於2019-04-23

原文網址 : https://juejin.im/post/5cbe71c9f265da03a54c1d29

如果你在爬蟲過程中有遇到“您的請求太過頻繁，請稍後再試”，或者說程式碼完全正確，可是爬蟲過程中突然就訪問不了，那麼恭喜你，你的爬蟲被對方識破了，輕則給予友好提示警告，嚴重的可能會對你的ip進行封禁，所以代理ip那就尤為重要了。今天我們就來談一下代理IP，去解決爬蟲被封的問題。

網上有許多代理ip，免費的、付費的。大多數公司爬蟲會買這些專業版，對於普通人來說，免費的基本滿足我們需要了，不過免費有一個弊端，時效性不強，不穩定，所以我們就需要對採集的ip進行一個簡單的驗證。

1.目標採集

本文主要針對西刺代理，這個網站很早之前用過，不過那個時候它還提供免費的api，現在api暫不提供了，我們就寫個簡單的爬蟲去採集。

開啟西刺代理，有幾個頁面，果斷選擇高匿代理。

Chrome瀏覽器右鍵檢查檢視network，不難發現，每個ip地址都在td標籤中，對於我們來說就簡單許多了，初步的想法就是獲取所有的ip，然後校驗可用性，不可用就剔除。

定義匹配規則

import re

ip_compile = re.compile(r'<td>(\d+\.\d+\.\d+\.\d+)</td>')  # 匹配IP
port_compile = re.compile(r'<td>(\d+)</td>')  # 匹配埠
複製程式碼

2.校驗這裡我使用淘寶ip地址庫檢驗可用性

2.1、關於淘寶IP地址庫

目前提供的服務包括： 1. 根據使用者提供的IP地址，快速查詢出該IP地址所在的地理資訊和地理相關的資訊，包括國家、省、市和運營商。 2. 使用者可以根據自己所在的位置和使用的IP地址更新我們的服務內容。我們的優勢： 1. 提供國家、省、市、縣、運營商全方位資訊，資訊維度廣，格式規範。 2. 提供完善的統計分析報表，省準確度超過99.8%，市準確度超過96.8%，資料質量有保障。

2.2、介面說明

請求介面（GET）： ip.taobao.com/service/get… 例：http://ip.taobao.com/service/getIpInfo2.php?ip=111.177.181.44
響應資訊：（json格式的）國家、省（自治區或直轄市）、市（縣）、運營商
返回資料格式：

{"code":0,"data":{"ip":"210.75.225.254","country":"\u4e2d\u56fd","area":"\u534e\u5317",
"region":"\u5317\u4eac\u5e02","city":"\u5317\u4eac\u5e02","county":"","isp":"\u7535\u4fe1",
"country_id":"86","area_id":"100000","region_id":"110000","city_id":"110000",
"county_id":"-1","isp_id":"100017"}}
複製程式碼

其中code的值的含義為，0：成功，1：失敗。

注意：為了保障服務正常執行，每個使用者的訪問頻率需小於10qps。我們先通過瀏覽器測試一下

輸入地址http://ip.taobao.com/service/getIpInfo2.php?ip=111.177.181.44
再次輸入一個地址http://ip.taobao.com/service/getIpInfo2.php?ip=112.85.168.98
程式碼操作

import requests

check_api = "http://ip.taobao.com/service/getIpInfo2.php?ip="
api = check_api + ip
try:
    response = requests.get(url=api, headers=api_headers, timeout=2)
    print("ip：%s 可用" % ip)
except Exception as e:
    print("此ip %s 已失效：%s" % (ip, e))
複製程式碼

3.程式碼

程式碼中加入了異常處理，其實自己手寫的demo寫不寫異常處理都可以，但是為了方便其他人除錯，建議在可能出現異常的地方加入異常處理。

import requests
import re
import random

from bs4 import BeautifulSoup

ua_list = [
    "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.109 Safari/537.36",
    "Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/62.0.3202.75 Safari/537.36",
    "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_6) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.119 Safari/537.36",
    "Mozilla / 5.0(Windows NT 6.1;WOW64) AppleWebKit / 537.36(KHTML, likeGecko) Chrome / 45.0.2454.101Safari / 537.36"
    ]


def ip_parse_xici(page):
    """

    :param page: 採集的頁數
    :return:
    """
    ip_list = []
    for pg in range(1, int(page)):
        url = 'http://www.xicidaili.com/nn/' + str(pg)
        user_agent = random.choice(ua_list)
        my_headers = {
            'Accept': 'text/html, application/xhtml+xml, application/xml;',
            'Accept-Encoding': 'gzip, deflate, sdch',
            'Accept-Language': 'zh-CN,zh;q=0.8',
            'Referer': 'http: // www.xicidaili.com/nn',
            'User-Agent': user_agent
        }
        try:
            r = requests.get(url, headers=my_headers)
            soup = BeautifulSoup(r.text, 'html.parser')
        except requests.exceptions.ConnectionError:
            print('ConnectionError')
        else:
            data = soup.find_all('td')
            # 定義IP和埠Pattern規則
            ip_compile = re.compile(r'<td>(\d+\.\d+\.\d+\.\d+)</td>')  # 匹配IP
            port_compile = re.compile(r'<td>(\d+)</td>')  # 匹配埠
            ips = re.findall(ip_compile, str(data))  # 獲取所有IP

            ports = re.findall(port_compile, str(data))  # 獲取所有埠
            check_api = "http://ip.taobao.com/service/getIpInfo2.php?ip="

            for i in range(len(ips)):
                if i < len(ips):
                    ip = ips[i]
                    api = check_api + ip
                    api_headers = {
                        'User-Agent': user_agent
                    }
                    try:
                        response = requests.get(url=api, headers=api_headers, timeout=2)
                        print("ip：%s 可用" % ip)
                    except Exception as e:
                        print("此ip %s 已失效：%s" % (ip, e))
                        del ips[i]
                        del ports[i]
            ips_usable = ips
            ip_list += [':'.join(n) for n in zip(ips_usable, ports)]  # 列表生成式
            print('第{}頁ip採集完成'.format(pg))
    print(ip_list)


if __name__ == '__main__':
    xici_pg = input("請輸入需要採集的頁數：")
    ip_parse_xici(page=xici_pg)
複製程式碼

執行程式碼：

4.為你的爬蟲加入代理ip

建議大家可以把採集的ip存入資料庫，這樣每次爬蟲的時候直接呼叫即可，順便提一下程式碼中怎麼加入代理ip。

import requests

url = 'www.baidu.com'
headers = {
    "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_6) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.119 Safari/537.36",
}
proxies = {
    "http": "http://111.177.181.44:9999",
    # "https": "https://111.177.181.44:9999",
}

res = requests.get(url=url, headers=headers, proxies=proxies)
複製程式碼

好了，媽媽再也不擔心我爬蟲被封了

你有自己寫過爬蟲的程式嗎？說說你對爬蟲和反爬蟲的理解？
2024-11-28
爬蟲
聽說你好不容易寫了個爬蟲，結果沒抓幾個就被封了？（附工具）
2019-02-16
爬蟲
你的爬蟲為什麼會被檢測到？
2022-05-05
爬蟲
防止爬蟲被反爬的幾個主要策略
2021-12-15
爬蟲
防止爬蟲被限制的三種方法
2022-06-13
爬蟲
聽說你會 Python ？
2018-07-19
Python
你有聽說過“分詞”嗎？說說你對它的理解
2024-11-28
分詞
（python）爬蟲----八個專案帶你進入爬蟲的世界
2021-07-17
Python爬蟲
python爬蟲學習：爬蟲QQ說說並生成詞雲圖，回憶滿滿
2018-05-13
Python爬蟲
導致爬蟲被限制的原因有哪些？
2022-05-31
爬蟲
爬蟲是如何被網站識別的？
2022-04-28
爬蟲網站
如何防止網路爬蟲被限制？
2022-05-17
爬蟲
爬取資料時防止爬蟲被限制的四種方法
2022-06-07
爬蟲
【故障公告】被放出的 Bing 爬蟲，又被爬當機的園子
2023-04-26
爬蟲
【Python學習】爬蟲爬蟲爬蟲爬蟲~
2018-05-03
Python爬蟲
Python 第一個爬蟲，爬取 147 小說
2020-05-08
Python爬蟲
Python原始碼怎麼讀，聽聽頂級爬蟲工程師的建議
2020-02-19
Python原始碼爬蟲工程師
你的部落格可能被爬了
2019-07-25
聽說你的資源被盜用了，那你知道 Nginx 怎麼防盜鏈嗎？
2020-06-14
Nginx
python爬蟲總是爬不到資料，你需要解決反爬蟲了
2020-06-26
Python爬蟲
用PYTHON爬蟲簡單爬取網路小說
2021-09-11
Python爬蟲
如何用python爬蟲下載小說？
2021-09-11
Python爬蟲
帶你入門Python爬蟲，8個常用爬蟲技巧盤點
2018-08-06
Python爬蟲
分散式爬蟲很難嗎？用Python寫一個小白也能聽懂的分散式知乎爬蟲
2018-05-04
分散式爬蟲Python
爬蟲行動被限制？一招破解！
2018-11-13
爬蟲
3款你必須知道的爬蟲工具
2018-05-03
爬蟲
Python爬蟲帶你瞭解網友們對周董新歌《說好不哭》的看法
2021-09-11
Python爬蟲
爬蟲：多程式爬蟲
2021-05-19
爬蟲
python爬蟲---網頁爬蟲，圖片爬蟲，文章爬蟲，Python爬蟲爬取新聞網站新聞
2019-01-04
Python爬蟲網頁網站
Python超簡單超基礎的免費小說爬蟲！爬蟲入門從這開始！
2020-10-23
Python爬蟲
Java爬蟲與Python爬蟲的區別？
2023-10-25
Java爬蟲Python
導致爬蟲使用代理IP卻仍被限制的原因
2022-07-07
爬蟲
python爬蟲之抓取小說(逆天邪神)
2022-03-10
Python爬蟲
聽說同學你搞不懂Java的LinkedHashMap，可笑
2020-08-12
JavaHashMap
通用爬蟲與聚焦爬蟲
2023-04-18
爬蟲
爬蟲--Scrapy簡易爬蟲
2020-10-07
爬蟲
Python爬蟲（1.爬蟲的基本概念）
2018-04-20
Python爬蟲
Python爬蟲之路-chrome在爬蟲中的使用
2021-01-04
Python爬蟲Chrome

聽說你的爬蟲被封了?

1.目標採集

2.校驗 這裡我使用淘寶ip地址庫檢驗可用性

3.程式碼

4.為你的爬蟲加入代理ip

相關文章

2.校驗這裡我使用淘寶ip地址庫檢驗可用性