我用了30行程式碼，爬了知乎好多妹子

JoinWe發表於2017-09-25

行程

寫一個爬蟲有多簡單？答案是：不到30行程式碼

我用了不到30行程式碼，爬了知乎好多妹子圖！！！

跟著我一步一步來，你也可以簡簡單單建立一個爬蟲。

目標

爬蟲的第一步就是決定要爬些什麼。作為一個屌的不能再屌的屌絲，當然要爬妹子！！！

每當這個時候，就要拿出我的儲備了。欲罷不能的大美妞，要說妹子圖的質量，還是得知乎啊。

分析

目標有了，我們就要先分析一下。頁面結構。在頁面中找任一個爬取目標，點選滑鼠右鍵，選擇【檢查】選項。便會開啟瀏覽器的控制檯，並定位到我們的目標圖片的節點上。如下圖：

圖中的img標籤就是我們的爬取目標，我們可以明確的看到 data-original 元素的內容與 src 元素的內容都是圖片的地址。經過驗證， src 元素的內容可能會是縮圖地址，所以我們放棄 src 選擇 data-original。

以上就是我們要分析的部分，接下來就是程式碼。

編碼

新建專案

這裡我們使用 maven 作為專案的依賴管理工具。

新建一個 maven 專案，並在 pom.xml 中引入依賴。

<dependencies>
        <dependency>
            <groupId>com.github.zhangyingwei</groupId>
            <artifactId>cockroach</artifactId>
            <version>1.0-Alpha</version>
        </dependency>
        <dependency>
            <groupId>log4j</groupId>
            <artifactId>log4j</artifactId>
            <version>1.2.17</version>
        </dependency>
        <dependency>
            <groupId>com.squareup.okhttp3</groupId>
            <artifactId>okhttp</artifactId>
            <version>3.8.1</version>
        </dependency>
        <!--json-lib-->
        <dependency>
            <groupId>net.sf.json-lib</groupId>
            <artifactId>json-lib</artifactId>
            <version>2.4</version>
            <classifier>jdk15</classifier>
        </dependency>
        <!-- https://mvnrepository.com/artifact/org.jsoup/jsoup -->
        <dependency>
            <groupId>org.jsoup</groupId>
            <artifactId>jsoup</artifactId>
            <version>1.8.3</version>
        </dependency>
    </dependencies>複製程式碼

這裡我們使用了爬蟲框架 cockroach 。並引入了 log4j 作為日誌框架，okhttp3 作為 http 客戶端，json-lib 作為 json 解析工具，以及 jsoup 作為 html 解析工具。

建立包結構如下

store 主要存放頁面解析以及結果儲存相關類
utils 主要存放專案中用到的相關工具類
App.java 專案入口

編碼

程式主入口 App.java

public class App {
    public static void main(String[] args) throws InstantiationException, IllegalAccessException, InterruptedException {
        CockroachConfig config = new CockroachConfig().setAppName("知乎上的妹子們").setThread(10).setStore(ZhihuGirlsStore.class);
        TaskQueue queue = TaskQueue.of();
        getPageFrom(queue);
        CockroachContext context = new CockroachContext(config);
        context.start(queue);
    }

    private static void getPageFrom(TaskQueue queue) throws InterruptedException {
        String basePath = "https://www.zhihu.com/collection/72114548?page=";
        for (int i = 1; i <= 68; i++) {
            queue.push(new Task(basePath + i));
        }
    }
}複製程式碼

在上邊的程式碼中，我們一共分為5步。

我們建立了一個名稱為 知乎上的妹子們 的爬蟲，使用了 10 個執行緒來爬取內容，並指定了頁面解析以及結果儲存的處理類為 ZhihuGirlsStore.class
建立了一個預設長度的任務佇列
初始化任務到任務佇列中
建立了一個 Cockroach 爬蟲上下文物件
啟動爬蟲

頁面解析以及儲存 ZhihuGirlsStore.java

public class ZhihuGirlsStore implements IStore {
    public void store(TaskResponse taskResponse) throws Exception {
        if (taskResponse.getTask().getGroup().equals("img")) {
            byte[] bytes = taskResponse.getResponse().body().bytes();
            ImageUtils.save(bytes);
        } else {
            Elements imgs = taskResponse.select(".zm-item-answer").select("img");
            imgs.stream().map(element -> element.attr("data-original")).forEach(url -> {
                try {
                    taskResponse.getQueue().push(new Task(url, "img"));
                } catch (Exception e) {
                    e.printStackTrace();
                }
            });
        }
    }
}複製程式碼

Cockroach 的 task 中為我們提供了 group 欄位來標識每一個任務，如果不設定，任務預設的 group 為 default 。
在本爬蟲程式中，我們的 task 一共可分為兩種，一種是解析頁面得到頁面中的圖片地址，另外一種就是爬取圖片內容。
這裡我們通過 group 欄位來區分兩種任務，具體操作就是在解析到圖片地址並新增到佇列中的時候，給 task 設定 group 為 img，這樣我們在收到一個結果的時候，就可以通過 task 中的 group 欄位來區分我們要做何種操作（解析頁面 / 儲存圖片）。

圖片儲存 ImageUtils.java

public class ImageUtils {
    public static void save(byte[] bytes) throws IOException {
        String fileName = UUID.randomUUID().toString();
        String dirpath = "meizhi2";
        File dir = new File(dirpath);
        if(!dir.exists()){
            dir.mkdirs();
        }
        FileOutputStream outputStream = new FileOutputStream(dirpath + "/" + fileName + ".jpg");
        outputStream.write(bytes);
        outputStream.close();
        System.out.println("save image:" + fileName);
    }
}複製程式碼

以上程式碼就是把接收到的二進位制圖片內容儲存為圖片。圖片的名稱使用一個隨機的 UUID 值。

沒錯老鐵們，以上就是我們的全部的程式碼。包括方法宣告在內的有效程式碼不到30行！！！

別忘了最後一步。執行 App.java 中的 main 方法，接下來就休息休息吧。。。

60行程式碼爬取知乎神回覆
2018-11-15
行程
60行程式碼爬取知乎“神回覆”，句句戳中淚點
2019-03-06
行程
90行程式碼爬取我的微博
2017-07-03
行程
我膨脹了，測試必要商城小程式，用了3種方式！:)
2020-12-05
我膨脹了，測試必要商城小程式，用了 3 種方式！:)
2020-12-05
基於node的微小爬蟲——扒了一下知乎
2017-06-16
爬蟲
為了炒作，我們濫用了人工智慧
2019-05-07
人工智慧
純後端如何寫前端？我用了低程式碼平臺
2022-03-18
後端前端
慕爾名，我的“知乎”小程式（1）
2018-06-11
誰動了我的程式碼！?
2022-02-14
使用了lua-resty-http庫進行爬蟲
2023-10-27
RESTHTTP爬蟲
Scrapy框架爬取海量妹子圖
2018-08-30
框架
python爬蟲如何爬知乎的話題？
2019-02-16
Python爬蟲
Httprunner3.x 版本更新了好多
2020-08-20
HTTP
python 爬蟲——登入知乎
2016-01-28
Python爬蟲
nodejs 30行程式碼爬豆瓣電影資料
2017-12-14
NodeJS行程
爬蟲專案（一）爬蟲+jsoup輕鬆爬知乎
2017-02-07
爬蟲JS
Node.js爬取妹子圖-crawler爬蟲的使用
2018-04-04
Node.js爬蟲
爬了知乎 200 萬資料，圖說程式設計師都喜歡去哪兒工作
2017-12-03
程式設計師
我30歲了，轉行學程式設計可以嗎? 排除法告訴你答案
2019-01-08
程式設計
我30歲了，轉行學程式設計可以嗎?排除法告訴你答案
2019-01-08
程式設計
我已經寫了48年程式碼了，我感覺我還能寫下去
2015-11-15
寫了 50 萬行 Go 程式碼後，我明白這些道理
2021-06-17
Go
幾行程式碼養只貓，心情瞬間好多了
2019-06-21
行程
趣圖：我在你程式碼中下毒了
2018-02-05
大家都覺得PSV這個功能雞肋，但是好多遊戲都用了
2021-05-27
遊戲
從系統設計到擼程式碼？我用了這些方法和工具
2024-04-19
分散式爬蟲之知乎使用者資訊爬取
2018-08-31
分散式爬蟲
自從用了 Alibaba COLA 架構，程式碼再也不怕腐爛了！
2023-05-09
架構
知乎專案程式碼閱後總結
2018-12-13
5行程式碼就能入門爬蟲？
2019-02-17
行程爬蟲
Python爬蟲新手教程：知乎文章圖片爬取器
2019-07-20
Python爬蟲
今天好多人 phpstrom 編譯器註冊碼失效了，最新可用註冊碼
2019-12-24
PHP編譯
我用了20年ERP系統，但是用它做報表，我卻後悔了
2020-11-17
用了組合式 (Composition) API 後程式碼變得更亂了，怎麼辦？
2024-08-02
API
爬蟲福利----妹子圖網MM批量下載
2020-01-06
爬蟲
教你用Python爬取妹子圖APP
2018-08-30
PythonAPP
我也 30 了，來談談程式設計師的迷茫年齡
2017-03-28
程式設計師

我用了30行程式碼，爬了知乎好多妹子

目標

分析

編碼

新建專案

編碼

相關文章