【爬蟲工具】下載部落格轉成Markdown的形式

我的孫女叫小芳發表於2019-02-16

簡單的爬蟲工具

下載部落格,並轉成Markdown的形式

為什麼要寫這個工具

主要是為了收集好的網上資源,每次看到一篇好的文章就像儲存下來,但是儲存網頁的可讀性太差了,如果轉換成Markdown的形式就很舒服。但是網頁中會有許多無聊的標籤干擾,於是寫個簡單的工具

使用的python庫

  • beautifulsoup4
  • requests
  • html2text

目錄

  • csdn.py csdn部落格爬蟲
  • jianshu.py 簡書部落格爬蟲
  • juejin.py 掘金文章爬蟲
  • segmentfault.py segmentfault文章爬蟲

使用方法舉例

import html2md

url_list = [
        `http://blog.csdn.net/qq_37482544/article/details/63720726`, # csdn
        `https://www.jianshu.com/p/b6220e99df2d`, # jianshu
        `https://juejin.im/post/5a68437b6fb9a01ca47aabc6`, # juejin
        `https://segmentfault.com/a/1190000011929414`, # segmentfault
        `http://www.voidcn.com/article/p-giqfrkhb-bbr.html`, # 其他
        `https://www.cnblogs.com/zxqstrong/p/4789105.html`
    ]
for url in url_list:
    checkSite(url)

專案地址

https://github.com/No-96/Feng…

相關文章