HtmlParse:一款超輕量級的HTML檔案解析和爬取工具

一隻會鏟史的貓發表於2022-06-14

HtmlParse 是一款基於windwos平臺的HTML文件解析工具,可快速構建DOM樹,從而輕鬆實現網頁元素的爬取工作。DOM樹就是一個HTML文件的節點樹,每個節點由:標籤(Tag)、屬性(Attribute)、文字(Text)三個值來描述。
 
所謂的HTML文件解析,指的就是如何構建一顆DOM樹,只有成功構建出DOM樹,才有可能進行後續的資料爬取和分析工作。顯然,構建DOM樹是比較複雜的過程,因為不是每一個HTML文件都會嚴格按照規範來書寫,因此解析過程需要具有一定容錯能力。此外,解析效率也是一個需要考慮的因素,也就是說最好通過一次文件掃描即可建立起DOM樹,而不是反覆掃描。
 
下面是HtmlParse介紹。
 

工具特點

1、綠色純天然,無任何第三方依賴庫,檔案大小不到150K;
2、解析速度快,具有一定的HTML語法容錯能力,可快速將HMTL文件解析為DOM樹;
3、基於命令列引數,可通過不同引數獲取指定TAG的屬性值和文字內容,從而實現網頁爬取功能;
4、可將爬取資料輸出為json格式,方便第三方程式進一步分析和使用;
5、可爬取script指令碼到指定的js檔案中;

下載地址http://softlee.cn/HtmlParse.zip
 

使用方法

HtmlParse HtmlPathFile -tag TagName [-attr] [Attribute] [-o] [JsonPathFile]

解析指定的HTML文件,並將文件中指定的標籤及屬性輸出到指定檔案中。

HtmlPathFile:必選引數,要解析的HTML文件路徑名,如果檔案路徑中有空格,可使用雙引號將檔案路徑包含;

-tag:必選引數,用於指定要抓取的HTML標籤名稱;
-attr:可選引數,用於指定標籤的屬性值,如果不指定,則返回該標籤的所有屬性值;
-o:可選引數,用於指定抓取內容輸出的檔案,可將抓取的內容儲存為json格式的檔案。 如果該引數不指定,則進行控制檯輸出。 如果抓取的是script、style則會儲存為js格式檔案。

如果要抓取doctype,可使用-tag doctype,將整個doctype內容獲取。此時將會忽略-attr指定的任何屬性值。

 

舉例說明

1、爬取網頁中所有超連結

HtmlParse c:/sina.html -tag a -attr href -o c:/sina.json

解析C盤下的sina.html文件,並提取該文件中的所有超連結到sina.json檔案中。其中-tag a -attr href,用於指定獲取超連結標籤ahref屬性。

2、爬取網頁中所有圖片連結

HtmlParse c:/sina.html -tag img -attr src -o c:/sina.json

解析C盤下的sina.html文件,並提取該文件中的所有圖片連結到sina.json檔案中。

3、爬取網頁中所有指令碼

HtmlParse c:/sina.html -tag script -o c:/sina.js

解析C盤下的sina.html文件,並提取該文件中的所有指令碼函式到sina.js檔案中。

 

輸出內容

如果通過-o引數指定輸出檔案,則會生成一個json格式的文件。
TagName為爬取的標籤名稱,比如超連結的a,其值是一個json陣列,陣列中的每個內容為Json物件,每個Json物件,有屬性和文字構成。如果-attr 指定了要爬取的屬性,則AttrName為指定的屬性名稱,比如href或src。text為該標籤的文字內容,有些標籤不存在文字內容,比如img、meta等,則該值為空。json格式如下:

{
  "TagName":
  {
     {"AttrName":"AttrValue1", "text":"text1"}
     {"AttrName":"AttrValue1", "text":"text2"}
  }
}

下面是一個sina網頁的所有超連結json

{
	"a": [{
		"href": "javascript:;",
		"text": "設為首頁"
	}, {
		"href": "javascript:;",
		"text": "我的選單"
	}, {
		"href": "https://sina.cn/",
		"text": "手機新浪網"
	}, {
		"href": "",
		"text": "移動客戶端"
	}, {
		"href": "https://c.weibo.cn/client/guide/download",
		"text": "新浪微博"
	}, {
		"href": "https://so.sina.cn/palmnews/web-sinanews-app-download.d.html",
		"text": "新浪新聞"
	}, {
		"href": "https://finance.sina.com.cn/mobile/comfinanceweb.shtml",
		"text": "新浪財經"
	}, {
		"href": "https://m.sina.com.cn/m/sinasports.shtml",
		"text": "新浪體育"
	}, {
		"href": "https://tousu.sina.com.cn/about_app/index?frompage=heimaopc",
		"text": "黑貓投訴"
	}, {
		"href": "http://blog.sina.com.cn/lm/z/app/",
		"text": "新浪部落格"
	}, {
		"href": "https://games.sina.com.cn/o/kb/12392.shtml",
		"text": "新浪遊戲"
	}, {
		"href": "https://zhongce.sina.com.cn/about/app",
		"text": "新浪眾測"
	}, {
		"href": "https://mail.sina.com.cn/client/mobile/index.php?suda-key=mail_app&suda-value=login",
		"text": "新浪郵箱客戶端"
	}, {
		"href": "javascript:;",
		"text": "關閉置頂"
	}, {

寫在最後

網頁下載可通過wincurl工具,這是一個windows平臺下的curl程式。

下載地址http://softlee.cn/wincurl.zip

介紹文章:《wincurl:一款基於HTTP協議的輕量級web資源抓取和上傳工具

相關文章