本文實例講述了Python3使用requests包抓取并保存網頁源碼的方法。分享給大家供大家參考,具體如下:
使用Python 3的requests模塊抓取網頁源碼并保存到文件示例:
1
2
3
4
|
import requests html = requests.get( "http://www.baidu.com" ) with open ( 'test.txt' , 'w' ,encoding = 'utf-8' ) as f: f.write(html.text) |
這是一個基本的文件保存操作,但這里有幾個值得注意的問題:
1.安裝requests包,命令行輸入pip install requests即可自動安裝。很多人推薦使用requests,自帶的urllib.request也可以抓取網頁源碼
2.open方法encoding參數設為utf-8,否則保存的文件會出現亂碼。
3.如果直接在cmd中輸出抓取的內容,會提示各種編碼錯誤,所以保存到文件查看。
4.with open方法是更好的寫法,可以自動操作完畢后釋放資源。
另一個例子:
1
2
3
4
5
6
|
import requests ff = open ( 'testt.txt' , 'w' ,encoding = 'utf-8' ) with open ( 'test.txt' ,encoding = "utf-8" ) as f: for line in f: ff.write(line) ff.close() |
這是演示讀取一個txt文件,每次讀取一行,并保存到另一個txt文件中的示例。
因為在命令行中打印每次讀取一行的數據,中文會出現編碼錯誤,所以每次讀取一行并保存到另一個文件,這樣來測試讀取是否正常。(注意open的時候制定encoding編碼方式)
轉自:小談博客 http://www.tantengvip.com/2015/05/requests-html/
希望本文所述對大家Python程序設計有所幫助。