文章詳情頁

python中scrapy處理項目數據的實例分析

瀏覽：132日期：2022-07-04 15:29:04

在我們處理完數據后，習慣把它放在原有的位置，但是這樣也會出現一定的隱患。如果因為新數據的加入或者其他種種原因，當我們再次想要啟用這個文件的時候，小伙伴們就會開始著急卻怎么也翻不出來，似乎也沒有其他更好的搜集辦法，而重新進行數據整理顯然是不現實的。下面我們就一起看看python爬蟲中scrapy處理項目數據的方法吧。

1、拉取項目

$ git clone https://github.com/jonbakerfish/TweetScraper.git$ cd TweetScraper/$ pip install -r requirements.txt #add ’--user’ if you are not root$ scrapy list$ #If the output is ’TweetScraper’, then you are ready to go.

2、數據持久化

通過閱讀文檔，我們發現該項目有三種持久化數據的方式，第一種是保存在文件中，第二種是保存在Mongo中，第三種是保存在MySQL數據庫中。因為我們抓取的數據需要做后期的分析，所以，需要將數據保存在MySQL中。

抓取到的數據默認是以Json格式保存在磁盤 ./Data/tweet/ 中的，所以，需要修改配置文件 TweetScraper/settings.py 。

ITEM_PIPELINES = { # ’TweetScraper.pipelines.SaveToFilePipeline’:100,#’TweetScraper.pipelines.SaveToMongoPipeline’:100, # replace `SaveToFilePipeline` with this to use MongoDB ’TweetScraper.pipelines.SavetoMySQLPipeline’:100, # replace `SaveToFilePipeline` with this to use MySQL}#settings for mysqlMYSQL_SERVER = '18.126.219.16'MYSQL_DB = 'scraper'MYSQL_TABLE = 'tweets' # the table will be created automaticallyMYSQL_USER = 'root' # MySQL user to use (should have INSERT access granted to the Database/TableMYSQL_PWD = 'admin123456' # MySQL user’s password

內容擴展：

scrapy.cfg是項目的配置文件

from scrapy.spider import BaseSpiderclass DmozSpider(BaseSpider):name = 'dmoz'allowed_domains = ['dmoz.org']start_urls = [ 'http://www.dmoz.org/Computers/Programming/Languages/Python/Books/', 'http://www.dmoz.org/Computers/Programming/Languages/Python/Resources/']def parse(self, response): filename = response.url.split('/')[-2] open(filename, ’wb’).write(response.body)

到此這篇關于python中scrapy處理項目數據的實例分析的文章就介紹到這了,更多相關python爬蟲中scrapy如何處理項目數據內容請搜索好吧啦網以前的文章或繼續瀏覽下面的相關文章希望大家以后多多支持好吧啦網！

Python 編程

上一條：python全棧開發語法總結下一條：Java 基于UDP協議實現消息發送

相關文章：

1. ajax請求添加自定義header參數代碼2. ASP基礎知識VBScript基本元素講解3. Kotlin + Flow 實現Android 應用初始化任務啟動庫4. Python requests庫參數提交的注意事項總結5. Gitlab CI-CD自動化部署SpringBoot項目的方法步驟6. python操作mysql、excel、pdf的示例7. vue-electron中修改表格內容并修改樣式8. 淺談SpringMVC jsp前臺獲取參數的方式 EL表達式9. 利用CSS3新特性創建透明邊框三角10. axios和ajax的區別點總結

排行榜

					
					ASP基礎知識VBScript基本元素講解
ajax請求添加自定義header參數代碼
Gitlab CI-CD自動化部署SpringBoot項目的方法步驟
Kotlin + Flow 實現Android 應用初始化任務啟動庫
Python requests庫參數提交的注意事項總結
基于javascript處理二進制圖片流過程詳解
SpringBoot參數校驗與國際化使用教程
idea開啟代碼提示功能的方法步驟
利用CSS3新特性創建透明邊框三角
axios和ajax的區別點總結
python pymysql鏈接數據庫查詢結果轉為Dataframe實例
				

熱門標簽

国产综合久久一区二区三区