文章詳情頁

csv - python多列存取爬蟲網頁？

瀏覽：93日期：2022-08-30 10:07:16

問題描述

爬蟲抓取的資料想分列存取在tsv上,試過很多方式都沒有辦法成功存存取成兩列資訊。想存取為數字爬取的資料一列,底下類型在第二列 csv - python多列存取爬蟲網頁？

from urllib.request import urlopenfrom bs4 import BeautifulSoupimport reimport csvhtml = urlopen('http://www.app12345.com/?area=tw&store=Apple%20Store')bs0bj = BeautifulSoup (html)def GPname(): GPnameList = bs0bj.find_all('dd',{'class':re.compile('ddappname')}) str = ’’ for name in GPnameList:str += name.get_text()str += ’n’print(name.get_text()) return strdef GPcompany(): GPcompanyname = bs0bj.find_all('dd',{'style':re.compile('color')}) str = ’’ for cpa in GPcompanyname:str += cpa.get_text()str += ’n’print(cpa.get_text()) return strwith open(’0217.tsv’,’w’,newline=’’,encoding=’utf-8’) as f: f.write(GPname()) f.write(GPcompany())f.close()

可能對zip不熟悉，存取下來之后變成一個字一格也找到這篇參考，但怎么嘗試都沒有辦法成功https://segmentfault.com/q/10...

問題解答

回答1：

寫csv文件簡單點你的結構數據要成這樣 [['1. 東森新聞雲','新聞'],['2. 創世黎明(Dawn of world)','遊戲']]

from urllib import urlopenfrom bs4 import BeautifulSoupimport reimport csvhtml = urlopen('http://www.app12345.com/?area=tw&store=Apple%20Store')bs0bj = BeautifulSoup (html)GPnameList = [name.get_text() for name in bs0bj.find_all('dd',{'class':re.compile('ddappname')})]GPcompanyname = [cpa.get_text() for cpa in bs0bj.find_all('dd',{'style':re.compile('color')})]data = ’n’.join([’,’.join(d) for d in zip(GPnameList, GPcompanyname)])with open(’C:/Users/sa/Desktop/0217.csv’,’wb’) as f: f.write(data.encode(’utf-8’))

Python 編程

上一條：python - 搜索大文件（20G左右）下一條：ubuntu - Python3.x的中文字符在Linux下面的占位問題？

相關文章：

1. javascript - js中遞歸與for循環同時發生的時候，代碼的執行順序是怎樣的？2. 小程序怎么加外鏈，語句怎么寫！求救新手，開文檔沒發現3. python - linux怎么在每天的凌晨2點執行一次這個log.py文件4. php如何獲取訪問者路由器的mac地址5. android - 鍵盤遮擋RecyclerView6. 如何分別在Windows下用Winform項模板+C#，在MacOSX下用Cocos Application項目模板+Objective-C實現一個制作游戲的空的黑窗口？7. javascript - jQuery each 方法第三個參數args 如何解釋？8. javascript - 在 vue里面用import引入js文件，結果為undefined9. java - new + 類名，一定需要申明一個對象嗎？10. javascript - ...mapGetters和...mapState獲取到的state，怎么拿來在methods中操作？

排行榜

					
					python - linux怎么在每天的凌晨2點執行一次這個log.py文件
php如何獲取訪問者路由器的mac地址
android - 鍵盤遮擋RecyclerView
javascript - js中遞歸與for循環同時發生的時候，代碼的執行順序是怎樣的？
如何分別在Windows下用Winform項模板+C#，在MacOSX下用Cocos Application項目模板+Objective-C實現一個制作游戲的空的黑窗口？
小程序怎么加外鏈，語句怎么寫！求救新手，開文檔沒發現
java - new + 類名，一定需要申明一個對象嗎？
javascript -  在 vue里面用import引入js文件，結果為undefined
javascript - ...mapGetters和...mapState獲取到的state，怎么拿來在methods中操作？
javascript - jQuery each 方法第三個參數args 如何解釋？
python沒入門，請教一個問題
				

熱門標簽

csv - python多列存取爬蟲網頁？

csv - python多列存取爬蟲網頁？