文章詳情頁

html - 為什么BeautifulSoup find_all 返回的list都不是按照網頁顯示順序排序的？

瀏覽：101日期：2023-10-13 17:52:01

問題描述

我想爬糗百的段子，顯示作者，和對應的段子，先只爬第一面

import requestsfrom bs4 import BeautifulSoup as bspage = 1url = 'http://www.qiushibaike.com/hot/page/'r = requests.get(url+str(page))soup = bs(r.content,'html.parser')names = []for n in soup.find_all('a',{'href':True,'target':True,'title':True}): names += [n.h2.get_text()]print(names)

print 結果：

[’威信紅包接龍關注’, ’ZBZBZBZ’, ’養賊專業戶’, ’柱流年’, ’大風起兮雪飛揚’, ’依然家的麥芽糖’, ’小小&妖精’, ’蒼南下山耍流氓，黑衣格哥買紅糖’, ’九妹妹～’, ’親愛de橄欖綠’, ’有點胖的妮妮’, ’污奇奇’, ’沒辦法就是這么帥’, ’亦龍’, ’哇噻～桃寶’, ’單名一個飯字’, ’ni敢拿命疼我嗎？’, ’許我三日暖’, ’半闕詞曲丶’, ’誰動了我的糧食？’]

html.fromstring xpath 也這樣

from lxml import htmlimport requestspage = 1url = 'http://www.qiushibaike.com/hot/page/'r = requests.get(url+str(page))tree = html.fromstring(r.content)print(tree.xpath(’//*[@class='article block untagged mb15']/p[1]/a[2]/h2/text()’))

print 結果：

[’威信紅包接龍關注’, ’ZBZBZBZ’, ’養賊專業戶’, ’大風起兮雪飛揚’, ’柱流年’, ’依然家的麥芽糖’, ’小小&妖精’, ’蒼南下山耍流氓，黑衣格哥買紅糖’, ’九妹妹～’, ’親愛de橄欖綠’, ’有點胖的妮妮’, ’污奇奇’, ’沒辦法就是這么帥’, ’亦龍’, ’單名一個飯字’, ’ni敢拿命疼我嗎？’, ’許我三日暖’, ’半闕詞曲丶’, ’根@兒’, ’我是你的絕無僅有’]

但網頁的實際顯示順序是:

[’威信紅包接龍關注’, ’養賊專業戶’, ’ZBZBZBZ’, ’柱流年’, ’有點胖的妮妮’, ’依然家的麥芽糖’, ’小小&妖精’, ’大風起兮雪飛揚’, ’蒼南下山耍流氓，黑衣格哥買紅糖’, ’九妹妹～’, ’亦龍’...]

如何讓返回的list的元素的順序和網頁顯示順序相同？

問題解答

回答1：

應該是因為它頁面的內容的排序是在變動的。他的排序是根據評論里面的個“好笑”數來排的，好笑數字接近的，順序變化正常，而且有時有新的段子加入這頁。你瀏覽器取得頁面的時間，和爬蟲爬取的時間不一樣，看到的段子順序不一樣很正常。

HTML

上一條：java - 正則表達式如何對字符串取反？下一條：java - 求算法. 在球面上取隨機N個均勻的點(或者間距不小于某距離的點)

相關文章：

1. 在html文件的目錄下輸入代碼按回車后顯示這個，哪位大佬幫幫我呀2. javascript - 微信網頁開發從菜單進入頁面后，按返回鍵沒有關閉瀏覽器而是刷新當前頁面，求解決？3. node.js - nodejs開發中常用的連接mysql的庫4. 老師您的微信號是多少？5. mysql - jdbc的問題6. 網頁爬蟲 - python 爬取網站并解析非json內容7. 視頻文件不能播放，怎么辦？8. mysql - 分庫分表、分區、讀寫分離這些都是用在什么場景下，會帶來哪些效率或者其他方面的好處9. windows7 ping不通虛擬機VMware上的linux（ubuntu）的ip10. mysql - 如何減少使用或者不用LEFT JOIN查詢？

排行榜

					
					node.js - npm init無法一直回車。到version就卡主不動了
python - 有哪些預測算法可以根據實時增量數據更新算法并預測后續數據？
javascript - ios下獲取焦點失敗
解決Android webview設置cookie和cookie丟失的問題
javascript - 關于css絕對定位在ios瀏覽器被橡皮筋遮擋的問題
網頁爬蟲 - python 爬取網站 并解析非json內容
visual-studio - Python OpenCV: 奇怪的自動補全問題
在html文件的目錄下輸入代碼按回車后顯示這個，哪位大佬幫幫我 呀
python - 我在使用pip install -r requirements.txt下載時，為什么部分能下載，部分不能下載
docker安裝后出現Cannot connect to the Docker daemon.
docker內創建jenkins訪問另一個容器下的服務器問題
				

熱門標簽

国产综合久久一区二区三区