當前位置：首頁 > 编程语言 > python >内容正文

python

python爬取多页数据_python爬虫实现爬取同一个网站的多页数据代码实例

發布時間：2024/9/27 python 25 豆豆

生活随笔收集整理的這篇文章主要介紹了 python爬取多页数据_python爬虫实现爬取同一个网站的多页数据代码实例小編覺得挺不錯的,現在分享給大家,幫大家做個參考.

本篇文章小編給大家分享一下python爬蟲實現爬取同一個網站的多頁數據代碼實例，文章代碼介紹的很詳細，小編覺得挺不錯的，現在分享給大家供大家參考，有需要的小伙伴們可以來看看。

一、爬蟲的目的

從網上獲取對你有需要的數據

二、爬蟲過程

1、獲取url(網址)。

2、發出請求，獲得響應。

3、提取數據。

4、保存數據。

三、爬蟲功能

可以快速批量的獲取想要的數據，不用手動的一個個下載(圖片、文字音視頻等)

四、使用python爬蟲爬取同一網站多頁數據

1、需要定位至該標簽并獲得總頁數

def get_page_size(soup):

pcxt=soup.find('div',{'class':'babynames-term-articles'}).find('nav')

pcxt1=pcxt.find('div',{'class':'nav-links'}).findAll('a')

for i in pcxt1[:-1]:

link=i.get('href')

s=str(i)

page=re.sub('','',page1)

page3=re.sub('','',page2)

pagesize=int(page3)

print(pagesize)

return pagesize

Pass

2、更改url來訪問網址，也就是進行主函數的編寫

if __name__ == '__main__':

url="http://www.sheknows.com/baby-names/browse/a/"

soup=get_requests(url)

page=get_page_size(soup)

for i in range(1,page+1):

url1=url+"page/"+str(i)+"/"

soup1=get_requests(url1)

draw_base_list(soup1)

實例擴展：

import requests

from lxml import etree

import re

url="https://movie.douban.com/top250"

header = {"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.130 Safari/537.36"}

allMovieList=[]

flag = True

while flag:

html = requests.get(url, headers=header).text

list = etree.HTML(html)

lis = list.xpath('//ol[@class="grid_view"]/li')

for oneSelector in lis:

name = oneSelector.xpath("div/div[2]/div[1]/a/span[1]/text()")[0]

score = oneSelector.xpath("div/div[2]/div[2]/div/span[2]/text()")[0]

people = oneSelector.xpath("div/div[2]/div[2]/div/span[4]/text()")[0]

people = re.findall("(.*?)人評價",people)[0]

oneMovieList = [name,score,people]

allMovieList.append(oneMovieList)

#獲取下一頁地址

try:

next_url = list.xpath('//span[@class="next"]/a/@href')[0]

if next_url:

url = "https://movie.douban.com/top250"+ next_url

except:

flag = False

print(allMovieList)

總結

以上是生活随笔為你收集整理的python爬取多页数据_python爬虫实现爬取同一个网站的多页数据代码实例的全部內容，希望文章能夠幫你解決所遇到的問題。

如果覺得生活随笔網站內容還不錯，歡迎將生活随笔推薦給好友。

上一篇： emqx配置mysql认证,emqx使用
下一篇： websocket python爬虫_p