空格、符号等)。
他用浏览器的“开发者工具”(F12)查看京东搜索“初中数学教辅”的结果页。密密麻麻的HTML标签让他眼花缭乱,但通过“检查元素”功能点击具体的书名、价格,他逐渐锁定了数据所在的标签类别和class名称。这是一个需要耐心和细心的“侦探”工作。
第二、三天:编写第一个爬虫脚本(京东)。
他先尝试抓取单页数据。代码大致如下:
importrequests
frombs4importBeautifulSoup
importpandasaspd
importtime
headers={'User-Agent':'Mozilla/5.0...'}#模拟浏览器请求头
url='https://search.jd.com/...初中数学教辅...'#搜索URL
response=requests.get(url,headers=headers)
soup=BeautifulSoup(response.text,'html.parser')
books=[]
foriteminsoup.find_all('div',class_='gl-i-wrap'):#根据实际class调整
try:
title=item.find('div',class_='p-name').em.get_text(strip=True)
price=item.find('div',class_='p-price').strong.i.get_text()
shop=item.find('div',class_='p-shop').span.get_text(strip=True)ifitem.find('div',class_='p-shop')else'未知'
#评价数有时在另一个标签里,需要更复杂的查找
commit=item.find('div',class_='p-commit').strong.get_text(strip=True)ifi
本章未完,请点击下一页继续阅读!