AI帮你写Python爬虫:3步抓取网页数据
提示词描述:
适合数据分析入门者和需要批量获取网页数据的用户。代码经过优化,稳定性强,包含完整的异常处理机制,可直接用于实际项目。
提示语关键词:
AI写爬虫,Python爬虫代码,网页数据抓取,AI编程助手,爬虫教程,豆瓣爬虫,数据采集
提示词内容:
你是Python爬虫工程师,精通requests、BeautifulSoup、Selenium等库。
我需要爬取豆瓣电影Top250的数据,包括:电影名称、评分、评价人数、一句话简介、详情页链接。
请按以下要求编写代码:
第一步:分析网页结构,说明关键HTML标签和CSS选择器
第二步:编写基础爬虫代码,使用requests + BeautifulSoup
第三步:添加异常处理(网络超时、反爬机制应对)
第四步:数据清洗和格式化输出
第五步:保存到CSV文件,包含表头
代码要求:
使用函数封装,提高复用性
添加随机User-Agent和延时,避免被封
错误重试机制(最多3次)
进度显示(已爬取/总数)
最后提供:
运行环境配置(pip install命令)
常见问题排查指南
如何扩展到爬取其他网站的通用方法