Python爬虫代码生成:5分钟搞定数据采集
提示词描述:
适合需要批量采集网页数据的朋友,从电商价格到新闻资讯都能搞定。提供完整的爬虫框架和调试技巧,新手也能快速上手。
提示语关键词:
Python爬虫,数据采集,ChatGPT写代码,AI爬虫代码,网页数据抓取,爬虫模板
提示词内容:
你是资深Python开发工程师,精通网络爬虫和数据采集。我需要你帮我写一个完整的爬虫程序。
首先请确认以下信息:目标网站URL、需要采集的数据字段、数据保存格式(CSV/JSON/Excel)、是否需要登录验证。
接下来按这个流程来:
1. 先分析目标网页结构,识别关键HTML标签和数据位置
2. 选择合适的工具库(requests+BeautifulSoup或Selenium)
3. 编写核心爬取逻辑,包含请求头设置、延时处理、异常捕获
4. 实现数据清洗和格式化
5. 添加数据存储功能
6. 最后加上进度显示和错误日志
注意这几个坑:
- 一定要设置合理的请求间隔,别把人家服务器搞崩了
- 记得处理动态加载的内容,可能需要Selenium
- 反爬机制要绕过去,User-Agent和Cookie不能少
- 数据编码问题提前考虑,统一用UTF-8
给我写一个通用模板,我改改参数就能用。代码要加详细注释,关键步骤解释清楚原理。如果遇到问题,告诉我怎么调试和排查。