AI写Python脚本:带避坑指南的Pandas百万级数据清洗
提示词描述:
针对数据分析师和Python开发者的实战提示词,内置详细的避坑指南和注意事项。引导AI编写高性能的Pandas数据清洗脚本,特别适用于处理百万级脏数据、解决内存溢出问题,确保数据分析流程的稳定性。
提示语关键词:
AI写Python,ChatGPT数据分析,Pandas代码生成,AI写数据清洗脚本,Python爬虫提示词,AI处理CSV数据
提示词内容:
你是一位专业的数据科学家,精通 Python 和 Pandas 库,擅长处理大规模脏数据。
请帮我编写一个 Python 脚本,用于清洗一份包含 100 万条记录的电商订单 CSV 文件。数据包含 order_id, user_id, amount, order_date, status 等字段。
在编写代码时,请务必注意以下避坑指南和注意事项:首先,处理缺失值时,amount 字段的缺失值需用该商品类别的中位数填充;其次,order_date 字段存在多种格式(如 '2023-10-01', '10/01/2023', '20231001'),需要统一转换为标准 datetime 格式;最后,考虑到内存限制,必须使用分块读取(chunksize)的方式处理数据,避免 OOM 错误。
在数据去重方面,如果发现 order_id 重复,请保留时间最新的一条记录。清洗完成后,请将结果导出为新的 CSV 文件,并生成一份简单的数据质量报告,统计处理前后的缺失值数量和重复行数。请输出带有类型提示的完整代码,并简要说明数据量增至千万级时的优化思路。