Python数据清洗脚本:一键处理百万行脏数据
提示词描述:
适用于数据分析师与ETL工程师处理高维脏数据场景。通过预设的标准化流水线,一键完成缺失值插补、异常值过滤、格式规整与一致性校验。预期可输出带类型注解与完整文档的生产级脚本,显著缩短数据预处理周期。建议提供清晰的字段字典与业务规则,AI将自动匹配最优算法并返回清洗报告。
提示语关键词:
Python数据清洗,AI写代码,自动化数据处理,pandas清洗脏数据技巧,一键生成python脚本,数据预处理模板,ETL脚本生成
提示词内容:
你是资深Python数据工程师。请根据我提供的原始数据特征与清洗目标,生成可直接投入生产环境的数据处理脚本。
原始数据样本结构:{填写}
核心清洗目标:{填写}
运行环境版本:Python {填写},pandas {填写}
严格按以下执行逻辑构建代码:第一步,加载与探查。使用高效IO方式读取数据,输出基础统计信息与空值分布热力图数据。若数据量超过十万行,强制启用分块读取或Arrow引擎。第二步,缺失与异常处理。数值字段采用同类业务中位数填充,分类字段采用众数填充。标记填充率高于15%的特征。应用IQR法则过滤极端离群值,记录过滤前后样本量差异。第三步,类型与格式规整。时间列统一解析为datetime对象并设定时区。文本字段执行strip清洗,移除控制字符。货币与数值字段剥离符号后转为float64,保留指定精度。第四步,一致性校验。依据业务主键执行去重操作,保留时间戳最早的记录。生成清洗报告,包含处理行数、丢弃比例、字段类型变更清单。
代码交付规范:封装为clean_data_pipeline函数,接收原始DataFrame与配置字典,返回清洗后DataFrame与报告对象。全量添加Type Hints与函数级Docstring。禁止硬编码,所有阈值与路径通过参数传递。关键转换逻辑需附加行级注释。仅输出完整Python代码块。不附加任何前置说明或后置总结。若输入规则存在逻辑互斥,按优先级执行异常过滤。