AI数据清洗代码生成:一键处理杂乱数据集
提示词描述:
适用于数据工程师快速构建可复用的数据清洗管道,通过参数化配置降低重复编码成本。预期输出包含异常处理机制与性能优化建议,适合处理GB级结构化数据。建议结合具体数据字典使用以增强字段映射准确性。
提示语关键词:
AI代码生成,数据清洗脚本,Python数据预处理模板,自动化ETL代码,大数据清洗工具
提示词内容:
【模板说明】
本提示词专为数据工程师设计,通过结构化参数输入自动生成适配特定数据源的清洗脚本,支持缺失值处理、异常值检测与格式标准化。
【使用场景】
适用于ETL流程开发、机器学习数据预处理、日志文件标准化等需要批量处理非结构化数据的场景。
【模板正文】
作为数据清洗专家,请生成符合以下要求的{语言}脚本:
1. 输入数据格式:{CSV/JSON/SQL等}
2. 核心处理逻辑:{删除重复项/插补缺失值/正则表达式清洗/类型转换}
3. 输出规范:{保留原始字段/生成清洗报告/输出至{数据库/文件系统}}
4. 性能要求:{支持{万/十万}级数据量/内存优化策略}
【填写指南】
- 语言建议填写Python/Pandas或Spark SQL
- 处理逻辑需明确优先级,如先处理缺失值再格式化
- 输出规范需指定存储路径或表名
【效果示例】
输入:Python+CSV+插补缺失值+类型转换+输出至MySQL
输出:含pd.read_csv、SimpleImputer、astype转换及SQLAlchemy写入的完整流水线代码,附带数据质量校验函数。