AI数据清洗代码生成:一键处理杂乱数据集

官方 5 查看 0 有趣 0 复制 0 收藏

提示词描述:

适用于数据工程师快速构建可复用的数据清洗管道,通过参数化配置降低重复编码成本。预期输出包含异常处理机制与性能优化建议,适合处理GB级结构化数据。建议结合具体数据字典使用以增强字段映射准确性。

提示语关键词:
AI代码生成,数据清洗脚本,Python数据预处理模板,自动化ETL代码,大数据清洗工具
提示词内容:
【模板说明】 本提示词专为数据工程师设计,通过结构化参数输入自动生成适配特定数据源的清洗脚本,支持缺失值处理、异常值检测与格式标准化。 【使用场景】 适用于ETL流程开发、机器学习数据预处理、日志文件标准化等需要批量处理非结构化数据的场景。 【模板正文】 作为数据清洗专家,请生成符合以下要求的{语言}脚本: 1. 输入数据格式:{CSV/JSON/SQL等} 2. 核心处理逻辑:{删除重复项/插补缺失值/正则表达式清洗/类型转换} 3. 输出规范:{保留原始字段/生成清洗报告/输出至{数据库/文件系统}} 4. 性能要求:{支持{万/十万}级数据量/内存优化策略} 【填写指南】 - 语言建议填写Python/Pandas或Spark SQL - 处理逻辑需明确优先级,如先处理缺失值再格式化 - 输出规范需指定存储路径或表名 【效果示例】 输入:Python+CSV+插补缺失值+类型转换+输出至MySQL 输出:含pd.read_csv、SimpleImputer、astype转换及SQLAlchemy写入的完整流水线代码,附带数据质量校验函数。
返回列表

提示词排行榜

文章排行榜