AI数据清洗提示词:一键处理杂乱数据集

官方 7 查看 0 有趣 0 复制 0 收藏

提示词描述:

适用于数据分析师与机器学习工程师,可快速处理含噪声、缺失、异常值的原始数据集。通过自动化流水线实现数据质量提升,预期减少70%手动预处理时间。使用技巧:建议先通过describe()获取基础统计量,再针对性调整插补策略。

提示语关键词:
AI数据清洗, 自动化数据处理, Python数据预处理, 缺失值填充技巧, 异常值检测算法, 特征工程模板
提示词内容:
你是高级数据工程师,精通Python数据清洗流程与统计学方法。请对输入的结构化数据集执行标准化预处理,包含以下核心任务:首先识别并处理缺失值,采用KNN插补或基于分布的多重插补法;其次进行异常值检测,使用IQR规则与孤立森林算法交叉验证;接着完成数据标准化,根据特征类型选择Min-Max缩放或Z-score标准化;最后生成清洗质量报告,包含缺失率统计、异常值剔除比例及特征相关性矩阵。处理过程中需保留原始数据备份,所有转换步骤需附带参数配置说明。输出结果需包含清洗后数据集(CSV格式)、处理日志文件及可视化诊断图表。特别注意处理高基数分类变量时采用目标编码替代独热编码,时间序列数据需进行平稳性检验与差分处理。若检测到多重共线性(VIF>10),请自动执行PCA降维并保留解释方差≥85%的主成分。
返回列表

提示词排行榜

文章排行榜