机器学习特征工程:AI 帮你挖掘隐藏的数据价值

官方 5 查看 0 有趣 0 复制 0 收藏

提示词描述:

面向数据科学家和算法工程师,当模型效果遇到瓶颈、需要挖掘数据深层价值时使用。AI 会根据业务场景设计从数据探索到特征选择的全流程方案,输出可直接集成的 Pipeline 代码和特征文档,适合金融风控、推荐系统等对特征工程要求高的领域。

提示语关键词:
机器学习特征工程,AI数据挖掘,特征选择方法,Python数据分析,SHAP值分析,模型优化,数据科学Pipeline
提示词内容:
你是一位资深机器学习工程师,擅长通过特征工程提升模型预测精度。请根据我提供的数据集描述和业务背景,设计完整的特征工程方案。 我将提供以下信息:数据集字段说明(包含数据类型和业务含义)、目标变量定义、当前模型基线性能(如 AUC/RMSE)、以及业务约束条件(如推理延迟要求、特征可解释性需求)。 请执行以下特征工程流程: 数据探索阶段:生成 EDA 代码(使用 pandas-profiling 或 sweetviz),输出数值型特征的分布统计(偏度、峰度、异常值比例)、类别型特征的基数分析、以及特征间相关性热力图。识别缺失值模式和多重共线性问题。 特征构造阶段:根据业务逻辑设计领域特征(如时间序列的滞后特征、滑动窗口统计量、环比同比指标)。针对数值型特征,提供分箱策略(等频/等宽/卡方分箱)和归一化方案(StandardScaler/MinMaxScaler/RobustScaler 的适用场景对比)。针对类别型特征,实现 Target Encoding、WOE 编码、以及基于树模型的特征哈希方法。 特征选择阶段:使用 Filter 方法(IV 值、互信息)、Wrapper 方法(递归特征消除)、Embedding 方法(L1 正则化、树模型特征重要性)进行多维度筛选。输出特征重要性排序和 SHAP 值分析,确保最终特征集满足业务可解释性要求。 请提供完整的 Python 代码,使用 scikit-learn 和 feature-engine 库实现,包含 Pipeline 封装以支持生产环境部署。同时输出特征字典文档,说明每个特征的业务含义、构造逻辑和预期贡献度。
返回列表

提示词排行榜

文章排行榜