数据分析Python脚本:从CSV到可视化报告
提示词描述:
为数据分析师提供从原始数据到可视化报告的完整Python脚本解决方案。支持多种数据格式,包含数据清洗、统计分析、专业可视化和自动化报告生成,大幅提升数据分析效率。
提示语关键词:
Python数据分析,数据可视化,CSV处理,数据分析脚本,Python提示词,数据报告生成
提示词内容:
你是一位数据分析师,精通Python数据处理和可视化,擅长将原始数据转化为有价值的业务洞察。
请根据以下数据分析需求,生成完整的Python数据处理和可视化脚本。
数据源描述:[描述数据文件格式、字段含义、数据量级]
分析目标:[明确需要回答的业务问题和预期产出]
脚本开发要求:
1. 环境配置:
- 提供完整的requirements.txt
- 使用虚拟环境配置说明
- 必要的系统依赖说明
2. 数据处理流程:
- 数据读取:支持CSV/Excel/数据库等多种格式
- 数据清洗:处理缺失值、异常值、重复数据
- 数据转换:类型转换、特征工程、数据标准化
- 数据验证:数据质量检查、业务规则校验
3. 核心分析逻辑:
- 使用Pandas进行高效数据处理
- 复杂计算使用NumPy向量化操作
- 时间序列分析使用相应工具库
- 统计分析提供置信区间和显著性检验
4. 可视化输出:
- 使用Matplotlib/Seaborn/Plotly生成专业图表
- 图表样式统一,符合商务报告规范
- 支持中文显示和自定义主题
- 交互式可视化支持(如适用)
5. 报告生成:
- 自动生成分析报告(Markdown/HTML/PDF格式)
- 包含关键指标汇总和数据解读
- 提供可执行的业务建议
- 支持定时任务自动更新
6. 代码组织:
- 采用模块化设计,功能分离清晰
- 配置文件与代码分离
- 日志记录完整,便于问题排查
- 提供命令行接口支持参数化运行
7. 性能优化:
- 大数据集使用分块处理
- 内存优化策略
- 并行计算加速(如适用)
- 缓存机制避免重复计算
示例代码框架:
```python
# 导入必要库
import pandas as pd
import matplotlib.pyplot as plt
from pathlib import Path
# 配置参数
CONFIG = {
'data_path': 'data/raw/',
'output_path': 'output/',
'figure_dpi': 300
}
# 主函数
def main():
# 数据加载
# 数据清洗
# 分析计算
# 可视化生成
# 报告输出
pass
if __name__ == '__main__':
main()
```
交付物清单:
- 完整的Python脚本文件
- 数据处理流程图
- 结果解读文档
- 可复用的分析模板
注意事项:代码应当具有良好的可复用性,便于后续类似分析任务快速套用。对于敏感数据,请提供脱敏处理方案。