前提:先有清晰的问题
把「帮我分析这份数据」换成具体问题,效果差别巨大:
- ❌ 分析一下这份销售数据
- ✅ 按月份看,哪个产品线的环比下滑最明显?可能的原因有哪些方向值得查?
问题越具体,输出越可用。
第一步:整理与脱敏
- 只保留分析需要的列,删掉无关字段
- 敏感信息先处理:客户姓名、手机号、身份证等必须脱敏或删除
- 确认字段含义(单位、时区、是否含税),避免后续解读错误
第二步:让它先做「描述」,不要急着下结论
先要求输出基础事实:
- 数据范围(时间区间、记录数)
- 各维度的分布与缺失情况
- 明显的异常值
这一步能帮你发现数据本身的问题(缺失、重复、口径不一致),避免基于脏数据得出错误结论。
第三步:再要「分析」
在描述的基础上追问:
- 趋势变化的拐点在哪里
- 哪些因素可能存在关联
- 有哪些需要进一步验证的假设
关键要求:让它区分「数据能支持的结论」和「推测」,并标注置信程度。
第四步:交叉验证(不可跳过)
- 换个角度重算一遍(如换时间粒度、换分组方式),看结论是否一致
- 挑几个具体样本手动核对
- 涉及对外汇报的数字,必须用原始表格复核
最常见的坑:样本量很小时得出的「显著变化」,往往只是波动。
不适合交给 AI 的部分
- 因果判断(相关性不等于因果)
- 需要业务背景才能解释的异常
- 对外承诺性的数据结论
小结
AI 能显著加快「描述数据」和「提出假设」的环节,但结论验证仍需要人。按「问题→整理→描述→分析→验证」四步走,既高效又不容易出错。