前提:先有清晰的问题

把「帮我分析这份数据」换成具体问题,效果差别巨大:

  • ❌ 分析一下这份销售数据
  • ✅ 按月份看,哪个产品线的环比下滑最明显?可能的原因有哪些方向值得查?

问题越具体,输出越可用。

第一步:整理与脱敏

  • 只保留分析需要的列,删掉无关字段
  • 敏感信息先处理:客户姓名、手机号、身份证等必须脱敏或删除
  • 确认字段含义(单位、时区、是否含税),避免后续解读错误

第二步:让它先做「描述」,不要急着下结论

先要求输出基础事实:

  • 数据范围(时间区间、记录数)
  • 各维度的分布与缺失情况
  • 明显的异常值

这一步能帮你发现数据本身的问题(缺失、重复、口径不一致),避免基于脏数据得出错误结论。

第三步:再要「分析」

在描述的基础上追问:

  • 趋势变化的拐点在哪里
  • 哪些因素可能存在关联
  • 有哪些需要进一步验证的假设

关键要求:让它区分「数据能支持的结论」和「推测」,并标注置信程度。

第四步:交叉验证(不可跳过)

  • 换个角度重算一遍(如换时间粒度、换分组方式),看结论是否一致
  • 挑几个具体样本手动核对
  • 涉及对外汇报的数字,必须用原始表格复核

最常见的坑:样本量很小时得出的「显著变化」,往往只是波动。

不适合交给 AI 的部分

  • 因果判断(相关性不等于因果)
  • 需要业务背景才能解释的异常
  • 对外承诺性的数据结论

小结

AI 能显著加快「描述数据」和「提出假设」的环节,但结论验证仍需要人。按「问题→整理→描述→分析→验证」四步走,既高效又不容易出错。