测试背景与方法

很多人关心「大模型到底能不能直接吃下长文档」。这次我用两类真实材料测试:

  1. 一份约 8000 字的技术文档(含多级标题与代码片段)
  2. 一段 300 行左右、缺少注释的遗留代码

测试任务固定为三类:长文总结、语气改写、代码解释。

一、长文总结

做法:把文档整段粘贴,要求输出「500 字摘要 + 5 条要点」。

结果

  • 摘要覆盖了主要章节,要点基本命中文章主干,没有明显跑偏
  • 但模型会省略部分中间层级的细节,尤其是表格里的具体参数
  • 若某段内容出现在文档很靠后的位置,被提及的概率会下降

结论:适合做「快速判断要不要细读」的第一道筛选,不适合直接当作事实依据。重要参数仍需回到原文核对。

二、语气改写

做法:把一段口语化的说明改成正式的对外文档语气。

结果:改写后的文本通顺,术语使用一致,长句拆分合理。主要问题是偶尔会顺手补充原文没有的信息(例如自己加了一句适用范围说明)。

结论:改写可用,但发布前必须逐句比对,防止「无中生有」。

三、代码解释

做法:贴入遗留代码,要求说明整体流程与每个函数的作用。

结果

  • 主流程判断准确,能指出入口函数和核心循环
  • 对个别边界条件(如空数组、异常分支)的解释存在想当然的情况
  • 给出的重构建议整体合理,但直接照搬前需要跑一遍测试

结论:把它当成「资深同事的快速讲解」很合适;当成「可直接合入的代码」则风险较高。

通用避坑建议

  • 长文档分段投喂:超过一定长度后,靠后内容被忽略的概率上升,建议按章节分段并让它分别总结,最后再做一次汇总
  • 关键数字必查:模型对参数的复述不可靠,涉及版本号、限额、价格时以官网为准
  • 明确输出格式:指定「几点」「多少字」「用什么语气」能明显减少返工

总结

在总结、改写、代码解释这三类任务上,ChatGPT 已经能稳定节省大量时间,但定位应是「高效助手」而非「权威来源」。只要保留人工核对环节,整体收益是明确的。