模型评测习惯盯虚构,一项新研究盯的是遗漏。
Georgetown 与 University of Washington 分析 20 份 AI 生成的事故报告摘要,主要错误不是写错,而是写漏。328 人实验中,一份误导性摘要把关键细节的正确回忆率从 83.6% 压到 44.8%,读的人没有察觉任何缺失。

差别在呈现方式:虚构是显性错误,复核能抓到;遗漏是隐性错误,看上去完整,无从下手。
落地做法:
- 摘要附原文链接,关键结论回原文对齐后再用
- 标明摘要覆盖范围,未覆盖部分单独标注
- 进入决策的摘要,加第二来源交叉验证
边界:研究未覆盖职场场景,结论限于「省略什么,读者就会记住什么」。
