RecodeX 重构消息,谷歌研究院与以色列理工学院联合发布的一项新研究表明,大型语言模型(LLM)的幻觉问题往往源于“回忆失败”而非“知识缺失”。实验显示,GPT-5、Gemini-3等前沿模型可编码95%-98%的测试事实,但通过延长推理时间,模型能恢复最多65%无法直接回忆的事实。研究提出“事实级画像”评估框架,区分事实的“编码”与“知晓”,并指出回忆失败可通过推理期计算干预改善,而非单纯依赖扩大模型或数据。
RecodeX 重构消息,谷歌研究院与以色列理工学院联合发布的一项新研究表明,大型语言模型(LLM)的幻觉问题往往源于“回忆失败”而非“知识缺失”。实验显示,GPT-5、Gemini-3等前沿模型可编码95%-98%的测试事实,但通过延长推理时间,模型能恢复最多65%无法直接回忆的事实。研究提出“事实级画像”评估框架,区分事实的“编码”与“知晓”,并指出回忆失败可通过推理期计算干预改善,而非单纯依赖扩大模型或数据。