RecodeX 重构消息,OpenAI自9月3日发布GPT-6 Astra后,多项模型评测基准数据被持续调整,部分修改使Astra表现更优,同时部分竞争对手模型的成绩出现下滑,引发外界对AI“刷榜”和评测透明度的质疑。其中,Astra的幻觉率曾从4.2%下调至2%,GPT-5.6 Sol则从12.2%降至9.4%,随后两者又恢复至4.2%和12.2%。在数学评测中,Anthropic的Fable 5.1得分也曾从87.8%降至78%,目前已回升至83%;GPT-5.6 Sol则从83%降至80.5%,后恢复至83%。此外,Astra在ARC-AGI-3评测中的成绩从发布前草稿的98.6%提升至最终页面的99.99%,其编程评测成绩也从57.7%小幅上调至57.9%。OpenAI表示,评测结果会受到模型版本、工具配置、推理级别及测试运行等因素影响,此次调整是为了确保数据更准确地反映模型的最佳性能。不过,斯坦福大学研究人员认为,频繁重新运行评测可能涉及所谓“Benchmaxxing”,即通过调整测试条件最大化基准成绩。

订阅 RecodeX 创投情报 每日融资动态与原创深度报道,直达邮箱