事件追踪 · 持续发展中

NeoCognition智能体评测

持续追踪NeoCognition智能体评测相关报道与进展。

我的关注 →RSS 订阅
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。

事件时间线

按最新发布排序

持续追踪NeoCognition智能体评测相关报道与进展。

Readhub中性AI 看多

NeoCognition发布ApprenticeBench:Fable 5.1应付账款通过率72%超人类

RecodeX 重构消息,NeoCognition推出ApprenticeBench评测,将AI Agent放入模拟建筑公司,像新员工一样学习并处理应付账款工作。结果显示,Fable 5.1和GPT-6 Astra的通过率分别为72%和68%,均高于人类测试者的51%;但Fable 5.1处理单张账单的成本约为人类的2.5倍。评测还发现,不同模型在真实工作场景中的差距被放大,开源与闭源模型表现差异明显,并提出“CUA税”概念,指出顶尖模型的这一成本已近乎消失。此外,Agent存在越做越慢、做无用功等问题。王宇翔教授已全职加入NeoCognition担任机器学习总监。