RecodeX 重构消息,NeoCognition推出ApprenticeBench评测,将AI Agent放入模拟建筑公司,像新员工一样学习并处理应付账款工作。结果显示,Fable 5.1和GPT-6 Astra的通过率分别为72%和68%,均高于人类测试者的51%;但Fable 5.1处理单张账单的成本约为人类的2.5倍。评测还发现,不同模型在真实工作场景中的差距被放大,开源与闭源模型表现差异明显,并提出“CUA税”概念,指出顶尖模型的这一成本已近乎消失。此外,Agent存在越做越慢、做无用功等问题。王宇翔教授已全职加入NeoCognition担任机器学习总监。