何恺明团队发布AGI评测基准,Claude满分GPT获99分
RecodeX 重构消息,何恺明团队推出了一项面向通用人工智能的评测基准,测试结果显示Anthropic的Claude模型取得满分,OpenAI的GPT模型获得99分。该评测旨在以更严苛的标准衡量大模型在AGI相关任务上的能力表现,两项成绩均接近或达到满分水平。
持续追踪何恺明VISTA视觉系统相关报道与进展。
关注仅保存在当前浏览器和域名中,无需登录,不会自动跨设备同步。RecodeX 重构消息,何恺明团队推出了一项面向通用人工智能的评测基准,测试结果显示Anthropic的Claude模型取得满分,OpenAI的GPT模型获得99分。该评测旨在以更严苛的标准衡量大模型在AGI相关任务上的能力表现,两项成绩均接近或达到满分水平。
RecodeX 重构消息,何恺明团队推出VISTA系统,将ARC-AGI-3测试中的数字表转换为直观图像,并加入无损视觉记忆“相册”机制,允许模型随时回溯任意帧画面细节且不计入操作步数,无需额外训练模型或为每个游戏编写模拟器代码。
测试结果显示,Claude Opus 5借此拿下ARC-AGI-3全部25个公开游戏满分,通关步数仅为首次游玩人类的0.43倍;GPT-5.6 Sol获得99分;原本仅得1.89分的320B开源模型套用VISTA后得分升至66.93分。该系统在3D场景、网页游戏、静态看图题等场景下均有表现。