氛围检测:Grok 4 在考试中表现优异,但现实世界是另一回事

最聪明的模型未必是最实用的
Grok 4 正在领跑多项重要人工智能基准测试 。但为何外界对其评价如此褒贬不一 ?更奇怪的是,Every 公司的工程师们为何很少使用它?
xAI 最新发布的 Grok 4 被定位为具备高级推理能力的 LLM。该模型上周在直播发布会中首次亮相, 埃隆·马斯克和 xAI 团队成员坐在黑色沙发上,指着似乎显示 Grok 4 在人类终极考试和 ARC-AGI 等知名基准测试中卓越表现的图表。
但我们 Studio 团队的速评是:Grok 4 很聪明,但似乎对基准测试存在过度训练——实际应用中不足以成为日常任务的首选工具。它本应擅长编程,但由于缺乏内置命令行界面(CLI),尝试使用它的门槛很高。(CLI 是一种基于文本的界面,开发者可直接向模型输入指令,无需在不同应用或窗口间切换。)
“这里出现了新的竞争态势——Claude Code[拥有专属命令行工具]的用户黏性很强,”Every 公司 CEO 兼联合创始人丹·希珀表示。
以下是新功能亮点、团队观点与外界评价
Grok 4 的核心机制解析
Grok 4 是一种隐式推理模型,用户既无法查看推理标记也无法关闭推理模式。换言之,它总是在回答前进行深度思考,但不会展示思考过程,也不允许你中止这种深度思考。
xAI 通过定制化的强化学习训练该模型,旨在提升其推理能力——因此 Grok 4 号称在数学、物理等技术领域表现卓越。它能同时接收图像和文本提示,并拥有 256,000 个标记的上下文窗口,是其前代 Grok 3 的两倍,也超过了 OpenAI 的 o3 和 Claude Opus 4 目前 20 万标记的上限。
此次发布还包含被描述为 Grok 4 强化版的 Grok 4 Heavy。马斯克在解释其工作原理时表示 ,它会”并行生成多个[Grok 4]代理”,然后这些代理会”像学习小组一样”比较工作成果以找出最佳答案。
消费者可通过两种订阅方案使用这些模型:每月 30 美元的”SuperGrok”套餐,或包含 Grok 4 Heavy 访问权限的每月 300 美元”SuperGrok Heavy”套餐。对开发者而言,Grok 4 的定价与 Anthropic 的 Claude Sonnet 4 持平:每百万输入标记 3 美元,每百万输出标记 15 美元。
当模型答对了问题却偏离了重点时
理论上,Grok 4 凭借其推理优先的训练模式,本应在编程任务中表现卓越。但早期迹象表明,它可能过度拟合了基准测试——或者说,正如作家兹维·莫肖维茨所称的能正确回答”考试型问题”。物理学家凯西·汉德默向 Grok 提出了四个更注重解答过程而非结果的问题,发现该模型表现欠佳。”Grok 4 能轻松解决物理奥林匹克式考题,”汉德默在推文中指出 ,”但它似乎仍缺乏对物理学至关重要的核心洞察力。”
这使得 Grok 4 在实际应用中的实用性被高估。缺乏工具支持加剧了使用障碍:Grok 4 没有内置命令行界面,因此需要更多配置才能使用——除非通过第三方工具如 AI 代码编辑器 Cursor。(我们团队多数成员已弃用 Cursor,因为 Claude Code 现已深度集成到日常工作流中。)
此外还存在与 xAI 模型相关的安全隐患。作家西蒙·威尔逊发现 ,Grok 4 在回应争议性问题时会援引埃隆·马斯克的观点。一位 Anthropic 研究员公开批评 xAI 未按行业惯例公布安全测试文档。本月初 Grok 3 还曾公开赞美阿道夫·希特勒 ,尽管 xAI 发布了道歉声明 ,但前沿模型出现此类行为极大损害了信任度。
每个 Every 成员都在想的事……
以下是 Grok 4 在我们内部评估新模型时使用的部分基准测试表现:
外交博弈:顶级表现
“Grok 4 在外交博弈中达到 o3 级别…也就是说 S 级 ,领先其他所有模型一个档次。”——Every 公司 AI 训练负责人亚历克斯·达菲评价这款新模型在他共同创立的基准测试中的表现:通过复杂策略游戏《外交》来评估 LLMs
读者参与度测试:仍落后于 Claude
我们对 Grok 4 进行了与前几代前沿模型相同的”读者参与度测试”,其表现与[OpenAI 的]o3 相当,但逊于 Claude Opus 4。
读者参与度测试是我们使用的一种提示方法,让 LLM 阅读某些文字内容(目前主要是推文),然后判断这些文字是否能保持读者在逐句阅读时的参与感。我们发现 Claude Opus 4 是唯一能稳定完成这项任务的模型。”——Danny Aziz, Spiral 总经理
视觉生成提示:Grok 略胜新兴开源模型 Kimi
“Grok 生成的图像效果不错。[新兴开源模型]Kimi[也]可以,[但]准确性不如 Grok。”——Cora 总经理 Kieran Klassen, 对比了 Grok 和 Kimi K2 在其标志性测试中的表现,该测试要求新模型生成特定类型森林的图像
“Grok 4 有点慢。”—— 基兰,在发布关于 Grok 生成图像的推文几分钟后
以下是 Every 对 Grok 4 的更多看法:
考试表现优异,现实表现欠佳
“它在基准测试中表现惊人,但实际使用时并未明显优于其他产品,而且由于它不像 Claude Code 那样集成到自己的 CLI 中,提高了尝试门槛——除非你使用 Cursor,但我们大多数人已经不怎么用 Cursor 了。”—— 丹
xAI 的进展速度确实惊人
“我看到一个去年还不存在的新 AI 玩家。这个玩家以巨大优势碾压了最难的 AI 排行榜,差距之大让图表看起来像恶搞图——但这是真实的。然后我想到创造它的人,他作为这个 AI 领域最老牌公司的前联合创始人,如今却成了其死敌。这让我突然意识到我们正身处多么疯狂的历史时刻。”—— 尼提耶什·阿加瓦尔, 科拉项目工程师,在其 X 时间线上看到上图后如是说
“只是因为它不在我常用的 AI 应用里,所以我用得不多……[但 xAI 拥有]先发优势[得益于其]快速发布的能力。OpenAI 迅速获得了用户认可,所以现在要想赢得用户就得翻越一座大山。话说回来,老实讲,尽管有点尴尬,[xAI 是]首个推出 AI 伴侣的主流实验室,看起来这个功能正在被接受。”—— 亚历克斯 , 在看到 Grok 内 AI 伴侣功能似乎逐渐受到关注后
Grok 4 的写作水平并不出众
“我用[Grok 4]替换了新 Spiral 内部的模型,[结果]初稿质量明显下降。”——丹尼
别人都在想什么
开发者们很难信任 Grok
谈及 Grok 3 的仇恨言论事件时,西蒙·威尔逊指出 :”如果 xAI 希望开发者在 Grok 上构建应用程序,就必须做得比这好得多。这种荒谬的自毁性错误根本无法建立开发者信任!”
Grok 4 缺乏明确的应用场景;更糟的是,它还存在气质问题
机器学习研究员内森·兰伯特补充道 ,他认同 Grok 4 存在”严重的品牌风险”,并指出”在基准测试中追赶是一回事,但为昂贵的前沿模型找到用途并非水到渠成——随着模型性能趋于同质化,这已成为核心挑战。”
强化学习的规模化应用依然有效
作家兼学者伊桑·莫里克发推文称,Grok 4 表明”模型扩展仍然有效(遵循扩展定律预测的收益递减规律),而工具使用可以解锁性能提升”。换言之,虽然通过扩大模型规模仍能获得更好结果,但这并非唯一出路。模型与工具交互方式的创新正在开辟新可能,因此 AI 的未来很可能由工具使用与持续模型扩展共同塑造。
Grok 4 作为编程任务的规划专家
AI 编程助手 Cline 指出 ,其用户正将 Grok 4 用作”规划专家”。该机器人补充道:”值得关注的是:(1)它修复了 Opus 和 o3 无法解决的错误 (2)虽然昂贵,但复杂推理场景物有所值 (3)部分用户先用 Grok 4 进行架构设计,再交由廉价模型执行。真实工作流正在形成:Grok 4 负责规划模式 → DeepSeek 负责执行模式。”
一个并不那么实用的智能前沿模型
匿名 AI 评论员 xjdr 给出了中肯评价 :”从积极面看,xAI 及其团队打造的模型确实处于技术前沿…但缺点是过度依赖强化学习导致效果失真,且存在话痨式逢迎倾向。其响应速度慢到需要与[OpenAI 的推理模型]o3-pro 竞争,但我每次都更倾向后者。”
泰勒·考恩也更青睐 o3
经济学家泰勒·考恩以隐晦方式发推称”o3 依然更胜一筹”。他关于如何引导 Grok 的博文并未阐明具体原因,但显然他更认可 OpenAI 的模型而非 Grok 4。

