开发者称 GPT-5 好坏参半
本文信息来源:wired
软件工程师发现,OpenAI 的新 GPT-5 模型在帮助他们思考编码问题方面很有用——但在实际编码上的表现并没有好太多。

上周,当 OpenAI 发布 GPT-5 时,它告诉软件工程师,这款模型旨在成为一名“ 真正的编码协作伙伴 ”,擅长生成高质量代码并执行具备自主性的自动化软件任务。虽然公司并未明确说明,但 OpenAI 似乎是在直接瞄准 Anthropic 的 Claude Code,后者已迅速成为许多开发者进行 AI 辅助编程的首选工具。
但开发者告诉 WIRED,GPT-5 目前的表现好坏参半。它在技术推理和规划编码任务方面表现出色,但一些人表示,Anthropic 最新的 Opus 和 Sonnet 推理模型依然能生成更好的代码。根据开发者使用的 GPT-5 版本不同——低、中或高冗长度——该模型可能会更为详尽,而这有时会导致它生成不必要或重复的代码行。
一些软件工程师还批评了 OpenAI 评估 GPT-5 编码性能的方式,认为其使用的基准测试具有误导性。一家研究公司称 OpenAI 发布的一张夸耀 GPT-5 能力的图表是一次“图表犯罪”。
GPT-5 至少在一个方面表现突出:有几个人指出,与竞争对手的模型相比,它的性价比要高得多。“在我们的测试中,GPT-5 大多被其他 AI 模型超越,但它真的很便宜。”普林斯顿大学计算机科学博士生兼研究员、AI Snake Oil 一书的合著者 Sayash Kapoor 说道。
Kapoor 表示,自上周该模型向公众发布以来,他和团队一直在运行基准测试来评估 GPT-5 的能力。他指出,他们团队使用的标准测试——衡量语言模型编写代码以重现 45 篇科学论文结果的能力——在 GPT-5 设置为中等或中等冗长度时,运行成本为 30 美元。而使用 Anthropic 的 Opus 4.1 运行同样的测试则需要 400 美元。Kapoor 说,到目前为止,他的团队在测试 GPT-5 上总共花费了大约 2 万美元。
尽管 GPT-5 价格低廉,但 Kapoor 的测试表明,该模型的准确性也低于一些竞争对手。Claude 的高级模型在准确性方面达到了 51% 的评分,这一评分是通过其准确复现的科学论文数量来衡量的。GPT-5 的中等版本获得了 27% 的准确性评分。(Kapoor 尚未使用 GPT-5 高级版进行相同测试,因此这是一次间接比较,因为 Opus 4.1 是 Anthropic 最强大的模型。)
OpenAI 发言人 Lindsay McCallum 向 WIRED 提供了公司博客的链接,博客中提到他们在“与初创公司和企业的早期测试者合作下,基于真实世界的编码任务”训练了 GPT-5。公司还强调了 GPT-5 的一些内部准确性测量结果 ,显示 GPT-5 的“thinking”模型(进行更深思熟虑的推理)在所有 OpenAI 模型中准确性得分最高。然而,GPT-5 的“main”版本在 OpenAI 自己的准确性评分中,仍低于此前发布的模型。
Anthropic 发言人 Amie Rotherham 在一份声明中表示:“一旦开发者开始在生产环境中使用它们,性能声明和定价模型往往会呈现出不同的情况。由于推理模型在思考时可能会迅速消耗大量的 tokens,行业正在向一个以每个结果的价格比每个 token 的价格更重要的世界发展。”
一些开发者表示,他们目前对 GPT-5 的整体体验大多是积极的。工程师、投资人以及个人造型助手 Alta 的创作者 Jenny Wang 告诉《WIRED》,该模型在一次性完成复杂编码任务方面似乎比其他模型更出色。她将其与自己经常用于代码生成和简单修复(“比如格式化,或者我想创建一个与现有类似的 API 端点”)的 OpenAI o3 和 4o 进行了比较,Wang 说道。
在对 GPT-5 的测试中,Wang 表示她让模型为公司网站生成一个新闻页面的代码,其中包括与网站整体美学相匹配的特定设计元素。GPT-5 一次性完成了任务,而过去 Wang 需要在过程中多次修改提示。不过也有一个明显的错误:“它虚构了 URL,”Wang 说。
另一位开发者因雇主未授权其对媒体发言而要求匿名,他表示 GPT-5 在解决深层技术问题方面表现出色。
这位开发者目前的业余项目是编写一个程序化的网络分析工具,该工具出于安全目的需要代码隔离。“我基本上向它介绍了我的项目以及我正在考虑的一些路径,GPT-5 全部理解后,给出了几条建议以及一个切实可行的时间表,”这位开发者解释道,“我很惊讶。”
包括 Cursor、Windsurf 和 Notion 在内的少数 OpenAI 企业合作伙伴和客户,已公开为 GPT-5 的编码和推理能力作证。(OpenAI 在宣布新模型的博客文章中引用了其中许多评价。)Notion 还在 X 上分享称,它“速度快、全面,并且处理复杂工作的能力比我们测试过的其他模型高出 15%。”
但在 GPT-5 发布后的几天内,一些开发者就在网上发表了抱怨。许多人表示,GPT-5 的编码能力似乎落后于预期,与这家全球最受关注的 AI 公司所宣称的最先进、超强大的模型不符。
“OpenAI 的 GPT-5 很不错,但感觉像是一年前就会发布的东西,”正在开发电子邮件收件箱 AI 助手的开发者 Kieran Klassen 说。“它的编程能力让我想起了 Sonnet 3.5,”他补充道,指的是 Anthropic 于 2024 年 6 月推出的一个模型。
初创公司 Doist 的创始人 Amir Salihefendić 在一则社交媒体帖子中表示 ,他一直在 Cursor 中使用 GPT-5,但觉得它“相当令人失望”,而且“在编程方面尤其糟糕”。他说,GPT-4 的发布让人感觉像是一个“Llama 4 时刻”,指的是 Meta 的 AI 模型,该模型同样让 AI 社区中的一些人感到失望。
在 X 上,开发者 Mckay Wrigley 写道 ,GPT-5 是一个“出色的日常聊天模型”,但在编程方面,“我仍然会使用 Claude Code + Opus”。
其他开发者形容 GPT-5 “面面俱到”——有时很有帮助,但往往因其冗长而令人恼火。对 GPT-5 在她分配的前端编码项目中表现总体满意的王表示,她确实注意到该模型“更冗余。它显然可以提出更简洁或更短的解决方案。”(Kapoor 指出,GPT-5 的冗长程度是可以调整的,用户可以要求它少说一些,甚至减少推理,以换取更好的性能或更低的价格。)
AI 编码平台 Qodo 的联合创始人兼首席执行官 Itamar Friedman 认为,对 GPT-5 的一些批评源于人们对 AI 模型发布的期望不断变化。“我认为很多人以为 GPT-5 会是另一个 AI 全面提升的时刻,因为大家都在追求通用人工智能(AGI)。但实际上,这个模型只是针对几个关键的子任务有所改进。”他说。
Friedman 将 2022 年之前称为“BCE”——ChatGPT 时代之前(Before ChatGPT Era),那时的人工智能模型是整体性地提升的。在 ChatGPT 时代之后,新的人工智能模型往往只在某些方面更出色。Friedman 说:“例如,Claude Sonnet 3.5 是在编程方面独占鳌头的模型。而 Google Gemini 在代码审查方面变得非常出色,可以检查代码质量是否高。”
OpenAI 也因其用于运行基准测试并对 GPT-5 性能作出声明的方法论而受到一些批评——尽管基准测试在整个行业中差异很大。专注于半导体和人工智能领域的研究公司 SemiAnalysis 指出 ,OpenAI 仅运行了通常包含在 SWE-bench(一个相对较新的用于测试大型语言模型的 AI 行业框架)中的 500 项测试中的 477 项。(这是针对模型的整体性能,而不仅仅是编码。)
OpenAI 表示,它始终在固定的 477 个任务子集上测试其 AI 模型,而不是在 SWE-bench 测试的全部 500 个任务上进行测试,因为这 477 个任务是公司已在其内部基础设施上验证过的。McCallum 还提到了 GPT-5 的系统卡 ,其中指出模型的冗长度设置变化可能“导致评估性能的波动”。
Kapoor 表示,前沿 AI 公司最终面临着艰难的权衡。“当模型开发者训练新模型时,他们也会引入新的限制,并且必须考虑许多因素:用户期望 AI 的行为方式、它在某些任务(如自主编码)上的表现,同时还要控制成本,”他说。“在某种意义上,我认为 OpenAI 知道它不会打破所有这些基准测试,所以它做出了一个能够普遍取悦大多数人的产品。”