RecodeX 重构消息,DeepSWE基准测试发布最新大模型排名,该测试衡量模型在真实软件工程任务中的平均pass@1得分,即能否实际修复漏洞而非仅描述方案。当前前十名中,OpenAI占据七席:GPT-5.6 Sol(max)以69分居首,GPT-5.6 Sol(xHigh)和Terra(max)均获67分,Claude Fable 5(max)66分,GPT-5.6 Sol(High)65分,GPT-5.5(xHigh)与Kimi K3并列64分。榜首与第十名仅差6分,GPT-5.6 Sol在中等推理强度下与Kimi K3及GPT-5.5 xHigh同分。Kimi K3是前十中唯一非美国模型,且与成本高出数倍的模型处于同一区间。此外,榜首69分存在标注:Artificial Analysis指出该端点自基准测试以来内容安全过滤率较高。