全球大语言模型榜
综合全球闭源与开放权重大模型的客观能力、独立综合评测和真实用户偏好;同时拆分推理、编程、Agent、速度、性价比与采用度维度。
页面快照时间:2026/09/17 04:59当前公开数据更新于 2026/09/16 08:00
综合分沿用本站既有评估方法,各项跑分保留原始尺度,不代表同一条件下的统一测试。缺测显示“—”,不会按零分处理。
当前显示 38 个模型数据与方法
| 模型 / 提供商 | 综合参考分 | 数据覆盖 | LiveBench | Artificial Analysis | LMArena | 推理 | 编程 | 智能体 | 输入 / 输出价格美元 / 百万 tokens | 输出速度tokens / 秒 |
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Fable 5 MaxAnthropic闭源 | 90.7 | 3 项 | 83 | 49.7 | 1,493 | 89.7 | 86 | 62.2 | 10 / 50 | 64.5 |
| Claude Opus 5 MaxAnthropic闭源 | 87.6 | 3 项 | 80.1 | 50.7 | 1,505 | 91.2 | 81.4 | 65.2 | 5 / 25 | 50 |
| GPT-5.6 Sol MaxOpenAI闭源 | 86 | 3 项 | 81.1 | 47.1 | 1,455 | 91.7 | 83.9 | 56.2 | 4 / 20 | 64.7 |
| Kimi K3 MaxMoonshot AI开放权重 | 85 | 3 项 | 79.2 | 43.8 | 1,472 | 90.7 | 81.4 | 62.2 | 3 / 15 | 34.8 |
| Claude Fable 5.1 MaxAnthropic闭源 | 84.2 | 3 项 | 83.4 | 53.4 | 1,508 | 91.7 | 86.4 | 66.1 | 10 / 50 | 66 |
| GLM-5.3 MaxZ.ai闭源 | 83.5 | 3 项 | 76.1 | 44.9 | 1,475 | 85.8 | 79 | 60.9 | 1.4 / 4.4 | 66.6 |
| Qwen3.8 MaxAlibaba闭源 | 83.2 | 3 项 | 78.5 | 45.4 | 1,481 | 88.2 | 72.9 | 64.6 | 2 / 6 | 41.3 |
| Gemini 3.7 Flash HighGoogle闭源 | 82.5 | 3 项 | 78.8 | 39.4 | 1,491 | 87.8 | 78.9 | 58.3 | 0.75 / 3.75 | 292.3 |
| Grok 4.6 HighxAI闭源 | 81.9 | 3 项 | 78 | 44.4 | 1,430 | 90.5 | 76.8 | 57 | 2 / 6 | 59.1 |
| GPT-5.6 Terra MaxOpenAI闭源 | 80.3 | 3 项 | 77.9 | 42.3 | 1,446 | 90.6 | 78.2 | 54.9 | 2 / 12 | 101.2 |
| Grok 4.5 HighxAI闭源 | 79.5 | 3 项 | 75.8 | 39.1 | 1,450 | 87.2 | 68.6 | 56.5 | 2 / 6 | 60.5 |
| Claude Opus 5 HighAnthropic闭源 | 79.2 | 2 项 | — | 48.2 | 1,505 | — | — | — | 5 / 25 | 49.3 |
| Claude Sonnet 5 MaxAnthropic闭源 | 78.2 | 3 项 | 76 | 38.4 | 1,442 | 88.7 | 80.7 | 59.4 | 2 / 10 | 83.9 |
| Gemini 3.1 Pro PreviewGoogle闭源 | 78.2 | 3 项 | 77 | 30.4 | 1,480 | 84 | 76.5 | 44.1 | 2 / 12 | 108.4 |
| Qwen3.8 27B XHighAlibaba开放权重 | 78 | 3 项 | 75.3 | 33.9 | 1,439 | 80 | 75.7 | 61.4 | 0.5 / 3 | 44.7 |
| DeepSeek V4 Pro 0813DeepSeek开放权重 | 77.7 | 3 项 | 77.4 | 36.3 | 1,451 | 85.8 | 77.2 | 54.9 | 1.32 / 3.96 | 94.4 |
| Gemini 3.6 Flash HighGoogle闭源 | 77.7 | 3 项 | 73.6 | 34.3 | 1,476 | 85.1 | 77.9 | 43.4 | 0.75 / 3.75 | 183.6 |
| Muse Spark 1.3 MaxMeta闭源 | 77.6 | 3 项 | 81.6 | 48.2 | 1,490 | 89.7 | 81.1 | 64.1 | 1.25 / 4.25 | 220.8 |
| DeepSeek V4 Flash 0731DeepSeek开放权重 | 77.2 | 3 项 | 74.2 | 34.5 | 1,432 | 86.6 | 75 | 46.8 | 0.44 / 1.32 | 214.9 |
| GLM-5.2 MaxZ.ai开放权重 | 77 | 3 项 | 73.2 | 34 | 1,467 | 78.6 | 79.7 | 51.8 | 1.4 / 4.4 | 73.1 |
| GPT-5.6 Luna MaxOpenAI闭源 | 77 | 3 项 | 73.6 | 37.5 | 1,430 | 85.6 | 82.9 | 48.4 | 0.2 / 1.2 | 116.7 |
| GPT-6 Astra MaxOpenAI闭源 | 76 | 3 项 | 82.2 | 52.8 | 1,444 | 92.7 | 80.4 | 57.3 | 10 / 50 | 54 |
| DeepSeek V4.1 Flash MaxDeepSeek开放权重 | 73.3 | 2 项 | 81.1 | 39.5 | — | 86.7 | 80 | 77.3 | 0.3 / 1.2 | 212.1 |
| Muse Spark 1.2 XHighMeta闭源 | 68.8 | 3 项 | 78 | 39.8 | 1,489 | 90 | 77.5 | 57.6 | 1.25 / 4.25 | 181.2 |
| GPT-5.5 XHighOpenAI闭源 | 68.6 | 3 项 | 80.2 | 38.6 | 1,466 | 89.7 | 82.1 | 54 | 5 / 30 | 94.1 |
| Gemini 3.8 Flash HighGoogle闭源 | 67.3 | 3 项 | 75.8 | 41.2 | 1,495 | 89.3 | 72.5 | 54.2 | 0.75 / 3.75 | 335.5 |
| Claude Opus 4.7 MaxAnthropic闭源 | 66.8 | 3 项 | 76.5 | 40.7 | 1,483 | 87.2 | 82.1 | 50.7 | 5 / 25 | 44.9 |
| Qwen3.8-Flash-NextAlibaba开放权重 | 65.9 | 2 项 | 76.2 | 39.9 | — | 87.4 | 72.6 | 61.6 | 0.15 / 0.47 | 52.5 |
| GPT-5.4 MaxOpenAI闭源 | 64.8 | 3 项 | 78 | 39 | 1,453 | 88.1 | 77.5 | 53.8 | 2.5 / 15 | 141.9 |
| Claude Opus 4.8 MaxAnthropic闭源 | 64 | 3 项 | 76.2 | 42 | 1,453 | 89.2 | 81.8 | 50.5 | 5 / 25 | 56.1 |
| Muse Spark 1.1 XHighMeta闭源 | 61.8 | 3 项 | 75.3 | 34.3 | 1,480 | 87.7 | 77.2 | 58.5 | 1.25 / 4.25 | 178.6 |
| GPT-5.5 HighOpenAI闭源 | 61.5 | 2 项 | — | 37.3 | 1,471 | — | — | — | 5 / 30 | 92.4 |
| Gemini 3.5 Flash HighGoogle闭源 | 60.5 | 3 项 | 74.6 | 33 | 1,482 | 82 | 78.2 | 49 | 1.5 / 9 | 219.1 |
| GLM-5.3-FlashZ.ai开放权重 | 60.1 | 3 项 | 71.6 | 41.9 | 1,472 | 77.6 | 79 | 56.8 | 0.15 / 0.5 | 114.4 |
| Gemini 3.5 Flash MediumGoogle闭源 | 58.7 | 2 项 | — | 33.6 | 1,476 | — | — | — | 1.5 / 9 | 222.2 |
| Muse SparkMeta闭源 | 56 | 2 项 | — | 31.3 | 1,473 | — | — | — | — / — | — |
| Claude Opus 4.6 Non-reasoning HighAnthropic闭源 | 55.9 | 2 项 | — | 26.4 | 1,498 | — | — | — | 5 / 25 | 37.1 |
| Gemini 3 Pro Preview HighGoogle闭源 | 53.9 | 2 项 | — | 28 | 1,480 | — | — | — | 2 / 12 | — |
来源与快照
不同来源更新时间可能不同;价格与速度并非质量评分,实际调用表现仍需按任务验证。
- LiveBench23 项可客观判分任务,覆盖七个能力维度(综合分 50%)2026-06-25
- Artificial AnalysisIntelligence Index、子基准、价格与推理速度(综合分 30%)2026-09-16
- LMArena匿名对战形成的真实用户偏好分(综合分 20%)2026-09-13
- OpenRouter过去 7 天 API 路由 token 份额,作为采用度维度,不计入综合分未提供快照日期
- ARC PrizeARC-AGI-2 半私有集得分与单题成本,不计入综合分2026-09-04
- Stanford HELM用于复核评测透明度与方法框架,不直接计入本期综合分未提供快照日期