LLM Stats 最新排行榜深度解析:全球 Top 15 大模型公司分布、能力对比与趋势洞察
从 LLM Stats 看 2026 年大模型格局
LLM Stats 是当下最权威的独立大模型排行榜之一,覆盖 300+ 模型,采用 TrueSkill 贝叶斯评级系统,综合 Reasoning(推理)、Coding(编码)、Agent(智能体)、Code Arena(竞技场)等多个维度给出统一排名。其 v3.0 方法论不依赖简单平均分,而是将每个 Benchmark 视为一场"多人竞技",用排名信息而非绝对分数计算能力估计值。缺失的 Benchmark 不计为零,而是保持更大的不确定性区间——这让新模型不会被"未参评"拖累。
本文基于 2026 年 7 月最新数据,逐一分析 Top 15 模型的公司格局、能力分布和性价比趋势。
Top 15 总览
| 排名 | 模型 | 公司 | LLM Stats | 推理 | 编码 | Agent | Code Arena | 上下文 | 速度 | 价格($/M) | 许可 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 57.9 | 58.5 | 49.6 | 44.8 | 1,959 | 1.1M | 248c/s | $7.78 | 闭源 |
| 2 | Claude Mythos Preview | Anthropic | 56.9 | 56.9 | 47.3 | 39.3 | — | — | — | — | 闭源 |
| 3 | Claude Fable 5 | Anthropic | 56.7 | 54.2 | 47.1 | 43.5 | 2,018 | 1.0M | 116c/s | $14.44 | 闭源 |
| 4 | Kimi K3 | Moonshot AI | 55.2 | 54.5 | 44.0 | 42.4 | — | 1.0M | 114c/s | $4.33 | 闭源 |
| 5 | GPT-5.6 Terra | OpenAI | 53.1 | 52.3 | 45.8 | 41.0 | 834 | 1.1M | 307c/s | $3.89 | 闭源 |
| 6 | Muse Spark 1.1 | Meta | 52.9 | 52.6 | 37.9 | 38.2 | — | 1.0M | — | $1.58 | 闭源 |
| 7 | Claude Opus 4.8 | Anthropic | 52.6 | 52.0 | 43.6 | 37.9 | 1,676 | 1.0M | 87c/s | $7.22 | 闭源 |
| 8 | Claude Sonnet 5 | Anthropic | 51.0 | 50.4 | 39.5 | 35.3 | 1,536 | 1.0M | 199c/s | $4.33 | 闭源 |
| 9 | Grok 4.5 | xAI | 49.0 | 47.7 | 39.7 | 34.9 | 1,142 | 500K | 180c/s | $2.44 | 闭源 |
| 10 | GPT-5.5 | OpenAI | 48.8 | 48.1 | 39.9 | 33.5 | 2,115 | 1.1M | 167c/s | $7.78 | 闭源 |
| 11 | Seed 2.1 Pro | 字节跳动 | 47.8 | 48.9 | 36.1 | 33.0 | — | — | — | — | 闭源 |
| 12 | GLM-5.2 | 智谱 AI | 47.6 | 46.7 | 38.1 | 33.5 | 1,509 | 1.0M | 201c/s | $1.18 | 开源 |
| 13 | Qwen3.7 Max | 阿里云 | 46.8 | 47.4 | 37.6 | 31.4 | 1,692 | 1.0M | 171c/s | $1.53 | 闭源 |
| 14 | Claude Opus 4.6 | Anthropic | 46.4 | 46.8 | 35.3 | 31.3 | 2,127 | 1.0M | 44c/s | $7.22 | 闭源 |
| 15 | GPT-5.6 Luna | OpenAI | 46.3 | 46.6 | 38.1 | 32.8 | 703 | 1.1M | 549c/s | $1.56 | 闭源 |
注:Score 范围为 0-100,采用 μ − 3σ 保守估计。价格为单位百万 token 输入价格。
一、公司格局:两强争霸,中国力量崛起
按模型数量分布
pie title Top 15 模型公司分布
"Anthropic" : 5
"OpenAI" : 4
"Moonshot AI" : 1
"Meta" : 1
"xAI" : 1
"字节跳动" : 1
"智谱 AI" : 1
"阿里云" : 1Top 15 中,Anthropic 以 5 款模型上榜成为最大赢家——从预览版的 Mythos 到已发布的 Fable 5、Opus 4.8/4.6、Sonnet 5,产品矩阵覆盖从旗舰到中端。OpenAI 以 4 款紧随其后,全部是 GPT-5.x 系列的不同变体。中美公司形成了 11:4 的数量对比。
但只数"有几个模型上榜"会掩盖真相。我们来看综合实力:
按公司综合实力
| 公司 | 上榜数 | 最高排名 | 平均 Score | 价格区间($/M) |
|---|---|---|---|---|
| OpenAI | 4 | #1 (57.9) | 51.5 | $1.56–7.78 |
| Anthropic | 5 | #2 (56.9) | 52.7 | $4.33–14.44 |
| Moonshot AI | 1 | #4 (55.2) | 55.2 | $4.33 |
| Meta | 1 | #6 (52.9) | 52.9 | $1.58 |
| xAI | 1 | #9 (49.0) | 49.0 | $2.44 |
| 字节跳动 | 1 | #11 (47.8) | 47.8 | — |
| 智谱 AI | 1 | #12 (47.6) | 47.6 | $1.18 |
| 阿里云 | 1 | #13 (46.8) | 46.8 | $1.53 |
三个关键洞察:
OpenAI 守住王座但腹背受敌。 GPT-5.6 Sol 以 57.9 分登顶,但 Anthropic 的 Mythos(56.9)和 Fable 5(56.7)咬得极紧。更值得注意的是,OpenAI 的平均分(51.5)实际上低于 Anthropic(52.7),说明 Anthropic 在整体产品线上略占上风。
中国模型进入第一梯队。 Kimi K3 以 55.2 分冲到全球第 4,不仅远超 GPT-5.5(48.8),甚至在推理能力(54.5)上超越了 Claude Fable 5(54.2)。这是中国模型首次在综合榜上与全球最顶尖模型同台竞技。
腰部玩家格局清晰。 Meta(Muse Spark 1.1)、xAI(Grok 4.5)各有特色定位——Meta 主打极致性价比,xAI 在速度上发力。字节、智谱、阿里构成中国模型的"第二梯队",Score 集中在 46-48 区间。
二、能力维度深度对比
LLM Stats 从四个维度评测:推理(Reasoning)、编码(Coding)、智能体(Agent)、竞技场编码(Code Arena)。每个维度揭示的是不同类型的能力偏好。
2.1 推理能力(Reasoning)
推理是当前大模型竞争最激烈的维度,直接决定模型"聪不聪明"。
xychart-beta
title "Top 15 推理能力排行榜"
x-axis ["GPT-5.6 Sol", "Claude Mythos", "Kimi K3", "Claude Fable 5", "Muse Spark 1.1", "GPT-5.6 Terra", "Claude Opus 4.8", "Claude Sonnet 5", "Seed 2.1 Pro", "GPT-5.5", "Grok 4.5", "Qwen3.7 Max", "Claude Opus 4.6", "GLM-5.2", "GPT-5.6 Luna"]
y-axis "Reasoning Score" 30 --> 60
bar [58.5, 56.9, 54.5, 54.2, 52.6, 52.3, 52.0, 50.4, 48.9, 48.1, 47.7, 47.4, 46.8, 46.7, 46.6]推理前三强:
- GPT-5.6 Sol (58.5):推理之王,独一档存在
- Claude Mythos Preview (56.9):未发布已展现恐怖实力
- Kimi K3 (54.5):中国模型推理能力巅峰
一个有趣的细节:字节 Seed 2.1 Pro 的推理分(48.9)反超了它的综合能力(47.8),甚至高于 GPT-5.5(48.1)。这说明字节在推理能力上投入了大量资源,综合排名低更多是因为 Agent 和 Code Arena 维度拖了后腿。
2.2 编码能力(Coding)
编码是工程生产力的关键指标,也是当前大模型落地最多的场景之一。
| 排名 | 模型 | Coding | 综合排名 | 编码相对综合的偏差 |
|---|---|---|---|---|
| 1 | GPT-5.6 Sol | 49.6 | #1 | — |
| 2 | Claude Mythos | 47.3 | #2 | — |
| 3 | Claude Fable 5 | 47.1 | #3 | — |
| 4 | GPT-5.6 Terra | 45.8 | #5 | ↑ |
| 5 | Kimi K3 | 44.0 | #4 | ↓ |
| 6 | Claude Opus 4.8 | 43.6 | #7 | ↑ |
| 7 | Grok 4.5 | 39.7 | #9 | ↑↑ |
| 8 | GPT-5.5 | 39.9 | #10 | ↑↑ |
| 8 | Claude Sonnet 5 | 39.5 | #8 | — |
| 10 | GLM-5.2 | 38.1 | #12 | ↑↑ |
关键发现:GPT-5.6 Terra 的编码能力(45.8)远超其综合排名预期——它在综合榜排第 5,但编码分几乎是独一档的"旗舰之下第一人"。OpenAI 似乎有意将 Terra 定位为"编码特化版"。
Grok 4.5 和 GPT-5.5 的编码相对综合排名也明显"超常发挥",说明这两款模型在工程场景中有独特优势。
2.3 Agent 能力
Agent 能力是 2026 年大模型竞争的核心战场——它衡量的是模型作为智能体自主完成任务的能力,包括工具调用、多步规划、环境交互等。
xychart-beta
title "Agent 能力 Top 10"
x-axis ["GPT-5.6 Sol", "Claude Fable 5", "Kimi K3", "GPT-5.6 Terra", "Claude Mythos", "Muse Spark", "Claude Opus 4.8", "Claude Sonnet 5", "Grok 4.5", "GPT-5.5"]
y-axis "Agent Score" 30 --> 50
bar [44.8, 43.5, 42.4, 41.0, 39.3, 38.2, 37.9, 35.3, 34.9, 33.5]Agent 维度的竞争格局与综合排名高度一致,说明 Agent 能力正在成为区分"能用"和"好用"的分水岭。
值得关注的是 Kimi K3 在 Agent 维度(42.4)超越了 GPT-5.6 Terra(41.0)和 Claude Mythos(39.3)。如果这个趋势持续,中国模型可能在 Agent 应用落地场景中占据先机。
2.4 Code Arena(竞技场编码)
Code Arena 反映的是模型在真实竞技场环境中的编码表现,更接近实际开发体验。
| 排名 | 模型 | Code Arena | 综合 Code Arena 排名 |
|---|---|---|---|
| 1 | Claude Opus 4.6 | 2,127 | #1 |
| 2 | GPT-5.5 | 2,115 | #2 |
| 3 | Claude Fable 5 | 2,018 | #3 |
| 4 | GPT-5.6 Sol | 1,959 | #4 |
| 5 | Qwen3.7 Max | 1,692 | #5 |
| 6 | Claude Opus 4.8 | 1,676 | #6 |
| 7 | Claude Sonnet 5 | 1,536 | #7 |
| 8 | GLM-5.2 | 1,509 | #8 |
| 9 | Grok 4.5 | 1,142 | #9 |
Code Arena 的排名与 Coding 维度出现了有趣的错位。Coding 分最高的 GPT-5.6 Sol(49.6)在 Code Arena 仅排第 4,而被认为"即将退役"的 Claude Opus 4.6 却以 2,127 分登顶。这说明 Benchmark 编码能力 ≠ 真实编码体验——竞技场的 ELo 分更反映实际用户偏好。
通义 Qwen3.7 Max(1,692)和智谱 GLM-5.2(1,509)在 Code Arena 的表现远好于他们在 Coding 维度的排名,说明这两个模型在真实开发场景中的用户满意度出乎意料地高。
三、性价比战争:速度 × 价格 × 能力
如果说 2025 年大家还在卷能力,那 2026 年的主题词就是**"单位美元买到多少智能"**。
3.1 价格分布
$14.44 ████████████████████████████████████ Claude Fable 5 (最贵)
$7.78 ██████████████████████████ GPT-5.6 Sol / GPT-5.5
$7.22 ██████████████████████████ Claude Opus 4.8 / 4.6
$4.33 ██████████████████ Kimi K3 / Claude Sonnet 5
$3.89 ████████████████ GPT-5.6 Terra
$2.44 ████████████ Grok 4.5
$1.58 ████████ Muse Spark 1.1
$1.56 ████████ GPT-5.6 Luna
$1.53 ████████ Qwen3.7 Max
$1.18 ██████ GLM-5.2 (最便宜)价格跨度惊人:从 GLM-5.2 的 $1.18/M 到 Claude Fable 5 的 $14.44/M,差了 12 倍。但更值得关注的是"甜蜜点"的出现——
3.2 性价比矩阵
将 LLM Stats Score 与价格结合,可以得到"智能密度":
| 模型 | Score | 价格($/M) | 智能/价格比 | 速度 |
|---|---|---|---|---|
| GLM-5.2 | 47.6 | $1.18 | 40.3 | 201c/s |
| Qwen3.7 Max | 46.8 | $1.53 | 30.6 | 171c/s |
| GPT-5.6 Luna | 46.3 | $1.56 | 29.7 | 549c/s |
| Muse Spark 1.1 | 52.9 | $1.58 | 33.5 | — |
| Grok 4.5 | 49.0 | $2.44 | 20.1 | 180c/s |
| Kimi K3 | 55.2 | $4.33 | 12.7 | 114c/s |
| Claude Fable 5 | 56.7 | $14.44 | 3.9 | 116c/s |
性价比之王的竞争异常激烈:
- GLM-5.2 以 40.3 的智能/价格比夺冠——而且还是 唯一的开源模型。这意味着你不仅可以用极低成本调用 API,还能私有化部署。
- **Qwen3.7 Max(30.6)和 GPT-5.6 Luna(29.7)**紧咬不放。Luna 还有一个杀手锏:549c/s 的极致速度,是所有模型中最快的,比第二名 GPT-5.6 Terra(307c/s)快了近 80%。
- Muse Spark 1.1 以 52.9 的高分 + $1.58 的低价成为"高端性价比"的标杆。
3.3 速度之王
速度直接影响用户体验。当前速度排名:
549c/s ██████████████████████████████████████████████████ GPT-5.6 Luna
307c/s ██████████████████████████████ GPT-5.6 Terra
248c/s █████████████████████████ GPT-5.6 Sol
201c/s ████████████████████ GLM-5.2
199c/s ████████████████████ Claude Sonnet 5
180c/s ██████████████████ Grok 4.5
171c/s █████████████████ Qwen3.7 Max
167c/s █████████████████ GPT-5.5
116c/s ████████████ Claude Fable 5
114c/s ████████████ Kimi K3
87c/s █████████ Claude Opus 4.8
44c/s ████ Claude Opus 4.6OpenAI 在速度上展现了恐怖的工程能力——前三快全部来自 GPT-5.6 系列。而 Anthropic 的 Claude 系列在速度上明显落后,Opus 4.6 仅 44c/s,是同价位 GPT-5.6 Sol(248c/s)的 1/5。
四、中国模型图谱:从追赶到平行竞争
Top 15 中的 4 款中国模型代表了当前国内大模型的最高水平:
| 模型 | 公司 | 排名 | Score | 推理 | 编码 | Agent | 特点 |
|---|---|---|---|---|---|---|---|
| Kimi K3 | 月之暗面 | #4 | 55.2 | 54.5 | 44.0 | 42.4 | 综合最强,Agent 突出 |
| Seed 2.1 Pro | 字节跳动 | #11 | 47.8 | 48.9 | 36.1 | 33.0 | 推理偏科强 |
| GLM-5.2 | 智谱 AI | #12 | 47.6 | 46.7 | 38.1 | 33.5 | 唯一开源,性价比王 |
| Qwen3.7 Max | 阿里云 | #13 | 46.8 | 47.4 | 37.6 | 31.4 | Code Arena 亮眼 |
中国模型的三个特征:
梯度分明。 Kimi K3 独一档(55.2),与 GPT-5.6 Terra(53.1)和 Muse Spark 1.1(52.9)处于同一梯队。Seed 2.1 Pro、GLM-5.2、Qwen3.7 Max 形成清晰的第二梯队(46-48 分),彼此差距不到 1 分。
各有侧重。 月之暗面押注 Agent 能力,字节赌推理,智谱走开源+性价比,阿里聚焦编码体验。没有"全都要",每个玩家都有清晰的差异化定位。
开源是差异化武器。 GLM-5.2 是 Top 15 中唯一的开源模型,这在中国模型生态中是战略性优势——它为国内开发者提供了不依赖海外 API 的自主可控选项。
五、五大趋势判断
趋势一:推理能力见顶,Agent 成为新战场
GPT-5.6 Sol 的推理分 58.5 已经极高,但前 5 名推理分集中在 52-59 区间,差距并不悬殊。相比之下,Agent 维度的分化更明显——从榜首的 44.8 到榜尾的 31.3,差距超过 13 分。Agent 能力正在取代推理成为区分模型档次的核心指标。
趋势二:价格战全面爆发
半年前,$10+/M 是旗舰模型的标配。现在 GPT-5.6 Luna 杀到 $1.56/M,Qwen3.7 Max 来到 $1.53/M,GLM-5.2 低至 $1.18/M。价格已经不再是区分旗舰和中端的依据——Muse Spark 1.1(52.9 分,$1.58/M)证明低价同样能做到顶级能力。
趋势三:OpenAI 的多线作战策略
GPT-5.6 系列的四个变体展示了 OpenAI 的精妙布局:
- Sol($7.78,248c/s):全能旗舰,要最好的来找我
- Terra($3.89,307c/s):编码优先,开发者首选
- Luna($1.56,549c/s):极致性价比+速度,降维打击价格战
- GPT-5.5($7.78,167c/s):稳如老狗的生产级选择
这种"一个底座 + 多个调优方向"的策略,让 OpenAI 在不同价格带都能保持竞争力。
趋势四:Anthropic 的"慢工出细活"困境
Anthropic 的 Claude 系列在能力上无可挑剔(5 款上榜),但速度短板日益突出。Opus 4.6 仅 44c/s,在 Luna 的 549c/s 面前几乎无法忍受。如果 Anthropic 不能解决推理速度问题,"能力强但太慢"的标签会越来越难撕掉。
趋势五:开源的力量被低估
GLM-5.2 以开源身份打进 Top 15,且性价比第一。这传递了一个清晰信号:开源模型不再只是"够用就行"——它们正在成为商业决策中的理性选择。当你可以用 $1.18/M 或干脆私有化部署来获得全球第 12 的能力时,花 $14.44/M 调用 Claude Fable 5 就需要非常充分的理由。
六、选型建议
根据不同场景,推荐如下:
| 场景 | 首选 | 备选 | 理由 |
|---|---|---|---|
| 极致能力 | GPT-5.6 Sol | Claude Fable 5 | 综合最强,推理独一档 |
| 编码开发 | GPT-5.6 Terra | Claude Fable 5 | 编码专精,性价比高于 Sol |
| Agent 应用 | Kimi K3 | GPT-5.6 Terra | Agent 能力突出,价格合理 |
| 高并发/低延迟 | GPT-5.6 Luna | GLM-5.2 | 549c/s 极致速度,便宜 |
| 成本敏感 | GLM-5.2 | Qwen3.7 Max | 最便宜+开源,可私有化 |
| 国内合规 | Kimi K3 | GLM-5.2 / Qwen3.7 Max | 国产模型,无合规风险 |
结语
2026 年的大模型竞争已经从"谁能做"进入"谁做得好又便宜"的阶段。LLM Stats 的这份榜单清晰地展示了:
- 美国依然领跑能力(OpenAI + Anthropic 垄断前 3),但中国已经进入第一梯队(Kimi K3 #4)
- 价格战比预期来得更快更猛,$1-2/M 区间已经出现多个强力竞争者
- Agent 能力正在取代推理成为新的技术制高点
- 开源不再只是"够用",GLM-5.2 证明了开源也能打进全球前列
对开发者来说,这是一个前所未有的好时代——你可以用不到一杯咖啡的钱,调用到全球 Top 15 级别的大模型。
数据来源:LLM Stats https://llm-stats.com,v3.0 方法论,数据截至 2026 年 7 月 17 日