返回博客列表

LLM Stats 最新排行榜深度解析:全球 Top 15 大模型公司分布、能力对比与趋势洞察

2026-07-18
[大模型LLM排行榜OpenAIAnthropicKimi智谱通义千问GrokMeta]

从 LLM Stats 看 2026 年大模型格局

LLM Stats 是当下最权威的独立大模型排行榜之一,覆盖 300+ 模型,采用 TrueSkill 贝叶斯评级系统,综合 Reasoning(推理)、Coding(编码)、Agent(智能体)、Code Arena(竞技场)等多个维度给出统一排名。其 v3.0 方法论不依赖简单平均分,而是将每个 Benchmark 视为一场"多人竞技",用排名信息而非绝对分数计算能力估计值。缺失的 Benchmark 不计为零,而是保持更大的不确定性区间——这让新模型不会被"未参评"拖累。

本文基于 2026 年 7 月最新数据,逐一分析 Top 15 模型的公司格局、能力分布和性价比趋势。


Top 15 总览

排名 模型 公司 LLM Stats 推理 编码 Agent Code Arena 上下文 速度 价格($/M) 许可
1 GPT-5.6 Sol OpenAI 57.9 58.5 49.6 44.8 1,959 1.1M 248c/s $7.78 闭源
2 Claude Mythos Preview Anthropic 56.9 56.9 47.3 39.3 闭源
3 Claude Fable 5 Anthropic 56.7 54.2 47.1 43.5 2,018 1.0M 116c/s $14.44 闭源
4 Kimi K3 Moonshot AI 55.2 54.5 44.0 42.4 1.0M 114c/s $4.33 闭源
5 GPT-5.6 Terra OpenAI 53.1 52.3 45.8 41.0 834 1.1M 307c/s $3.89 闭源
6 Muse Spark 1.1 Meta 52.9 52.6 37.9 38.2 1.0M $1.58 闭源
7 Claude Opus 4.8 Anthropic 52.6 52.0 43.6 37.9 1,676 1.0M 87c/s $7.22 闭源
8 Claude Sonnet 5 Anthropic 51.0 50.4 39.5 35.3 1,536 1.0M 199c/s $4.33 闭源
9 Grok 4.5 xAI 49.0 47.7 39.7 34.9 1,142 500K 180c/s $2.44 闭源
10 GPT-5.5 OpenAI 48.8 48.1 39.9 33.5 2,115 1.1M 167c/s $7.78 闭源
11 Seed 2.1 Pro 字节跳动 47.8 48.9 36.1 33.0 闭源
12 GLM-5.2 智谱 AI 47.6 46.7 38.1 33.5 1,509 1.0M 201c/s $1.18 开源
13 Qwen3.7 Max 阿里云 46.8 47.4 37.6 31.4 1,692 1.0M 171c/s $1.53 闭源
14 Claude Opus 4.6 Anthropic 46.4 46.8 35.3 31.3 2,127 1.0M 44c/s $7.22 闭源
15 GPT-5.6 Luna OpenAI 46.3 46.6 38.1 32.8 703 1.1M 549c/s $1.56 闭源

注:Score 范围为 0-100,采用 μ − 3σ 保守估计。价格为单位百万 token 输入价格。


一、公司格局:两强争霸,中国力量崛起

按模型数量分布

pie title Top 15 模型公司分布
    "Anthropic" : 5
    "OpenAI" : 4
    "Moonshot AI" : 1
    "Meta" : 1
    "xAI" : 1
    "字节跳动" : 1
    "智谱 AI" : 1
    "阿里云" : 1

Top 15 中,Anthropic 以 5 款模型上榜成为最大赢家——从预览版的 Mythos 到已发布的 Fable 5、Opus 4.8/4.6、Sonnet 5,产品矩阵覆盖从旗舰到中端。OpenAI 以 4 款紧随其后,全部是 GPT-5.x 系列的不同变体。中美公司形成了 11:4 的数量对比。

但只数"有几个模型上榜"会掩盖真相。我们来看综合实力:

按公司综合实力

公司 上榜数 最高排名 平均 Score 价格区间($/M)
OpenAI 4 #1 (57.9) 51.5 $1.56–7.78
Anthropic 5 #2 (56.9) 52.7 $4.33–14.44
Moonshot AI 1 #4 (55.2) 55.2 $4.33
Meta 1 #6 (52.9) 52.9 $1.58
xAI 1 #9 (49.0) 49.0 $2.44
字节跳动 1 #11 (47.8) 47.8
智谱 AI 1 #12 (47.6) 47.6 $1.18
阿里云 1 #13 (46.8) 46.8 $1.53

三个关键洞察:

  1. OpenAI 守住王座但腹背受敌。 GPT-5.6 Sol 以 57.9 分登顶,但 Anthropic 的 Mythos(56.9)和 Fable 5(56.7)咬得极紧。更值得注意的是,OpenAI 的平均分(51.5)实际上低于 Anthropic(52.7),说明 Anthropic 在整体产品线上略占上风。

  2. 中国模型进入第一梯队。 Kimi K3 以 55.2 分冲到全球第 4,不仅远超 GPT-5.5(48.8),甚至在推理能力(54.5)上超越了 Claude Fable 5(54.2)。这是中国模型首次在综合榜上与全球最顶尖模型同台竞技。

  3. 腰部玩家格局清晰。 Meta(Muse Spark 1.1)、xAI(Grok 4.5)各有特色定位——Meta 主打极致性价比,xAI 在速度上发力。字节、智谱、阿里构成中国模型的"第二梯队",Score 集中在 46-48 区间。


二、能力维度深度对比

LLM Stats 从四个维度评测:推理(Reasoning)编码(Coding)智能体(Agent)竞技场编码(Code Arena)。每个维度揭示的是不同类型的能力偏好。

2.1 推理能力(Reasoning)

推理是当前大模型竞争最激烈的维度,直接决定模型"聪不聪明"。

xychart-beta
    title "Top 15 推理能力排行榜"
    x-axis ["GPT-5.6 Sol", "Claude Mythos", "Kimi K3", "Claude Fable 5", "Muse Spark 1.1", "GPT-5.6 Terra", "Claude Opus 4.8", "Claude Sonnet 5", "Seed 2.1 Pro", "GPT-5.5", "Grok 4.5", "Qwen3.7 Max", "Claude Opus 4.6", "GLM-5.2", "GPT-5.6 Luna"]
    y-axis "Reasoning Score" 30 --> 60
    bar [58.5, 56.9, 54.5, 54.2, 52.6, 52.3, 52.0, 50.4, 48.9, 48.1, 47.7, 47.4, 46.8, 46.7, 46.6]

推理前三强:

  • GPT-5.6 Sol (58.5):推理之王,独一档存在
  • Claude Mythos Preview (56.9):未发布已展现恐怖实力
  • Kimi K3 (54.5):中国模型推理能力巅峰

一个有趣的细节:字节 Seed 2.1 Pro 的推理分(48.9)反超了它的综合能力(47.8),甚至高于 GPT-5.5(48.1)。这说明字节在推理能力上投入了大量资源,综合排名低更多是因为 Agent 和 Code Arena 维度拖了后腿。

2.2 编码能力(Coding)

编码是工程生产力的关键指标,也是当前大模型落地最多的场景之一。

排名 模型 Coding 综合排名 编码相对综合的偏差
1 GPT-5.6 Sol 49.6 #1
2 Claude Mythos 47.3 #2
3 Claude Fable 5 47.1 #3
4 GPT-5.6 Terra 45.8 #5
5 Kimi K3 44.0 #4
6 Claude Opus 4.8 43.6 #7
7 Grok 4.5 39.7 #9 ↑↑
8 GPT-5.5 39.9 #10 ↑↑
8 Claude Sonnet 5 39.5 #8
10 GLM-5.2 38.1 #12 ↑↑

关键发现:GPT-5.6 Terra 的编码能力(45.8)远超其综合排名预期——它在综合榜排第 5,但编码分几乎是独一档的"旗舰之下第一人"。OpenAI 似乎有意将 Terra 定位为"编码特化版"。

Grok 4.5 和 GPT-5.5 的编码相对综合排名也明显"超常发挥",说明这两款模型在工程场景中有独特优势。

2.3 Agent 能力

Agent 能力是 2026 年大模型竞争的核心战场——它衡量的是模型作为智能体自主完成任务的能力,包括工具调用、多步规划、环境交互等。

xychart-beta
    title "Agent 能力 Top 10"
    x-axis ["GPT-5.6 Sol", "Claude Fable 5", "Kimi K3", "GPT-5.6 Terra", "Claude Mythos", "Muse Spark", "Claude Opus 4.8", "Claude Sonnet 5", "Grok 4.5", "GPT-5.5"]
    y-axis "Agent Score" 30 --> 50
    bar [44.8, 43.5, 42.4, 41.0, 39.3, 38.2, 37.9, 35.3, 34.9, 33.5]

Agent 维度的竞争格局与综合排名高度一致,说明 Agent 能力正在成为区分"能用"和"好用"的分水岭。

值得关注的是 Kimi K3 在 Agent 维度(42.4)超越了 GPT-5.6 Terra(41.0)和 Claude Mythos(39.3)。如果这个趋势持续,中国模型可能在 Agent 应用落地场景中占据先机。

2.4 Code Arena(竞技场编码)

Code Arena 反映的是模型在真实竞技场环境中的编码表现,更接近实际开发体验。

排名 模型 Code Arena 综合 Code Arena 排名
1 Claude Opus 4.6 2,127 #1
2 GPT-5.5 2,115 #2
3 Claude Fable 5 2,018 #3
4 GPT-5.6 Sol 1,959 #4
5 Qwen3.7 Max 1,692 #5
6 Claude Opus 4.8 1,676 #6
7 Claude Sonnet 5 1,536 #7
8 GLM-5.2 1,509 #8
9 Grok 4.5 1,142 #9

Code Arena 的排名与 Coding 维度出现了有趣的错位。Coding 分最高的 GPT-5.6 Sol(49.6)在 Code Arena 仅排第 4,而被认为"即将退役"的 Claude Opus 4.6 却以 2,127 分登顶。这说明 Benchmark 编码能力 ≠ 真实编码体验——竞技场的 ELo 分更反映实际用户偏好。

通义 Qwen3.7 Max(1,692)和智谱 GLM-5.2(1,509)在 Code Arena 的表现远好于他们在 Coding 维度的排名,说明这两个模型在真实开发场景中的用户满意度出乎意料地高。


三、性价比战争:速度 × 价格 × 能力

如果说 2025 年大家还在卷能力,那 2026 年的主题词就是**"单位美元买到多少智能"**。

3.1 价格分布

$14.44 ████████████████████████████████████ Claude Fable 5 (最贵)
 $7.78 ██████████████████████████ GPT-5.6 Sol / GPT-5.5
 $7.22 ██████████████████████████ Claude Opus 4.8 / 4.6
 $4.33 ██████████████████ Kimi K3 / Claude Sonnet 5
 $3.89 ████████████████ GPT-5.6 Terra
 $2.44 ████████████ Grok 4.5
 $1.58 ████████ Muse Spark 1.1
 $1.56 ████████ GPT-5.6 Luna
 $1.53 ████████ Qwen3.7 Max
 $1.18 ██████ GLM-5.2 (最便宜)

价格跨度惊人:从 GLM-5.2 的 $1.18/M 到 Claude Fable 5 的 $14.44/M,差了 12 倍。但更值得关注的是"甜蜜点"的出现——

3.2 性价比矩阵

将 LLM Stats Score 与价格结合,可以得到"智能密度":

模型 Score 价格($/M) 智能/价格比 速度
GLM-5.2 47.6 $1.18 40.3 201c/s
Qwen3.7 Max 46.8 $1.53 30.6 171c/s
GPT-5.6 Luna 46.3 $1.56 29.7 549c/s
Muse Spark 1.1 52.9 $1.58 33.5
Grok 4.5 49.0 $2.44 20.1 180c/s
Kimi K3 55.2 $4.33 12.7 114c/s
Claude Fable 5 56.7 $14.44 3.9 116c/s

性价比之王的竞争异常激烈:

  • GLM-5.2 以 40.3 的智能/价格比夺冠——而且还是 唯一的开源模型。这意味着你不仅可以用极低成本调用 API,还能私有化部署。
  • **Qwen3.7 Max(30.6)和 GPT-5.6 Luna(29.7)**紧咬不放。Luna 还有一个杀手锏:549c/s 的极致速度,是所有模型中最快的,比第二名 GPT-5.6 Terra(307c/s)快了近 80%。
  • Muse Spark 1.1 以 52.9 的高分 + $1.58 的低价成为"高端性价比"的标杆。

3.3 速度之王

速度直接影响用户体验。当前速度排名:

549c/s ██████████████████████████████████████████████████ GPT-5.6 Luna
307c/s ██████████████████████████████ GPT-5.6 Terra
248c/s █████████████████████████ GPT-5.6 Sol
201c/s ████████████████████ GLM-5.2
199c/s ████████████████████ Claude Sonnet 5
180c/s ██████████████████ Grok 4.5
171c/s █████████████████ Qwen3.7 Max
167c/s █████████████████ GPT-5.5
116c/s ████████████ Claude Fable 5
114c/s ████████████ Kimi K3
 87c/s █████████ Claude Opus 4.8
 44c/s ████ Claude Opus 4.6

OpenAI 在速度上展现了恐怖的工程能力——前三快全部来自 GPT-5.6 系列。而 Anthropic 的 Claude 系列在速度上明显落后,Opus 4.6 仅 44c/s,是同价位 GPT-5.6 Sol(248c/s)的 1/5


四、中国模型图谱:从追赶到平行竞争

Top 15 中的 4 款中国模型代表了当前国内大模型的最高水平:

模型 公司 排名 Score 推理 编码 Agent 特点
Kimi K3 月之暗面 #4 55.2 54.5 44.0 42.4 综合最强,Agent 突出
Seed 2.1 Pro 字节跳动 #11 47.8 48.9 36.1 33.0 推理偏科强
GLM-5.2 智谱 AI #12 47.6 46.7 38.1 33.5 唯一开源,性价比王
Qwen3.7 Max 阿里云 #13 46.8 47.4 37.6 31.4 Code Arena 亮眼

中国模型的三个特征:

  1. 梯度分明。 Kimi K3 独一档(55.2),与 GPT-5.6 Terra(53.1)和 Muse Spark 1.1(52.9)处于同一梯队。Seed 2.1 Pro、GLM-5.2、Qwen3.7 Max 形成清晰的第二梯队(46-48 分),彼此差距不到 1 分。

  2. 各有侧重。 月之暗面押注 Agent 能力,字节赌推理,智谱走开源+性价比,阿里聚焦编码体验。没有"全都要",每个玩家都有清晰的差异化定位。

  3. 开源是差异化武器。 GLM-5.2 是 Top 15 中唯一的开源模型,这在中国模型生态中是战略性优势——它为国内开发者提供了不依赖海外 API 的自主可控选项。


五、五大趋势判断

趋势一:推理能力见顶,Agent 成为新战场

GPT-5.6 Sol 的推理分 58.5 已经极高,但前 5 名推理分集中在 52-59 区间,差距并不悬殊。相比之下,Agent 维度的分化更明显——从榜首的 44.8 到榜尾的 31.3,差距超过 13 分。Agent 能力正在取代推理成为区分模型档次的核心指标。

趋势二:价格战全面爆发

半年前,$10+/M 是旗舰模型的标配。现在 GPT-5.6 Luna 杀到 $1.56/M,Qwen3.7 Max 来到 $1.53/M,GLM-5.2 低至 $1.18/M。价格已经不再是区分旗舰和中端的依据——Muse Spark 1.1(52.9 分,$1.58/M)证明低价同样能做到顶级能力。

趋势三:OpenAI 的多线作战策略

GPT-5.6 系列的四个变体展示了 OpenAI 的精妙布局:

  • Sol($7.78,248c/s):全能旗舰,要最好的来找我
  • Terra($3.89,307c/s):编码优先,开发者首选
  • Luna($1.56,549c/s):极致性价比+速度,降维打击价格战
  • GPT-5.5($7.78,167c/s):稳如老狗的生产级选择

这种"一个底座 + 多个调优方向"的策略,让 OpenAI 在不同价格带都能保持竞争力。

趋势四:Anthropic 的"慢工出细活"困境

Anthropic 的 Claude 系列在能力上无可挑剔(5 款上榜),但速度短板日益突出。Opus 4.6 仅 44c/s,在 Luna 的 549c/s 面前几乎无法忍受。如果 Anthropic 不能解决推理速度问题,"能力强但太慢"的标签会越来越难撕掉。

趋势五:开源的力量被低估

GLM-5.2 以开源身份打进 Top 15,且性价比第一。这传递了一个清晰信号:开源模型不再只是"够用就行"——它们正在成为商业决策中的理性选择。当你可以用 $1.18/M 或干脆私有化部署来获得全球第 12 的能力时,花 $14.44/M 调用 Claude Fable 5 就需要非常充分的理由。


六、选型建议

根据不同场景,推荐如下:

场景 首选 备选 理由
极致能力 GPT-5.6 Sol Claude Fable 5 综合最强,推理独一档
编码开发 GPT-5.6 Terra Claude Fable 5 编码专精,性价比高于 Sol
Agent 应用 Kimi K3 GPT-5.6 Terra Agent 能力突出,价格合理
高并发/低延迟 GPT-5.6 Luna GLM-5.2 549c/s 极致速度,便宜
成本敏感 GLM-5.2 Qwen3.7 Max 最便宜+开源,可私有化
国内合规 Kimi K3 GLM-5.2 / Qwen3.7 Max 国产模型,无合规风险

结语

2026 年的大模型竞争已经从"谁能做"进入"谁做得好又便宜"的阶段。LLM Stats 的这份榜单清晰地展示了:

  • 美国依然领跑能力(OpenAI + Anthropic 垄断前 3),但中国已经进入第一梯队(Kimi K3 #4)
  • 价格战比预期来得更快更猛,$1-2/M 区间已经出现多个强力竞争者
  • Agent 能力正在取代推理成为新的技术制高点
  • 开源不再只是"够用",GLM-5.2 证明了开源也能打进全球前列

对开发者来说,这是一个前所未有的好时代——你可以用不到一杯咖啡的钱,调用到全球 Top 15 级别的大模型。


数据来源:LLM Stats https://llm-stats.com,v3.0 方法论,数据截至 2026 年 7 月 17 日

分享给朋友