大模型 Benchmark 完全指南:从 SWE-bench 到 Terminal-Bench,242 项评测到底在测什么?
看懂大模型排行榜,从理解 Benchmark 开始
当你看到"GPT-5.6 Sol 在 SWE-bench Verified 拿了 95 分",或者"Kimi K3 的 Agent 分数超越了 Claude Opus"——你知道这些数字背后到底在测什么吗?
LLM Stats 目前收录了 242 项基准测试,覆盖推理、编码、数学、多模态、长上下文、Agent、医疗、安全等十多个维度。这些 benchmark 的设计哲学、难度水平和评估方式各不相同,理解它们是读懂排行榜的前提。
本文按 LLM Stats 的分类体系,系统梳理八大评测维度,详解每个核心 benchmark 的含义。
一、LLM Stats 的四大维度索引
LLM Stats 将 242 项 benchmark 归类为四个主要维度(同时还有独立分类如 Math、Long Context 等):
mindmap root((LLM Stats
Benchmark 体系)) Reasoning 推理 GPQA 博士级科学推理 SWE-Bench Verified 软件工程 Terminal-Bench 终端操作 ARC-C 常识推理 BrowseComp 网络检索 SimpleQA 事实准确性 Coding 编码 HumanEval 功能正确性 LiveCodeBench 无污染编程 MBPP Python 编程 Aider-Polyglot 多语言编辑 CodeForces 竞赛编程 Agent 智能体 Tau-bench 工具交互 BFCL 函数调用 OSWorld 计算机操作 MCP Atlas 工具协调 Toolathlon 工具十项全能 Code Arena 竞技场 真实用户偏好 Elo 排名
注意:Reasoning、Coding、Agent 是 LLM Stats 的三大核心类别索引,Code Arena 是独立维度。每个 benchmark 只属于一个类别,但可以贡献到多个维度。
二、Reasoning(推理)—— 最庞大的类别
推理类 benchmark 数量最多(约 65 项),测试模型"聪不聪明"。这里挑出最重要的几个详解。
2.1 GPQA —— 博士级科学推理
| 属性 | 详情 |
|---|---|
| 全称 | Google-Proof Q&A |
| 题量 | 448 道多选题 |
| 学科 | 生物、物理、化学 |
| 难度 | PhD 专家准确率仅 65% |
| 特点 | "Google-proof"——搜索引擎也搜不到答案 |
GPQA 是当前衡量大模型"高端知识推理"的金标准。题目由领域博士专家撰写,难度极高,即使拥有 PhD 学位的人类专家也只能答对约 65%。
为什么重要? 它直接测量模型是否具备专家级科学推理能力,而非简单的知识检索。
当前王者: GPT-5.6 Sol (94.6)、Claude Mythos Preview (94.6)
2.2 SWE-Bench Verified —— 真实软件工程
| 属性 | 详情 |
|---|---|
| 全称 | Software Engineering Benchmark (Verified) |
| 题量 | 500 个真实 GitHub issue |
| 任务 | 阅读 issue → 生成代码补丁 → 通过测试 |
| 语言 | Python |
| 特点 | 人工标注验证,最接近真实开发场景 |
SWE-Bench Verified 是目前最受关注的编码 benchmark。它直接来自真实开源项目的 GitHub issue,模型需要像真正的开发者一样:理解问题 → 定位代码 → 编写修复补丁 → 确保测试通过。
SWE-Bench 家族还有:
- SWE-Bench Pro:高级版,需要扩展推理和多步问题解决
- SWE-bench Multilingual:跨 Java、TypeScript、Go、Rust、C、C++ 等 7 种语言
- Multi-SWE-Bench:1,632 个实例,68 位专家标注
- DeepSWE:使用 mini-swe-agent 在隔离容器中评估端到端编码
- FrontierSWE:数小时到数十小时规模的开放式技术项目
- SWE-Lancer:来自 Upwork 的真实自由职业任务($50-$32,000)
- NL2Repo:从自然语言生成整个代码仓库
当前王者: Claude Fable 5 (95.0)、Claude Mythos Preview (93.9)
2.3 Terminal-Bench —— 终端操作
| 属性 | 详情 |
|---|---|
| 题量 | ~100 个人工制作任务 |
| 任务 | 编译代码、训练模型、搭建服务器、系统管理、安全任务 |
| 方式 | AI 代理连接终端沙箱,自主完成任务 |
| 版本 | v1 → v2.0 → v2.1 |
Terminal-Bench 测的不是"写代码"而是"操作计算机"。模型被接入一个终端环境,需要自己执行命令行操作——编译代码、部署服务、管理系统、处理安全漏洞,全部自主完成。
版本演进:
- Terminal-Bench (v1):~100 个基础任务
- Terminal-Bench 2.0:扩展到编译、训练模型、数据科学工作流、网络安全
- Terminal-Bench 2.1:最新版,增加更多真实运维场景
为什么重要? 这是衡量 Agent "动手能力"的核心指标——不光要想得到,还要做得到。
2.4 ARC-C —— 常识推理
| 属性 | 详情 |
|---|---|
| 全称 | AI2 Reasoning Challenge (Challenge set) |
| 题量 | 小学科学多选题 |
| 特点 | 只包含被检索算法和词共现算法答错的问题 |
ARC-C 看似简单(小学科学题),实则刁钻——它特意筛选了那些"靠搜索引擎和统计匹配答不对"的题目,真正测试模型的推理能力而非记忆。
2.5 BrowseComp —— 网络信息检索
| 属性 | 详情 |
|---|---|
| 题量 | 1,266 个问题 |
| 任务 | AI 代理浏览互联网,寻找难以发现的纠缠信息 |
| 特点 | 答案简短可验证,但找到答案需要持久性和创造力 |
BrowseComp 测的是"上网查资料"的能力——不是简单的搜索引擎查询,而是需要多跳推理、跨站综合的深度信息检索。还有一个中文版 BrowseComp-zh(289 题),应对中文网络的语言和审查复杂性。
2.6 SimpleQA —— 事实准确性
| 属性 | 详情 |
|---|---|
| 来源 | OpenAI |
| 题量 | 4,326 个简短事实性问题 |
| 特点 | 单一明确答案,同时评估模型校准(知道自己不知道什么) |
SimpleQA 不只看"答得对不对",还看"模型是否知道自己不知道"——这是防止 AI 幻觉的关键指标。
三、Coding(编码)—— 工程生产力
编码类 benchmark 测试模型写代码的能力,是当前 AI 落地最热门的场景。
3.1 HumanEval —— 代码功能正确性鼻祖
| 属性 | 详情 |
|---|---|
| 题量 | 164 个编程问题 |
| 任务 | 根据 docstring 生成代码,通过单元测试 |
| 语言 | Python |
| 增强版 | HumanEval+(测试用例扩展 80 倍) |
HumanEval 是最早的代码生成 benchmark 之一。模型看一段函数描述(docstring),生成 Python 代码,然后跑测试看对不对。
进化版本:
- HumanEval+:用 EvalPlus 框架将测试用例扩展 80 倍,抓出之前漏掉的错误代码
- MBPP:974 个入门级 Python 编程题
- MBPP+:测试用例增加 35 倍
- MultiPL-E:将 HumanEval 和 MBPP 扩展到 18 种编程语言
3.2 LiveCodeBench —— 无污染编程评估
| 属性 | 详情 |
|---|---|
| 来源 | LeetCode、AtCoder、CodeForces |
| 特点 | 持续更新,标注发布日期,避免数据污染 |
| 评估场景 | 代码生成、自我修复、代码执行、测试输出预测 |
| 版本 | v5、v6、Pro(Elo 评分版) |
LiveCodeBench 解决了一个关键问题:训练数据污染。传统 benchmark 的题目早就被模型"背"过了。LiveCodeBench 持续从编程竞赛平台收集新题,标注发布日期,确保模型遇到的是真正没见过的问题。
3.3 Aider-Polyglot —— 多语言代码编辑
| 属性 | 详情 |
|---|---|
| 题量 | 225 道 Exercism 编程练习 |
| 语言 | C++、Go、Java、JavaScript、Python、Rust |
| 特点 | 两次尝试机会,第一次失败后提供测试错误反馈 |
Aider-Polyglot 测的不是从零写代码,而是编辑已有代码——这更接近真实开发场景。还有一个 Aider-Polyglot Edit 变体,只选 7 个顶级模型中 3 个或以下能解决的最难题。
3.4 CodeForces —— 竞赛编程
| 属性 | 详情 |
|---|---|
| 来源 | CodeForces 平台 |
| 难度 | 评级 800-2400 |
| 类型 | 动态规划、图算法、数据结构、数学 |
| 方式 | 直接在 CodeForces 平台提交评估 |
直接用竞赛编程平台的真实题目,按难度分级评估。这是"算法功底"的直接度量。
3.5 OJBench —— 竞赛级编程推理
| 属性 | 详情 |
|---|---|
| 题量 | 232 道竞赛编程题 |
| 来源 | NOI(全国信息学奥林匹克)和 ICPC(国际大学生程序设计竞赛) |
| 难度 | Easy / Medium / Hard 三级 |
| 语言 | Python 和 C++ |
这是中国 NOI 和国际 ICPC 的竞赛级题目,难度远超普通编程 benchmark。
四、Agent(智能体)—— 2026 年的新战场
Agent benchmark 测的是模型"自主完成任务"的能力——不只是回答问题,而是规划、使用工具、多步执行。
4.1 Tau-bench 系列 —— 工具-代理-用户交互
| 属性 | 详情 |
|---|---|
| 领域 | 零售(Retail)、航空(Airline)、电信(Telecom) |
| 方式 | 模拟用户与 AI 代理多轮对话,代理使用 API 工具 |
| 测试 | 规则遵循、工具选择、任务一致性 |
| 版本 | Tau-bench → Tau2(Retail/Airline/Telecom)→ TAU3-Bench |
Tau-bench 模拟真实客服场景:用户提需求 → AI 代理使用 API(查订单、改航班、处理故障)→ 在政策约束内完成任务。它测的是"AI 能不能当一个合格的客服 Agent"。
三个领域各有侧重:
- Tau2 Retail:取消订单、修改地址、查询状态
- Tau2 Airline:航班预订、修改、取消、退款
- Tau2 Telecom:电信故障排除(双控环境 Dec-POMDP)
4.2 BFCL(伯克利函数调用排行榜)—— 函数调用能力
| 属性 | 详情 |
|---|---|
| 全称 | Berkeley Function-Calling Leaderboard |
| 版本 | v2 → v3 → V4 |
| 测试 | 串行/并行/嵌套函数调用 |
| 方式 | AST 评估(v2)+ 状态验证(v3) |
BFCL 是评估模型"调用函数/API"能力的权威 benchmark。
- BFCL v2:2,251 个问答-函数-答案对,AST 准确率评估
- BFCL v3:1,000 个测试用例(车辆控制、交易机器人、旅行预订、文件系统),基于状态的评估——不只看调了对不对,还看系统状态变没变
- BFCL V4:简单、多重、并行、嵌套函数调用全覆盖
4.3 OSWorld —— 真实计算机环境
| 属性 | 详情 |
|---|---|
| 支持系统 | Ubuntu、Windows、macOS |
| 任务量 | 369 个计算机任务 |
| 涉及 | 真实 Web 和桌面应用、OS 文件 I/O、多应用工作流 |
| 特点 | 首个可扩展的真实计算机环境 |
OSWorld 让 AI 代理直接操作完整的操作系统——打开浏览器、使用 Excel、管理文件、跨应用协作。这是目前最接近"AI 像人一样用电脑"的 benchmark。
还有 OSWorld-Verified 验证子集。
4.4 MCP Atlas / MCP-Mark —— MCP 工具使用
| 属性 | 详情 |
|---|---|
| MCP Atlas | 评估复杂多步任务中协调多个工具的能力 |
| MCP-Mark | 评估 LLM 有效使用 MCP(Model Context Protocol)工具的能力 |
| 测试 | 工具发现、选择、调用、结果解释 |
随着 MCP 协议在 2025-2026 年爆发,MCP 工具使用能力成为 Agent 评测的新焦点。
4.5 其他重要 Agent benchmark
| Benchmark | 测什么 |
|---|---|
| Toolathlon | 工具十项全能——10 种工具使用场景 |
| AndroidWorld_SR | Android 设备自主操作(116 任务,20 个真实 App) |
| ScreenSpot / ScreenSpot Pro | GUI 定位——在截图中找到指定元素 |
| Claw-Eval | 真实世界代理式任务端到端完成 |
| DeepPlanning | 复杂多步规划 |
| APEX-Agents | 长期专业任务(持续推理+规划+执行) |
| Agents' Last Exam | 困难长期任务+工具使用 |
| PostTrainBench | 自主完成模型后训练全流程 |
| Program Bench | 从编译二进制逆向重建程序(200 任务,248,000+ 模糊测试) |
五、Math(数学)—— 推理能力的极限测试
数学 benchmark 测试模型的逻辑推理和多步计算能力。
5.1 AIME 系列 —— 奥林匹克数学
| 属性 | 详情 |
|---|---|
| 全称 | American Invitational Mathematics Examination |
| 题量 | 每年 30 题(AIME I + II) |
| 答案 | 000-999 整数 |
| 版本 | AIME 2024、AIME 2025、AIME 2026 |
| 特点 | 需多步逻辑推理和结构化符号推理 |
AIME 是美国数学竞赛的核心环节,题目需要深层的多步推理。当前顶级模型已在 AIME 2025 上达到 100% 满分。
进阶版本:
- Beyond AIME:比标准 AIME 更深的推理链和更难的分解
- MathArena Apex:最高难度数学竞赛题
- HMMT 2025:哈佛-MIT 数学锦标赛
- AMC 2022-23:面向高中生的美国数学竞赛
5.2 MATH —— 竞赛数学推理
| 属性 | 详情 |
|---|---|
| 题量 | 12,500 道竞赛数学题 |
| 来源 | AMC 10、AMC 12、AIME 等 |
| 难度 | 5 个级别 |
| 子学科 | 预备代数、代数、数论、计数与概率、几何、中级代数、微积分预备 |
| 变体 | MATH-500(500 题子集)、MATH (CoT)(思维链提示版) |
5.3 其他数学 benchmark
| Benchmark | 测什么 |
|---|---|
| GSM8k | 小学数学多步推理(8,500 题) |
| FrontierMath | 专家数学家创作的极难题,覆盖现代数学大部分分支 |
| HiddenMath | Google DeepMind 内部基准,评估真实数学推理而非记忆 |
| Humanity's Last Exam | 2,500 道人类知识前沿题,多模态 |
| MathVista | 视觉上下文中的数学推理(6,141 示例) |
| SciCode | 科学编程(338 子问题,16 个自然科学领域) |
| TheoremQA | 350+ 定理应用能力 |
| CodeForces | 竞赛编程(800-2400 难度) |
六、Multimodal(多模态)—— 视觉理解
6.1 MMMU 系列 —— 大学级多模态
| 属性 | 详情 |
|---|---|
| 全称 | Massive Multi-discipline Multimodal Understanding |
| 题量 | 11,500 道 |
| 学科 | 6 核心(艺术与设计、商业、科学、健康与医学、人文与社会科学、技术与工程) |
| 子领域 | 30 学科 183 子领域 |
| 增强版 | MMMU-Pro(过滤纯文本可答、增加选项、纯视觉输入) |
MMMU 测试的是"能不能像大学生一样看图答题"。MMMU-Pro 更进一步,确保题目必须依赖视觉才能回答。
6.2 其他多模态 benchmark
| Benchmark | 测什么 |
|---|---|
| AI2D | 小学科学图表理解(4,903 图解) |
| ChartQA | 图表视觉与逻辑推理(32,700 题) |
| DocVQA | 文档图像问答(12,000+ 图像,50,000 问题) |
| TextVQA | 图像中的文本推理 |
| MMStar | 视觉不可或缺的多模态评估(1,500 精选样本) |
| MMBench | 双语(英中)多模态能力 |
| Video-MME | 视频分析(900 视频,254 小时) |
| MVBench | 视频理解(20 任务,动作识别到反事实推理) |
| ScreenSpot | GUI 定位(移动/桌面/Web) |
| OSWorld | 真实计算机环境多模态代理 |
七、Long Context(长上下文)—— 信息检索与理解
| Benchmark | 测什么 |
|---|---|
| nolima | 长上下文理解与处理 |
| RULER | 输入长度增加时质量退化(13 任务,NVIDIA) |
| MRCR v2 (8-needle) | 长上下文中检索 8 个特定信息 |
| OpenAI-MRCR: 2 needle 1M | 1M token 长对话中检索特定实例 |
| LongBench v2 | 8k-2M 词上下文多任务理解 |
| LongVideoBench | 最长 1 小时视频理解 |
| LVBench | 超长视频(最长 2 小时) |
| ComplexFuncBench | 128k token 上下文复杂函数调用 |
| Graphwalks BFS >128k | >128k token 图上广度优先搜索 |
长上下文 benchmark 的核心问题是:模型能不能在海量信息中找到关键内容,而不是"看多了就忘"。从 128k 到 1M token,上下文窗口越来越长,但真正的问题是"质量是否随长度保持"。
八、其他重要维度
8.1 Language & 指令遵循
| Benchmark | 测什么 |
|---|---|
| MMLU | 57 学科知识理解(经典 benchmark) |
| MMLU-Pro | MMLU 增强版(10 选项,推理密集型,12,000+ 题) |
| MMLU-Redux | 人工修正错误标签的 MMLU |
| MMMLU | 多语言 MMLU(14 种语言) |
| CMMLU | 中文多任务理解(67 学科) |
| C-Eval | 中文知识与推理(52 学科,4 难度) |
| IFEval | 指令遵循(25 种指令,500 提示词) |
| Multi-IF | 多轮+多语言指令遵循 |
| Winogrande | 常识推理(代词消解,44,000 题) |
| BIG-Bench Hard | 23 个挑战任务(6,511 示例) |
| BIG-Bench Extra Hard | 超难版 BBH(最佳模型仅 9.8-44.8%) |
8.2 Healthcare(医疗)
| Benchmark | 测什么 |
|---|---|
| HealthBench | 5,000 轮医疗对话,262 位医生验证 |
| HealthBench Hard | 高难度医疗变体 |
| HealthBench Professional | 临床医生使用能力 |
| MedXpertQA | 专家级医学知识(4,460 题,17 专科) |
8.3 Safety & Legal
| Benchmark | 测什么 |
|---|---|
| TruthfulQA | 真实性(817 题,38 类,测是否避免常见误解) |
| ExploitBench | 漏洞发现与利用能力 |
| CyberGym | 网络安全任务 |
| SuperGPQA | 研究生级学术知识(285 学科,25,957 题) |
| Legal Agent Benchmark | 法律代理工作(Harvey 开源) |
| AGIEval | 标准化考试(高考、SAT、LSAT、公务员考试) |
九、Benchmark 的分类映射
LLM Stats 的四大维度(Reasoning、Coding、Agent、Code Arena)并非简单的一对一映射。一个 benchmark 可以同时贡献到多个维度。核心映射关系如下:
graph LR
subgraph 维度索引
R[Reasoning 推理]
C[Coding 编码]
A[Agent 智能体]
CA[Code Arena 竞技场]
end
subgraph 核心 Benchmark
GPQA[GPQA]
SWE[SWE-Bench]
TERM[Terminal-Bench]
HUM[HumanEval]
LIVE[LiveCodeBench]
TAU[Tau-bench]
BFCL[BFCL]
OSW[OSWorld]
ARENA[Arena Hard]
end
GPQA --> R
SWE --> R
SWE --> C
TERM --> R
TERM --> A
HUM --> C
LIVE --> C
TAU --> A
BFCL --> A
OSW --> A
ARENA --> CACode Arena 是什么?
Code Arena 是一个独立的竞技场维度,不同于其他基于固定测试集的 benchmark。它使用 Elo 评分系统,基于真实用户在编码场景中的使用偏好进行排名——更接近"用户满意度"而非"考试分数"。
与之类似的还有:
- Arena Hard / Arena Hard v2:500 个真实世界挑战性提示,LLM-as-a-Judge
- AlpacaEval 2.0:长度控制的自动评估器
- WildBench:1,024 个真实世界任务,任务特定清单评估
- MT-Bench:多轮对话能力,LLM 裁判评分
十、如何选择 Benchmark 评估你的场景
| 你的场景 | 重点关注 | 推荐 Benchmark |
|---|---|---|
| 日常编码辅助 | 代码生成正确性 | HumanEval+、MBPP+、LiveCodeBench |
| 复杂软件开发 | 真实 issue 修复 | SWE-Bench Verified、SWE-Bench Pro |
| Agent 工具调用 | 函数/API 调用 | BFCL v3、MCP Atlas、Toolathlon |
| Agent 自主操作 | 计算机操作 | OSWorld、Terminal-Bench 2.1 |
| 客服对话 | 工具+规则交互 | Tau-bench(Retail/Airline/Telecom) |
| 数学推理 | 竞赛级数学 | AIME 2025/2026、MATH、FrontierMath |
| 科学知识 | 专家级推理 | GPQA、SuperGPQA |
| 中文场景 | 中文能力 | C-Eval、CMMLU、CSimpleQA、BrowseComp-zh |
| 长文档处理 | 长上下文 | RULER、LongBench v2、MRCR |
| 多模态 | 图文/视频理解 | MMMU-Pro、Video-MME、MMStar |
| 真实用户偏好 | 用户体验 | Arena Hard v2、Code Arena |
结语:Benchmark 不是终点
242 项 benchmark 构建了一张精密的能力评估网,但它不是完美的:
- Benchmark 污染 是永恒问题——LiveCodeBench 和 LiveBench 的持续更新策略是当前最好的解法。
- 自报分数 依赖性存疑——LLM Stats 通过独立验证优先(Lab-reported 值标注来源,自验值优先)。
- 真实体验 ≠ Benchmark 分——Code Arena 的 Elo 排名经常与 Coding 分出现错位,说明"考试好"不等于"用着好"。
- Agent 评测仍在早期——Tau-bench、BFCL、OSWorld 等 Agent benchmark 还在快速迭代,远未像 MMLU 那样成熟。
理解 benchmark 的含义,是为了更好地判断"这个分数对我的场景到底有没有意义"。选对 benchmark,比追高分数更重要。
数据来源:LLM Stats Benchmarks (https://llm-stats.com/benchmarks),共 242 项基准测试,截至 2026 年 7 月