返回博客列表

大模型 Benchmark 完全指南:从 SWE-bench 到 Terminal-Bench,242 项评测到底在测什么?

2026-07-18
[BenchmarkLLMSWE-benchTerminal-BenchGPQAMMLU评测]

看懂大模型排行榜,从理解 Benchmark 开始

当你看到"GPT-5.6 Sol 在 SWE-bench Verified 拿了 95 分",或者"Kimi K3 的 Agent 分数超越了 Claude Opus"——你知道这些数字背后到底在测什么吗?

LLM Stats 目前收录了 242 项基准测试,覆盖推理、编码、数学、多模态、长上下文、Agent、医疗、安全等十多个维度。这些 benchmark 的设计哲学、难度水平和评估方式各不相同,理解它们是读懂排行榜的前提。

本文按 LLM Stats 的分类体系,系统梳理八大评测维度,详解每个核心 benchmark 的含义。


一、LLM Stats 的四大维度索引

LLM Stats 将 242 项 benchmark 归类为四个主要维度(同时还有独立分类如 Math、Long Context 等):

mindmap
  root((LLM Stats
Benchmark 体系)) Reasoning 推理 GPQA 博士级科学推理 SWE-Bench Verified 软件工程 Terminal-Bench 终端操作 ARC-C 常识推理 BrowseComp 网络检索 SimpleQA 事实准确性 Coding 编码 HumanEval 功能正确性 LiveCodeBench 无污染编程 MBPP Python 编程 Aider-Polyglot 多语言编辑 CodeForces 竞赛编程 Agent 智能体 Tau-bench 工具交互 BFCL 函数调用 OSWorld 计算机操作 MCP Atlas 工具协调 Toolathlon 工具十项全能 Code Arena 竞技场 真实用户偏好 Elo 排名

注意:Reasoning、Coding、Agent 是 LLM Stats 的三大核心类别索引,Code Arena 是独立维度。每个 benchmark 只属于一个类别,但可以贡献到多个维度。


二、Reasoning(推理)—— 最庞大的类别

推理类 benchmark 数量最多(约 65 项),测试模型"聪不聪明"。这里挑出最重要的几个详解。

2.1 GPQA —— 博士级科学推理

属性 详情
全称 Google-Proof Q&A
题量 448 道多选题
学科 生物、物理、化学
难度 PhD 专家准确率仅 65%
特点 "Google-proof"——搜索引擎也搜不到答案

GPQA 是当前衡量大模型"高端知识推理"的金标准。题目由领域博士专家撰写,难度极高,即使拥有 PhD 学位的人类专家也只能答对约 65%。

为什么重要? 它直接测量模型是否具备专家级科学推理能力,而非简单的知识检索。

当前王者: GPT-5.6 Sol (94.6)、Claude Mythos Preview (94.6)

2.2 SWE-Bench Verified —— 真实软件工程

属性 详情
全称 Software Engineering Benchmark (Verified)
题量 500 个真实 GitHub issue
任务 阅读 issue → 生成代码补丁 → 通过测试
语言 Python
特点 人工标注验证,最接近真实开发场景

SWE-Bench Verified 是目前最受关注的编码 benchmark。它直接来自真实开源项目的 GitHub issue,模型需要像真正的开发者一样:理解问题 → 定位代码 → 编写修复补丁 → 确保测试通过。

SWE-Bench 家族还有:

  • SWE-Bench Pro:高级版,需要扩展推理和多步问题解决
  • SWE-bench Multilingual:跨 Java、TypeScript、Go、Rust、C、C++ 等 7 种语言
  • Multi-SWE-Bench:1,632 个实例,68 位专家标注
  • DeepSWE:使用 mini-swe-agent 在隔离容器中评估端到端编码
  • FrontierSWE:数小时到数十小时规模的开放式技术项目
  • SWE-Lancer:来自 Upwork 的真实自由职业任务($50-$32,000)
  • NL2Repo:从自然语言生成整个代码仓库

当前王者: Claude Fable 5 (95.0)、Claude Mythos Preview (93.9)

2.3 Terminal-Bench —— 终端操作

属性 详情
题量 ~100 个人工制作任务
任务 编译代码、训练模型、搭建服务器、系统管理、安全任务
方式 AI 代理连接终端沙箱,自主完成任务
版本 v1 → v2.0 → v2.1

Terminal-Bench 测的不是"写代码"而是"操作计算机"。模型被接入一个终端环境,需要自己执行命令行操作——编译代码、部署服务、管理系统、处理安全漏洞,全部自主完成。

版本演进:

  • Terminal-Bench (v1):~100 个基础任务
  • Terminal-Bench 2.0:扩展到编译、训练模型、数据科学工作流、网络安全
  • Terminal-Bench 2.1:最新版,增加更多真实运维场景

为什么重要? 这是衡量 Agent "动手能力"的核心指标——不光要想得到,还要做得到。

2.4 ARC-C —— 常识推理

属性 详情
全称 AI2 Reasoning Challenge (Challenge set)
题量 小学科学多选题
特点 只包含被检索算法和词共现算法答错的问题

ARC-C 看似简单(小学科学题),实则刁钻——它特意筛选了那些"靠搜索引擎和统计匹配答不对"的题目,真正测试模型的推理能力而非记忆。

2.5 BrowseComp —— 网络信息检索

属性 详情
题量 1,266 个问题
任务 AI 代理浏览互联网,寻找难以发现的纠缠信息
特点 答案简短可验证,但找到答案需要持久性和创造力

BrowseComp 测的是"上网查资料"的能力——不是简单的搜索引擎查询,而是需要多跳推理、跨站综合的深度信息检索。还有一个中文版 BrowseComp-zh(289 题),应对中文网络的语言和审查复杂性。

2.6 SimpleQA —— 事实准确性

属性 详情
来源 OpenAI
题量 4,326 个简短事实性问题
特点 单一明确答案,同时评估模型校准(知道自己不知道什么)

SimpleQA 不只看"答得对不对",还看"模型是否知道自己不知道"——这是防止 AI 幻觉的关键指标。


三、Coding(编码)—— 工程生产力

编码类 benchmark 测试模型写代码的能力,是当前 AI 落地最热门的场景。

3.1 HumanEval —— 代码功能正确性鼻祖

属性 详情
题量 164 个编程问题
任务 根据 docstring 生成代码,通过单元测试
语言 Python
增强版 HumanEval+(测试用例扩展 80 倍)

HumanEval 是最早的代码生成 benchmark 之一。模型看一段函数描述(docstring),生成 Python 代码,然后跑测试看对不对。

进化版本:

  • HumanEval+:用 EvalPlus 框架将测试用例扩展 80 倍,抓出之前漏掉的错误代码
  • MBPP:974 个入门级 Python 编程题
  • MBPP+:测试用例增加 35 倍
  • MultiPL-E:将 HumanEval 和 MBPP 扩展到 18 种编程语言

3.2 LiveCodeBench —— 无污染编程评估

属性 详情
来源 LeetCode、AtCoder、CodeForces
特点 持续更新,标注发布日期,避免数据污染
评估场景 代码生成、自我修复、代码执行、测试输出预测
版本 v5、v6、Pro(Elo 评分版)

LiveCodeBench 解决了一个关键问题:训练数据污染。传统 benchmark 的题目早就被模型"背"过了。LiveCodeBench 持续从编程竞赛平台收集新题,标注发布日期,确保模型遇到的是真正没见过的问题。

3.3 Aider-Polyglot —— 多语言代码编辑

属性 详情
题量 225 道 Exercism 编程练习
语言 C++、Go、Java、JavaScript、Python、Rust
特点 两次尝试机会,第一次失败后提供测试错误反馈

Aider-Polyglot 测的不是从零写代码,而是编辑已有代码——这更接近真实开发场景。还有一个 Aider-Polyglot Edit 变体,只选 7 个顶级模型中 3 个或以下能解决的最难题。

3.4 CodeForces —— 竞赛编程

属性 详情
来源 CodeForces 平台
难度 评级 800-2400
类型 动态规划、图算法、数据结构、数学
方式 直接在 CodeForces 平台提交评估

直接用竞赛编程平台的真实题目,按难度分级评估。这是"算法功底"的直接度量。

3.5 OJBench —— 竞赛级编程推理

属性 详情
题量 232 道竞赛编程题
来源 NOI(全国信息学奥林匹克)和 ICPC(国际大学生程序设计竞赛)
难度 Easy / Medium / Hard 三级
语言 Python 和 C++

这是中国 NOI 和国际 ICPC 的竞赛级题目,难度远超普通编程 benchmark。


四、Agent(智能体)—— 2026 年的新战场

Agent benchmark 测的是模型"自主完成任务"的能力——不只是回答问题,而是规划、使用工具、多步执行。

4.1 Tau-bench 系列 —— 工具-代理-用户交互

属性 详情
领域 零售(Retail)、航空(Airline)、电信(Telecom)
方式 模拟用户与 AI 代理多轮对话,代理使用 API 工具
测试 规则遵循、工具选择、任务一致性
版本 Tau-bench → Tau2(Retail/Airline/Telecom)→ TAU3-Bench

Tau-bench 模拟真实客服场景:用户提需求 → AI 代理使用 API(查订单、改航班、处理故障)→ 在政策约束内完成任务。它测的是"AI 能不能当一个合格的客服 Agent"。

三个领域各有侧重:

  • Tau2 Retail:取消订单、修改地址、查询状态
  • Tau2 Airline:航班预订、修改、取消、退款
  • Tau2 Telecom:电信故障排除(双控环境 Dec-POMDP)

4.2 BFCL(伯克利函数调用排行榜)—— 函数调用能力

属性 详情
全称 Berkeley Function-Calling Leaderboard
版本 v2 → v3 → V4
测试 串行/并行/嵌套函数调用
方式 AST 评估(v2)+ 状态验证(v3)

BFCL 是评估模型"调用函数/API"能力的权威 benchmark。

  • BFCL v2:2,251 个问答-函数-答案对,AST 准确率评估
  • BFCL v3:1,000 个测试用例(车辆控制、交易机器人、旅行预订、文件系统),基于状态的评估——不只看调了对不对,还看系统状态变没变
  • BFCL V4:简单、多重、并行、嵌套函数调用全覆盖

4.3 OSWorld —— 真实计算机环境

属性 详情
支持系统 Ubuntu、Windows、macOS
任务量 369 个计算机任务
涉及 真实 Web 和桌面应用、OS 文件 I/O、多应用工作流
特点 首个可扩展的真实计算机环境

OSWorld 让 AI 代理直接操作完整的操作系统——打开浏览器、使用 Excel、管理文件、跨应用协作。这是目前最接近"AI 像人一样用电脑"的 benchmark。

还有 OSWorld-Verified 验证子集。

4.4 MCP Atlas / MCP-Mark —— MCP 工具使用

属性 详情
MCP Atlas 评估复杂多步任务中协调多个工具的能力
MCP-Mark 评估 LLM 有效使用 MCP(Model Context Protocol)工具的能力
测试 工具发现、选择、调用、结果解释

随着 MCP 协议在 2025-2026 年爆发,MCP 工具使用能力成为 Agent 评测的新焦点。

4.5 其他重要 Agent benchmark

Benchmark 测什么
Toolathlon 工具十项全能——10 种工具使用场景
AndroidWorld_SR Android 设备自主操作(116 任务,20 个真实 App)
ScreenSpot / ScreenSpot Pro GUI 定位——在截图中找到指定元素
Claw-Eval 真实世界代理式任务端到端完成
DeepPlanning 复杂多步规划
APEX-Agents 长期专业任务(持续推理+规划+执行)
Agents' Last Exam 困难长期任务+工具使用
PostTrainBench 自主完成模型后训练全流程
Program Bench 从编译二进制逆向重建程序(200 任务,248,000+ 模糊测试)

五、Math(数学)—— 推理能力的极限测试

数学 benchmark 测试模型的逻辑推理和多步计算能力。

5.1 AIME 系列 —— 奥林匹克数学

属性 详情
全称 American Invitational Mathematics Examination
题量 每年 30 题(AIME I + II)
答案 000-999 整数
版本 AIME 2024、AIME 2025、AIME 2026
特点 需多步逻辑推理和结构化符号推理

AIME 是美国数学竞赛的核心环节,题目需要深层的多步推理。当前顶级模型已在 AIME 2025 上达到 100% 满分

进阶版本:

  • Beyond AIME:比标准 AIME 更深的推理链和更难的分解
  • MathArena Apex:最高难度数学竞赛题
  • HMMT 2025:哈佛-MIT 数学锦标赛
  • AMC 2022-23:面向高中生的美国数学竞赛

5.2 MATH —— 竞赛数学推理

属性 详情
题量 12,500 道竞赛数学题
来源 AMC 10、AMC 12、AIME 等
难度 5 个级别
子学科 预备代数、代数、数论、计数与概率、几何、中级代数、微积分预备
变体 MATH-500(500 题子集)、MATH (CoT)(思维链提示版)

5.3 其他数学 benchmark

Benchmark 测什么
GSM8k 小学数学多步推理(8,500 题)
FrontierMath 专家数学家创作的极难题,覆盖现代数学大部分分支
HiddenMath Google DeepMind 内部基准,评估真实数学推理而非记忆
Humanity's Last Exam 2,500 道人类知识前沿题,多模态
MathVista 视觉上下文中的数学推理(6,141 示例)
SciCode 科学编程(338 子问题,16 个自然科学领域)
TheoremQA 350+ 定理应用能力
CodeForces 竞赛编程(800-2400 难度)

六、Multimodal(多模态)—— 视觉理解

6.1 MMMU 系列 —— 大学级多模态

属性 详情
全称 Massive Multi-discipline Multimodal Understanding
题量 11,500 道
学科 6 核心(艺术与设计、商业、科学、健康与医学、人文与社会科学、技术与工程)
子领域 30 学科 183 子领域
增强版 MMMU-Pro(过滤纯文本可答、增加选项、纯视觉输入)

MMMU 测试的是"能不能像大学生一样看图答题"。MMMU-Pro 更进一步,确保题目必须依赖视觉才能回答。

6.2 其他多模态 benchmark

Benchmark 测什么
AI2D 小学科学图表理解(4,903 图解)
ChartQA 图表视觉与逻辑推理(32,700 题)
DocVQA 文档图像问答(12,000+ 图像,50,000 问题)
TextVQA 图像中的文本推理
MMStar 视觉不可或缺的多模态评估(1,500 精选样本)
MMBench 双语(英中)多模态能力
Video-MME 视频分析(900 视频,254 小时)
MVBench 视频理解(20 任务,动作识别到反事实推理)
ScreenSpot GUI 定位(移动/桌面/Web)
OSWorld 真实计算机环境多模态代理

七、Long Context(长上下文)—— 信息检索与理解

Benchmark 测什么
nolima 长上下文理解与处理
RULER 输入长度增加时质量退化(13 任务,NVIDIA)
MRCR v2 (8-needle) 长上下文中检索 8 个特定信息
OpenAI-MRCR: 2 needle 1M 1M token 长对话中检索特定实例
LongBench v2 8k-2M 词上下文多任务理解
LongVideoBench 最长 1 小时视频理解
LVBench 超长视频(最长 2 小时)
ComplexFuncBench 128k token 上下文复杂函数调用
Graphwalks BFS >128k >128k token 图上广度优先搜索

长上下文 benchmark 的核心问题是:模型能不能在海量信息中找到关键内容,而不是"看多了就忘"。从 128k 到 1M token,上下文窗口越来越长,但真正的问题是"质量是否随长度保持"。


八、其他重要维度

8.1 Language & 指令遵循

Benchmark 测什么
MMLU 57 学科知识理解(经典 benchmark)
MMLU-Pro MMLU 增强版(10 选项,推理密集型,12,000+ 题)
MMLU-Redux 人工修正错误标签的 MMLU
MMMLU 多语言 MMLU(14 种语言)
CMMLU 中文多任务理解(67 学科)
C-Eval 中文知识与推理(52 学科,4 难度)
IFEval 指令遵循(25 种指令,500 提示词)
Multi-IF 多轮+多语言指令遵循
Winogrande 常识推理(代词消解,44,000 题)
BIG-Bench Hard 23 个挑战任务(6,511 示例)
BIG-Bench Extra Hard 超难版 BBH(最佳模型仅 9.8-44.8%)

8.2 Healthcare(医疗)

Benchmark 测什么
HealthBench 5,000 轮医疗对话,262 位医生验证
HealthBench Hard 高难度医疗变体
HealthBench Professional 临床医生使用能力
MedXpertQA 专家级医学知识(4,460 题,17 专科)

8.3 Safety & Legal

Benchmark 测什么
TruthfulQA 真实性(817 题,38 类,测是否避免常见误解)
ExploitBench 漏洞发现与利用能力
CyberGym 网络安全任务
SuperGPQA 研究生级学术知识(285 学科,25,957 题)
Legal Agent Benchmark 法律代理工作(Harvey 开源)
AGIEval 标准化考试(高考、SAT、LSAT、公务员考试)

九、Benchmark 的分类映射

LLM Stats 的四大维度(Reasoning、Coding、Agent、Code Arena)并非简单的一对一映射。一个 benchmark 可以同时贡献到多个维度。核心映射关系如下:

graph LR
    subgraph 维度索引
        R[Reasoning 推理]
        C[Coding 编码]
        A[Agent 智能体]
        CA[Code Arena 竞技场]
    end

    subgraph 核心 Benchmark
        GPQA[GPQA]
        SWE[SWE-Bench]
        TERM[Terminal-Bench]
        HUM[HumanEval]
        LIVE[LiveCodeBench]
        TAU[Tau-bench]
        BFCL[BFCL]
        OSW[OSWorld]
        ARENA[Arena Hard]
    end

    GPQA --> R
    SWE --> R
    SWE --> C
    TERM --> R
    TERM --> A
    HUM --> C
    LIVE --> C
    TAU --> A
    BFCL --> A
    OSW --> A
    ARENA --> CA

Code Arena 是什么?

Code Arena 是一个独立的竞技场维度,不同于其他基于固定测试集的 benchmark。它使用 Elo 评分系统,基于真实用户在编码场景中的使用偏好进行排名——更接近"用户满意度"而非"考试分数"。

与之类似的还有:

  • Arena Hard / Arena Hard v2:500 个真实世界挑战性提示,LLM-as-a-Judge
  • AlpacaEval 2.0:长度控制的自动评估器
  • WildBench:1,024 个真实世界任务,任务特定清单评估
  • MT-Bench:多轮对话能力,LLM 裁判评分

十、如何选择 Benchmark 评估你的场景

你的场景 重点关注 推荐 Benchmark
日常编码辅助 代码生成正确性 HumanEval+、MBPP+、LiveCodeBench
复杂软件开发 真实 issue 修复 SWE-Bench Verified、SWE-Bench Pro
Agent 工具调用 函数/API 调用 BFCL v3、MCP Atlas、Toolathlon
Agent 自主操作 计算机操作 OSWorld、Terminal-Bench 2.1
客服对话 工具+规则交互 Tau-bench(Retail/Airline/Telecom)
数学推理 竞赛级数学 AIME 2025/2026、MATH、FrontierMath
科学知识 专家级推理 GPQA、SuperGPQA
中文场景 中文能力 C-Eval、CMMLU、CSimpleQA、BrowseComp-zh
长文档处理 长上下文 RULER、LongBench v2、MRCR
多模态 图文/视频理解 MMMU-Pro、Video-MME、MMStar
真实用户偏好 用户体验 Arena Hard v2、Code Arena

结语:Benchmark 不是终点

242 项 benchmark 构建了一张精密的能力评估网,但它不是完美的:

  1. Benchmark 污染 是永恒问题——LiveCodeBench 和 LiveBench 的持续更新策略是当前最好的解法。
  2. 自报分数 依赖性存疑——LLM Stats 通过独立验证优先(Lab-reported 值标注来源,自验值优先)。
  3. 真实体验 ≠ Benchmark 分——Code Arena 的 Elo 排名经常与 Coding 分出现错位,说明"考试好"不等于"用着好"。
  4. Agent 评测仍在早期——Tau-bench、BFCL、OSWorld 等 Agent benchmark 还在快速迭代,远未像 MMLU 那样成熟。

理解 benchmark 的含义,是为了更好地判断"这个分数对我的场景到底有没有意义"。选对 benchmark,比追高分数更重要。


数据来源:LLM Stats Benchmarks (https://llm-stats.com/benchmarks),共 242 项基准测试,截至 2026 年 7 月

分享给朋友