HarnessEval-W:评测本身正在变成一个 Agent 任务
HarnessEval-W:评测本身正在变成一个 Agent 任务
看完你会发现,你对「评测」的理解可能要更新了。
世界模型(World Model)正在爆发。Kling、MiniMax H3、Seedance、Wan,各类视频生成模型每个月都在刷新画质上限。但一个越来越尖锐的问题被回避了:你怎么知道模型生成的世界是对的?
传统 benchmark 给你一个分数——PSNR 高不高、FID 低不低、物体检测准不准。分数好看,但物理违反没有?因果链条断没断?世界状态漂移了没?人类一眼能看出来的问题,没有 benchmark 能自动检测。
MirroS Lab 刚发布的 HarnessEval-W 给出了一个全新的回答:让 Agent 来做评测。
本文提纲
- 核心问题:分数好看,但世界是错的
- Harness 范式:从 LLM 生态搬来的方法论
- 三轴八维:世界模型评测的完整坐标系
- 工作流程:Skill 路由 → 子 Agent 推理 → 验证聚合
- 数据说话:0.93 人类相关性,4.9 倍一致性
- 18 个模型同台竞技的排行榜
- 为什么这件事值得你关注
核心问题:分数好看,但世界是错的
先说清楚 HarnessEval-W 要解决什么问题。
世界模型和普通视频生成有本质区别。视频生成追求「画面好看」,世界模型追求「世界正确」——物理规律要遵守、因果链条要连贯、状态要持久。一个视频可以每一帧都赏心悦目,但如果一个球从桌上滚下来后突然消失了,或者镜头转回去时房间布局变了,那这个世界模型就是错的。
人类评测员能看出来这些违反。但现有 benchmark 做不到。WBench、WorldScore 等工具本质上还是用固定指标暴力计算:算个 PSNR,跑个物体检测,输出一个标量分数。这个分数怎么来的?为什么这个模型 85 分那个 82 分?说不清。无法解释、无法验证、无法审计。
论文里有一句话点透了问题本质:
A benchmark should deliver more than a scalar score: what makes an evaluation trustworthy is the reasoning that justifies the score.
一个 benchmark 应该交付的不只是一个分数,而是证明这个分数合理的推理链。
Harness 范式:从 LLM 生态搬来的方法论
HarnessEval-W 做的事情用一句话概括:把 LLM 生态中的 Harness 范式搬到世界模型评测里。
Harness 在 LLM 生态中是什么意思?Claude Code、DeepSeek Harness 这些 Agent 框架的本质是:一个编排器(orchestrator)接收任务,分解成子任务,派发给带不同工具的子 Agent 执行,最后验证和聚合结果。整个链路可观测、可审计。
MirroS 团队意识到:人类评测本身也是一个工作流。 人类评测员看一个生成的世界时,不是扫一眼打个分——是定位物体、追踪物体持久性、验证因果关系和几何约束。这个过程可以形式化为一个 Agent 管线:
- 解读评测场景的上下文
- 把评测问题分解为可测量的子问题
- 每个子问题派发给专门的子 Agent,配备对应的诊断工具
- 父 Agent 验证收集到的证据,聚合成最终判定
博客里用了一个精准的比喻:这套系统像福尔摩斯一样工作——仔细发现隐藏线索、串联不同证据、运用严密推理得出最终结论。
三轴八维:世界模型评测的完整坐标系
HarnessEval-W 建立了一套完整的世界模型评测坐标系,从三个维度、八个设定来评判一个世界模型。
轴一:观测质量(Observation Quality)
| 设定 | 核心问题 |
|---|---|
| Render Quality | 生成的画面是否连贯、稳定、可读,能作为证据使用? |
| Physical Observation | 渲染状态在结构和物理上是否合理? |
这一层检查「看起来对不对」:画面没有撕裂、没有闪烁、物理结构没有穿模。
轴二:状态转换正确性(Transition Correctness)
| 设定 | 核心问题 |
|---|---|
| Exploratory Transition | 视角切换发生了,同时世界保持兼容? |
| Intentional Transition | 指定的目标变化了,受保护的状态保持稳定? |
| Physical Transition | 物理干预产生了对应的动力学响应? |
这一层检查「动作执行对不对」:你让 Agent 往左走,世界应该正确地往右移动;你让一扇门打开,门开了但房间不应该变形。
轴三:世界持久性(World Persistence)
| 设定 | 核心问题 |
|---|---|
| Drift Resistance | 长时间滚动后,世界不变量是否存活? |
| Revisit Consistency | 离开又回来后,地点或实体是否保持兼容? |
| Offscreen Evolution | 不可见区域内生过程是否继续,而非冻结或重置? |
这一层最考验世界模型的「记忆」:世界不是一张静态图,是一个随时间演化的系统。镜头转走再转回来,世界应该在合理地变化,而不是突然变脸。
持久性不要求世界到处不变——而是要求该变的按因果变,不该变的保持稳定。
工作流程:Skill 路由 → 子 Agent 推理 → 验证聚合
HarnessEval-W 的评测管线分三步走。
graph TB
A["Case Input
initial world + action + probe"] --> B["Planner Agent
skill routing"]
B --> C1["Skill 1
sub-agents"]
B --> C2["Skill 2
sub-agents"]
B --> C3["Skill N
sub-agents"]
B --> D["Skip log
evidence-grounded reason"]
C1 --> E["Parent Agent
validate + aggregate"]
C2 --> E
C3 --> E
E --> F["Case Card
full reasoning trace"]
style A fill:#FF6B6B,color:#000000
style B fill:#4ECDC4,color:#000000
style C1 fill:#45B7D1,color:#000000
style C2 fill:#45B7D1,color:#000000
style C3 fill:#45B7D1,color:#000000
style E fill:#96CEB4,color:#000000
style F fill:#FFEAA7,color:#000000第一步:场景化技能路由。 给定一个评测案例(初始世界状态、执行的动作、探测意图),Planner Agent 解读上下文,路由到能合法评测它的技能(skill)。关键细节:每个被跳过的技能也要记录一个基于证据的理由。这意味着路由决策本身是可审计的——你知道为什么某个案例没用某个技能。
第二步:子 Agent 推理。 每个技能把自己的评测问题分解为可测量的子问题,每个子问题由一个专门的子 Agent 对着生成证据回答。子 Agent 配备了定制的上下文和诊断工具——比如物体追踪、光流分析、几何一致性检查等。
第三步:验证聚合。 父 Agent 验证收集到的全部证据——确认证据确实回答了评测问题——然后聚合成案例分数。完整的推理链(每个问题、每个答案、每个分数、每个支撑帧)保存为一份可审计的案例卡(Case Card)。
一个关键设计原则:路由只取决于案例上下文,不取决于被评测的模型。所以每个模型面对的是完全相同的问题和完全相同的案例,评测的公平性有了结构性保障。
数据说话:0.93 人类相关性,4.9 倍一致性
HarnessEval-W 的评测有多可信?三个硬指标:
| 指标 | 数值 | 对比 |
|---|---|---|
| Spearman 相关 ρ | 0.93 | 与人类 Bradley-Terry 排名(Intentional Transition) |
| 人类选择准确率 | 71.7% | Physical Transition,WBench 最近协议仅 31.9% |
| 重复评测一致性 | 4.9× 更窄 | 比 WBench 三次独立运行的波动范围 |
0.93 的 Spearman 相关意味着 HarnessEval-W 的排名和人类专家的排名几乎完全一致。71.7% 的 pairwise 准确率比 WBench 的 31.9% 高了一倍多——在最难评测的物理转换设定上。4.9 倍更窄的重复评测波动范围意味着同一模型跑三次,分数波动极小。
这三个数字合在一起证明了一件事:Agent 化的评测不仅比固定指标更可解释,而且更准确、更稳定。
18 个模型同台竞技的排行榜
HarnessEval-W 的 V1 排行榜(2026-08-18 快照)评测了 18 个代表性世界模型,覆盖 330 个评测案例,产生 5,940 条带完整推理链的评分结果。
案例分布:
| 维度 | 案例数 |
|---|---|
| Exploratory Transition | 108 |
| Intentional Transition | 51 |
| Physical Transition | 66 |
| Drift Resistance | 34 |
| Revisit Consistency | 34 |
| Offscreen Evolution | 37 |
| 总计 | 330 |
11 个专门评测技能覆盖渲染质量、物理合理性、导航、意向变化、物理响应、漂移、返回一致性、离屏演化等全部维度。
排行榜支持按接口类型过滤(Prompt、I2V、Camera pose、Native action),意味着不同交互范式的世界模型可以在各自的维度上公平比较。项目页面还提供了评测画廊,可以浏览 6 个精选案例的完整推理过程。
为什么这件事值得你关注
第一,评测正在从「指标计算」变成「Agent 推理」。 这是评测范式的结构性转变。传统 benchmark 是一个计算器——输入数据,输出分数。HarnessEval-W 是一个 Agent 系统——输入评测案例,输出带完整推理链的判定。这个范式迁移和 Agent 领域本身的进化完全同频。
第二,Harness 范式的边界正在扩展。 之前我们在 DeepSeek Harness、Claude Code 上看到的 Harness 是「执行任务的 Agent 编排器」。HarnessEval-W 证明:Harness 范式同样适用于「评判任务的 Agent 编排器」。从「做事」到「判事」,同一套架构思想打通了。论文标题用的词很精确——"Agentifying the Evaluation",把评测 Agent 化。
第三,世界模型评测有了可信的标准。 世界模型是 AI 下一个主战场——具身智能、自动驾驶、游戏 NPC、数字孪生都依赖它。但如果评测不可信,所有进步都是自说自话。HarnessEval-W 用 0.93 的人类相关性证明:自动化评测可以达到专家级可信度。
第四,这是一个活的 benchmark。 论文明确说 HarnessEval-W 是"一个可执行的 Agent 系统"——技能库可扩展,新技能和新案例随世界模型进化而增长。传统 benchmark 的困境是:模型追上 benchmark 后 benchmark 就失效了。HarnessEval-W 的设计让 benchmark 本身在进化。
项目还在 TODO 里列了下一步:托管提交和评测服务(上传视频直接出分)、HuggingFace 上的完整案例集。这意味着任何世界模型开发者都可以把 HarnessEval-W 接入自己的评测管线。
arXiv 论文已上线(2608.16859),代码 Apache 2.0 开源,开箱即用的 demo 可以装完就跑。
参考文档与链接
- HarnessEval-W GitHub 仓库 - 127 stars,Python,Apache 2.0,完整评测代码和示例
- HarnessEval-W 项目页面 - 交互式排行榜、评测画廊、完整数据
- MirroS 博客:The Era of Harness for Benchmarking - 设计理念详解,Sherlock Holmes 比喻
- arXiv 论文 2608.16859 - 技术报告全文
- VBench - 视频质量指标基础
- WBench - 世界模型 benchmark 前作,HarnessEval-W 的对比基准
你用什么评测世界模型?评论区聊聊你的方法。觉得有用点个赞让更多人看到。
作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。
本文首发于 AI人工智能时代,转载请注明出处。