返回博客列表

HarnessEval-W:评测本身正在变成一个 Agent 任务

2026-08-15T01:00:00+08:00
HarnessEvalWorld ModelAgentBenchmarkEvaluationMirroS

HarnessEval-W:评测本身正在变成一个 Agent 任务

看完你会发现,你对「评测」的理解可能要更新了。

世界模型(World Model)正在爆发。Kling、MiniMax H3、Seedance、Wan,各类视频生成模型每个月都在刷新画质上限。但一个越来越尖锐的问题被回避了:你怎么知道模型生成的世界是对的?

传统 benchmark 给你一个分数——PSNR 高不高、FID 低不低、物体检测准不准。分数好看,但物理违反没有?因果链条断没断?世界状态漂移了没?人类一眼能看出来的问题,没有 benchmark 能自动检测。

MirroS Lab 刚发布的 HarnessEval-W 给出了一个全新的回答:让 Agent 来做评测。

本文提纲

  1. 核心问题:分数好看,但世界是错的
  2. Harness 范式:从 LLM 生态搬来的方法论
  3. 三轴八维:世界模型评测的完整坐标系
  4. 工作流程:Skill 路由 → 子 Agent 推理 → 验证聚合
  5. 数据说话:0.93 人类相关性,4.9 倍一致性
  6. 18 个模型同台竞技的排行榜
  7. 为什么这件事值得你关注

核心问题:分数好看,但世界是错的

先说清楚 HarnessEval-W 要解决什么问题。

世界模型和普通视频生成有本质区别。视频生成追求「画面好看」,世界模型追求「世界正确」——物理规律要遵守、因果链条要连贯、状态要持久。一个视频可以每一帧都赏心悦目,但如果一个球从桌上滚下来后突然消失了,或者镜头转回去时房间布局变了,那这个世界模型就是错的。

人类评测员能看出来这些违反。但现有 benchmark 做不到。WBench、WorldScore 等工具本质上还是用固定指标暴力计算:算个 PSNR,跑个物体检测,输出一个标量分数。这个分数怎么来的?为什么这个模型 85 分那个 82 分?说不清。无法解释、无法验证、无法审计。

论文里有一句话点透了问题本质:

A benchmark should deliver more than a scalar score: what makes an evaluation trustworthy is the reasoning that justifies the score.

一个 benchmark 应该交付的不只是一个分数,而是证明这个分数合理的推理链

Harness 范式:从 LLM 生态搬来的方法论

HarnessEval-W 做的事情用一句话概括:把 LLM 生态中的 Harness 范式搬到世界模型评测里。

Harness 在 LLM 生态中是什么意思?Claude Code、DeepSeek Harness 这些 Agent 框架的本质是:一个编排器(orchestrator)接收任务,分解成子任务,派发给带不同工具的子 Agent 执行,最后验证和聚合结果。整个链路可观测、可审计。

MirroS 团队意识到:人类评测本身也是一个工作流。 人类评测员看一个生成的世界时,不是扫一眼打个分——是定位物体、追踪物体持久性、验证因果关系和几何约束。这个过程可以形式化为一个 Agent 管线:

  • 解读评测场景的上下文
  • 把评测问题分解为可测量的子问题
  • 每个子问题派发给专门的子 Agent,配备对应的诊断工具
  • 父 Agent 验证收集到的证据,聚合成最终判定

博客里用了一个精准的比喻:这套系统像福尔摩斯一样工作——仔细发现隐藏线索、串联不同证据、运用严密推理得出最终结论。

三轴八维:世界模型评测的完整坐标系

HarnessEval-W 建立了一套完整的世界模型评测坐标系,从三个维度、八个设定来评判一个世界模型。

轴一:观测质量(Observation Quality)

设定 核心问题
Render Quality 生成的画面是否连贯、稳定、可读,能作为证据使用?
Physical Observation 渲染状态在结构和物理上是否合理?

这一层检查「看起来对不对」:画面没有撕裂、没有闪烁、物理结构没有穿模。

轴二:状态转换正确性(Transition Correctness)

设定 核心问题
Exploratory Transition 视角切换发生了,同时世界保持兼容?
Intentional Transition 指定的目标变化了,受保护的状态保持稳定?
Physical Transition 物理干预产生了对应的动力学响应?

这一层检查「动作执行对不对」:你让 Agent 往左走,世界应该正确地往右移动;你让一扇门打开,门开了但房间不应该变形。

轴三:世界持久性(World Persistence)

设定 核心问题
Drift Resistance 长时间滚动后,世界不变量是否存活?
Revisit Consistency 离开又回来后,地点或实体是否保持兼容?
Offscreen Evolution 不可见区域内生过程是否继续,而非冻结或重置?

这一层最考验世界模型的「记忆」:世界不是一张静态图,是一个随时间演化的系统。镜头转走再转回来,世界应该在合理地变化,而不是突然变脸。

持久性不要求世界到处不变——而是要求该变的按因果变,不该变的保持稳定

工作流程:Skill 路由 → 子 Agent 推理 → 验证聚合

HarnessEval-W 的评测管线分三步走。

graph TB
    A["Case Input
initial world + action + probe"] --> B["Planner Agent
skill routing"] B --> C1["Skill 1
sub-agents"] B --> C2["Skill 2
sub-agents"] B --> C3["Skill N
sub-agents"] B --> D["Skip log
evidence-grounded reason"] C1 --> E["Parent Agent
validate + aggregate"] C2 --> E C3 --> E E --> F["Case Card
full reasoning trace"] style A fill:#FF6B6B,color:#000000 style B fill:#4ECDC4,color:#000000 style C1 fill:#45B7D1,color:#000000 style C2 fill:#45B7D1,color:#000000 style C3 fill:#45B7D1,color:#000000 style E fill:#96CEB4,color:#000000 style F fill:#FFEAA7,color:#000000

第一步:场景化技能路由。 给定一个评测案例(初始世界状态、执行的动作、探测意图),Planner Agent 解读上下文,路由到能合法评测它的技能(skill)。关键细节:每个被跳过的技能也要记录一个基于证据的理由。这意味着路由决策本身是可审计的——你知道为什么某个案例没用某个技能。

第二步:子 Agent 推理。 每个技能把自己的评测问题分解为可测量的子问题,每个子问题由一个专门的子 Agent 对着生成证据回答。子 Agent 配备了定制的上下文和诊断工具——比如物体追踪、光流分析、几何一致性检查等。

第三步:验证聚合。 父 Agent 验证收集到的全部证据——确认证据确实回答了评测问题——然后聚合成案例分数。完整的推理链(每个问题、每个答案、每个分数、每个支撑帧)保存为一份可审计的案例卡(Case Card)

一个关键设计原则:路由只取决于案例上下文,不取决于被评测的模型。所以每个模型面对的是完全相同的问题和完全相同的案例,评测的公平性有了结构性保障。

数据说话:0.93 人类相关性,4.9 倍一致性

HarnessEval-W 的评测有多可信?三个硬指标:

指标 数值 对比
Spearman 相关 ρ 0.93 与人类 Bradley-Terry 排名(Intentional Transition)
人类选择准确率 71.7% Physical Transition,WBench 最近协议仅 31.9%
重复评测一致性 4.9× 更窄 比 WBench 三次独立运行的波动范围

0.93 的 Spearman 相关意味着 HarnessEval-W 的排名和人类专家的排名几乎完全一致。71.7% 的 pairwise 准确率比 WBench 的 31.9% 高了一倍多——在最难评测的物理转换设定上。4.9 倍更窄的重复评测波动范围意味着同一模型跑三次,分数波动极小。

这三个数字合在一起证明了一件事:Agent 化的评测不仅比固定指标更可解释,而且更准确、更稳定。

18 个模型同台竞技的排行榜

HarnessEval-W 的 V1 排行榜(2026-08-18 快照)评测了 18 个代表性世界模型,覆盖 330 个评测案例,产生 5,940 条带完整推理链的评分结果。

案例分布:

维度 案例数
Exploratory Transition 108
Intentional Transition 51
Physical Transition 66
Drift Resistance 34
Revisit Consistency 34
Offscreen Evolution 37
总计 330

11 个专门评测技能覆盖渲染质量、物理合理性、导航、意向变化、物理响应、漂移、返回一致性、离屏演化等全部维度。

排行榜支持按接口类型过滤(Prompt、I2V、Camera pose、Native action),意味着不同交互范式的世界模型可以在各自的维度上公平比较。项目页面还提供了评测画廊,可以浏览 6 个精选案例的完整推理过程。

为什么这件事值得你关注

第一,评测正在从「指标计算」变成「Agent 推理」。 这是评测范式的结构性转变。传统 benchmark 是一个计算器——输入数据,输出分数。HarnessEval-W 是一个 Agent 系统——输入评测案例,输出带完整推理链的判定。这个范式迁移和 Agent 领域本身的进化完全同频。

第二,Harness 范式的边界正在扩展。 之前我们在 DeepSeek Harness、Claude Code 上看到的 Harness 是「执行任务的 Agent 编排器」。HarnessEval-W 证明:Harness 范式同样适用于「评判任务的 Agent 编排器」。从「做事」到「判事」,同一套架构思想打通了。论文标题用的词很精确——"Agentifying the Evaluation",把评测 Agent 化。

第三,世界模型评测有了可信的标准。 世界模型是 AI 下一个主战场——具身智能、自动驾驶、游戏 NPC、数字孪生都依赖它。但如果评测不可信,所有进步都是自说自话。HarnessEval-W 用 0.93 的人类相关性证明:自动化评测可以达到专家级可信度。

第四,这是一个活的 benchmark。 论文明确说 HarnessEval-W 是"一个可执行的 Agent 系统"——技能库可扩展,新技能和新案例随世界模型进化而增长。传统 benchmark 的困境是:模型追上 benchmark 后 benchmark 就失效了。HarnessEval-W 的设计让 benchmark 本身在进化。

项目还在 TODO 里列了下一步:托管提交和评测服务(上传视频直接出分)、HuggingFace 上的完整案例集。这意味着任何世界模型开发者都可以把 HarnessEval-W 接入自己的评测管线。

arXiv 论文已上线(2608.16859),代码 Apache 2.0 开源,开箱即用的 demo 可以装完就跑。

参考文档与链接

你用什么评测世界模型?评论区聊聊你的方法。觉得有用点个赞让更多人看到。


作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友