返回博客列表

Better Harness 正式开源:终于有了一个能持续改进 AI 写代码工作流的工具,而不只是看最终的 Diff

2026-08-07T12:00:00+08:00
Better HarnessHarness 工程Coding AgentAI 工作流持续改进QoderAI

Better Harness 正式开源:终于有了一个能持续改进 AI 写代码工作流的工具,而不只是看最终的 Diff

整个 Harness 工程领域,昨天迎来了一个里程碑式的事件。

Better Harness 正式开源了。

GitHub 地址:https://github.com/QoderAI/better-harness

这个项目的意义怎么强调都不为过。 因为它是第一个,也是目前唯一一个,不把目光放在"AI 代码写得好不好"这件事上,而是把目光放在"AI 写代码的整个工作流程好不好"这件事上的开源工具。

绝大多数团队现在用 AI 写代码的状态是什么样的?

  • 有时候写得很好,有时候写得很烂,你不知道为什么
  • 同样的任务,这次一次就过,下次它能把整个项目搞崩
  • 它自信满满地解决了一个错误的问题
  • 它说"做好了",但是根本没有任何证据证明它真的测试过
  • 上次踩过的坑,下次它还会再踩一遍

所有人都知道这些问题存在,但是没有人知道怎么系统性地解决。 所有人都在盲人摸象,所有人都在靠感觉优化。

Better Harness 就是来解决这个问题的。

它给了你一个尺子,一个框架,一套方法论。 让你可以清晰地、量化地、可复现地看到你的整个 AI 编码工作流到底哪里有问题,然后一步一步地改进它。


先搞清楚:它不是做什么的,它是做什么的

在深入讲之前,我们先把边界划清楚。

Better Harness 不是

  • ❌ 不是又一个 Coding Agent,它不帮你写代码
  • ❌ 不是代码审查工具,它不看你代码写得好不好
  • ❌ 不是性能监控工具,它不看你写代码快不快
  • ❌ 不是提示词优化工具,它不教你怎么写更好的提示词

Better Harness

  • ✅ 一个工作流分析工具,它看的是 AI 写代码的整个过程
  • ✅ 一个测量工具,它告诉你你的 Harness 系统现在在什么水平
  • ✅ 一个诊断工具,它告诉你具体是哪个环节出了问题,应该怎么改
  • ✅ 一个持续改进工具,它能记录历史趋势,告诉你你是在变好还是变差

用一个很形象的比喻: 如果说 Coding Agent 是工厂里的工人,那么 Better Harness 就是工厂的质量控制经理。 它不亲自上生产线干活。 它站在生产线旁边,观察整个生产流程,告诉你哪个环节有浪费,哪个环节经常出次品,哪个工序应该怎么改进,以及整个工厂的生产质量是不是真的在越来越好。


五个核心维度,完整的 Agent 工作循环模型

Better Harness 最核心的贡献,就是它提出了一个非常完整、非常扎实的 Agent 工作循环模型。 它把整个编码任务的完整过程,拆成了五个互相连接的维度。

维度 它回答的核心问题 衡量的对象
任务理解 Agent 真的知道目标是什么吗?知道"完成"的定义是什么吗? 需求文档、AGENTS.md、设计文档、验收标准
受控执行 工作是不是在可支持、可复现的路径上发生的? Skills、命令、MCP 工具、沙箱边界
变更验证 有没有证据证明这个变更真的能用? 测试、Lint、Hook、可观测诊断信息
可靠交付 AI 的速度有没有绕过质量检查和验收流程? 人工审查、审批、CI/CD、回滚路径
学习捕获 下一个任务能不能从这个任务的经验里受益? 循环发现、可复用的 SDLC 技能、记忆

这个模型太重要了。 在它之前,所有人对 Agent 工作流的理解都是模糊的、碎片化的、凭感觉的。 现在我们有了一个共同的语言,一个共同的框架,一个共同的衡量标准。

以后你不需要再说"我们的 Agent 好像不太稳定"。 你可以说: "我们的任务理解维度现在是 70 分,但是变更验证维度只有 30 分,大量的变更根本没有任何测试证据,这是我们现在最大的瓶颈。"

这就是从模糊到精确的飞跃。


它到底是怎么工作的?三层架构设计

Better Harness 的设计非常精巧,整个系统分成了三个完全独立的证据采集层,最后由一个主导 Agent 统一分析。

第一层:前馈指导(Feedforward Guides)

这是工作开始之前就存在的东西。 AGENTS.md、规范文档、Skills、验收标准。 这些东西的作用是在 Agent 行动之前就给它指明方向。 Better Harness 会检查这些东西有没有,完不完整,清不清晰,能不能真的起到指导作用。

很多团队根本就没有这些东西。 他们让 Agent 在一片真空中工作,然后抱怨 Agent 理解不了需求。 这就像你让一个工人去造房子,但是你不给他图纸,然后骂他为什么盖得不对。

第二层:反馈传感器(Feedback Sensors)

这是工作进行中和工作完成之后产生的信号。 Linter、测试、Hook、审查 Agent。 这些东西的作用是观察结果,帮助 Agent 自我纠正。 Better Harness 会检查这些传感器有没有部署到位,有没有真的被触发,有没有真的起到作用。

很多团队的测试就是摆设。 Agent 可以完全不跑测试就说"做好了",也没有任何机制强制它必须跑。 这种情况下,出 bug 是必然的,不出 bug 才是运气。

第三层:统一分析与发现

三层独立采集到的所有证据,最后会交给一个主导 Agent 做统一分析。 它不会给你一个模糊的"打分"。 它会给你具体的、有证据支撑的发现(Findings):

  • 这个问题的影响是什么
  • 我们期望的正确结果应该是什么
  • 修复这个问题的边界和范围是什么
  • 怎么验证这个问题真的被修复好了

最棒的一点是: 所有的发现都必须有对应的证据支撑。 没有证据的东西,它不会瞎猜,不会乱打分,不会给你虚假的安全感。 它会老老实实地告诉你:这个维度我们观察不到,无法评估。

这种诚实,在 AI 工具里真的太稀缺了。


最有价值的特性:历史趋势对比

Better Harness 最厉害的功能,不是单次报告。 是历史趋势对比。

现在绝大多数团队优化 AI 工作流的方式是什么样的?

  • 我改了一下 AGENTS.md,好像效果变好了一点?
  • 我加了一个新的 Skill,感觉好像出错少了?
  • 我改了一下提示词,似乎速度变快了?

所有的判断都是主观的,都是凭感觉的。 你永远也不确定,你做的那个改动,是不是真的带来了改进,还是只是你最近运气好。 你也永远不知道,你是真的在进步,还是在原地踏步,甚至在退步。

Better Harness 解决了这个问题。 你每次跑完报告,它都会把结果记录下来。 时间长了,你就能看到一条清晰的趋势曲线。 五个维度,每个维度随时间的变化,清清楚楚,明明白白。

你加了一个新的测试 Skill,过两周再跑一次报告。 如果变更验证维度的分数真的从 30 分涨到了 60 分,那这个改动就是真的有用。 如果分数没变化,甚至变低了,那这个改动就是没用的,甚至是反效果。

终于,优化 AI 工作流这件事,从一门玄学,变成了一门可以量化、可以测量、可以持续改进的工程学科。


这个项目真正的历史意义

Better Harness 的开源,我认为标志着整个 AI 编码行业正式进入了第三阶段。

第一阶段:比谁的模型好(2022-2024)

所有人都在卷模型,比谁的代码写得好,比谁的基准测试分数高。 大家都相信只要模型足够聪明,所有问题都会自动解决。

第二阶段:比谁的 Agent 框架好(2024-2026)

大家发现光模型好没用,还需要好的工作流,好的工具调用,好的规划能力。 于是出现了几十个 Agent 框架,大家开始比谁的功能多,谁支持的工具多,谁的规划算法好。

第三阶段:比谁的工作流能持续改进(2026-)

现在我们终于意识到: 模型也好,框架也好,都只是起点。 真正重要的,不是你一开始有多好。 真正重要的是,你能不能持续地、稳定地、系统性地变得越来越好。

而 Better Harness,就是第三阶段的第一个标志性工具。

从此以后,一个团队用 AI 写代码的能力,不再取决于团队里有没有一两个"提示词大师",不再取决于某个人的个人经验。 它变成了一个可以被测量、可以被优化、可以被改进的工程问题。

这才是真正的成熟。


给所有团队的建议

最后,给所有正在用 AI 写代码的团队几个非常实在的建议。

1. 今天就装上去跑第一次报告

不要等,不要等你的工作流"足够好了"再用。 恰恰是因为你的工作流现在还不够好,你才更需要用它。 安装非常简单,Claude Code、Codex、Qoder 都支持,几分钟就能跑第一次报告。 那第一次报告给你的冲击,会让你对你们团队现在的真实状态有一个全新的认识。

2. 不要纠结分数,先从最容易的问题开始修

第一次跑出来的报告,分数可能会非常难看,可能会有二三十个发现。 不要慌,不要想一口吃成个胖子。 先从最简单、最容易修的问题开始,一个一个改。 改完一个,再跑一次报告,看到那个问题消失了,分数涨了一点。 这个正向反馈的循环一旦建立起来,后面的速度会超出你的想象。

3. 每个月跑一次,观察趋势

不要只跑一次就扔在一边。 把它变成你们团队的固定流程。 每个月的第一天,跑一次 Better Harness 报告。 看看哪些地方进步了,哪些地方还在原地踏步,哪些地方甚至退步了。 坚持半年,你会回来感谢我的。

4. 参与进来,贡献你的经验

这还是一个非常年轻的项目,还有很多可以改进的地方。 如果你的团队有一些经过验证的最佳实践,有一些踩过的坑,有一些好的想法。 不要犹豫,去参与贡献。 这个项目发展得越好,整个行业的所有人都会受益。


写在最后

半年前,Google 的 Vibe Coding 论文出来的时候,我写了一篇文章,最后说: "Harness 工程这个领域现在还是一片荒地,但是接下来的两年,这里会是整个行业最热闹的地方。"

半年后的今天,我们看到了 DataFlow 开源,我们看到了 Better Harness 开源。 这片荒地,正在以惊人的速度,变成良田。

更棒的是,这些项目不是大公司关起门来自己做的。 它们是完全开源的,完全开放的,任何人都可以用,任何人都可以贡献,任何人都可以站在它们的肩膀上做自己的东西。

我们正在亲眼见证一个全新的工程学科的诞生。 我们正在亲手建立这个学科的基础概念、方法论、工具和最佳实践。

十年后,当我们回头看的时候,我们会想起 2026 年的夏天。 就是在这个夏天,一切都开始了。

而 Better Harness,就是这个夏天里,最重要的一块里程碑。


作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友