返回博客列表

字节开源 Trae Agent:带着测试时缩放能力横空出世,专为研究设计的透明架构,SWE-bench 开源第一梯队

2026-08-08T12:00:00+08:00
Trae Agent字节跳动Coding Agent测试时缩放SWE-bench开源 AgentAgent 研究

字节开源 Trae Agent:带着测试时缩放能力横空出世,专为研究设计的透明架构,SWE-bench 开源第一梯队

字节跳动昨天扔了一个重磅炸弹到开源 Agent 领域。

他们开源了 Trae Agent

GitHub 地址:https://github.com/bytedance/trae-agent 技术报告:https://arxiv.org/abs/2507.23370

现在开源的 Coding Agent 没有一百也有八十了,很多人看到可能会想:哦,又一个 Claude Code 的克隆,又一个玩具。

但是这次不一样。

这不是某个工程师业余时间做的小玩具。这是一个真正的、工业级的、经过验证的、在 SWE-bench 基准测试上做到了开源第一梯队水平的 Agent 实现。

而且更重要的是:它从第一天开始,就是为研究设计的。

整个架构完全透明,完全模块化,非常容易修改,非常容易做 ablation study(消融实验),非常容易开发新的 Agent 能力。

对于所有想做 Agent 研究的人来说,这可能是目前最好的基础底座,没有之一。


先看硬实力:SWE-bench 开源第一梯队

任何 Coding Agent,上来先看 SWE-bench 分数。这是行业的硬通货。

根据他们的技术报告,Trae Agent 的成绩是:

  • SWE-bench Verified:32.7%
  • SWE-bench Lite:43.8%

这个分数是什么水平? 现在所有公开的、有论文的、开源的 Agent 里面,这绝对是第一梯队的水平。

要知道:

  • Claude Code 原生的 Agent 能力大概在 35-37% 左右
  • OpenAI 的 o3-mini 原生大概在 38-40% 左右
  • Devin 刚出来的时候吹的是 13.86%,现在最好的开源实现大概在 25-28% 左右

也就是说,这个开源实现,离最好的闭源商业产品,只差 3-5 个百分点。

这就非常恐怖了。

更重要的是,这不是靠什么堆 token、堆步骤堆出来的。 它用的就是 Claude Sonnet,不是 Opus,不是 o3,不是什么更贵更好的模型。 它靠的是架构设计,是工作流设计,是测试时缩放机制。

这才是真正有价值的东西。


最核心的创新:测试时缩放(Test-time Scaling)

Trae Agent 最核心的创新,也是它效果这么好的最主要原因,就是这个叫做测试时缩放的机制。

什么意思? 绝大多数现在的 Agent,都是一锤子买卖。 遇到一个问题,思考一遍,写一遍代码,跑一遍测试,能过就过,不能过就算了。

但是人类工程师是怎么做的? 如果一次没修好,我们会再看一遍错误信息,再思考一下,再改一次,再跑一遍测试。 一次不行就两次,两次不行就五次,五次不行就十次。 只要时间足够,只要我们不放弃,我们最终总能把问题修好。

Trae Agent 就是把这个非常朴素的道理,变成了一个系统化的机制。

当 Agent 发现自己改完代码但是测试通不过的时候,它不会放弃。 它会进入一个循环:

  1. 看错误信息
  2. 分析为什么没修好
  3. 再改一次代码
  4. 再跑一次测试
  5. 重复,直到通过,或者达到最大步数限制

就这么简单的一个机制,带来了巨大的提升。

而且更棒的是,这个机制天然就有成本和效果的权衡。 你想要更高的准确率?那就把最大步数设高一点,多花点钱,多花点时间。 你想要更快更便宜?那就把最大步数设低一点,接受稍微低一点的准确率。

你可以根据你的需求,自由地在成本和效果之间做权衡。 这就是"缩放"的真正含义。

很多人看不起这种"硬堆次数"的方法,觉得不够优雅,不够聪明。 但是事实就是:这就是目前被验证过的、最有效的、提升 Agent 成功率的方法。 没有之一。


专为研究设计的架构:这才是它最珍贵的地方

我认为这个项目最珍贵的地方,不是它的分数有多高。 是它的设计哲学。

现在绝大多数的 Agent 项目,包括很多很有名的开源项目,都是黑盒。 它们把所有东西都揉在一起,高度优化,高度定制,为了生产环境的性能和体验做了各种取舍。 你想改一点东西,想做个实验,想试个新想法,难如登天。

但是 Trae Agent 完全反过来。 它在 README 里第一句话就明明白白地写了:

Trae Agent 提供了一个透明的、模块化的架构,研究人员和开发者可以轻松地修改、扩展和分析,使其成为研究 AI Agent 架构、进行消融实验、开发新型 Agent 能力的理想平台。

而且它真的说到做到。 整个架构非常干净,非常解耦,非常容易改。

你想改它的思考方式?可以。 你想改它的工具调用逻辑?可以。 你想换它的记忆系统?可以。 你想换它的规划策略?可以。

整个项目就是为研究设计的。

这对于整个学术社区来说,价值是不可估量的。


其他非常棒的特性

除了最核心的测试时缩放机制和研究友好的架构之外,它还有很多非常棒的特性:

Lakeview 步骤摘要系统

这个设计我非常喜欢。 Agent 跑多步任务的时候,很容易陷入信息过载,忘记之前做了什么。 Lakeview 会自动给每一步的 Agent 行动生成一个简短、精炼的摘要。 就像有一个专门的书记官,在旁边帮你记录整个过程。 后续的步骤不需要看完整的冗长历史,只需要看摘要就行。

既保留了上下文的连贯性,又避免了上下文爆炸。 非常聪明的设计。

原生支持 MCP

它原生支持 MCP(Model Context Protocol)服务。 你可以非常方便地把任何 MCP 工具接进来,扩展它的能力边界。 不需要自己再去写工具对接的胶水代码。

完整的轨迹记录

Agent 的每一步行动、每一次工具调用、每一次 LLM 交互,都会被完整地记录下来,结构化地存在 JSON 文件里。 出了任何问题,你都可以回头去看。 你可以清清楚楚地看到 Agent 是在哪一步走偏的,为什么走偏的。 对于研究和调试 Agent 的行为模式来说,这简直是无价之宝。

多模型提供商支持

开箱即用支持 OpenAI、Anthropic、Gemini、OpenRouter、Ollama、豆包。 基本上所有主流的模型提供商,都支持了。 你可以非常方便地换不同的模型做对比实验。

Docker 沙箱

你可以让 Agent 运行在 Docker 容器里面,和你的本地环境完全隔离。 不用担心它把你的系统搞崩,也不用担心环境不一致带来的结果不可复现。


和其他 Agent 有什么本质的不同?

现在市面上这么多开源 Agent,Trae Agent 和它们最大的区别是什么? 我认为有三点:

第一,它是工业界做出来的研究级产品

它不是某个大学实验室做出来的玩具原型。 它是字节的工程师团队,在真实的工业场景下打磨出来的,经过验证的系统。 它不是为了写论文而做的玩具,它是真刀真枪干出来的东西。

第二,它是研究友好的,而不是生产友好的

绝大多数开源 Agent 优先考虑的是用户体验,是性能,是稳定性。 为了这些,它们牺牲了可修改性,牺牲了架构的清晰度。 整个系统高度耦合,你想改一点东西就要大动干戈。

但是 Trae Agent 从第一天开始,第一优先级就是架构的清晰性和可修改性。 它甚至为此愿意牺牲一点点性能和开发速度。 因为他们知道,对于研究来说,可理解性和可修改性比什么都重要。

第三,它有真实的基准测试成绩来背书

现在很多开源 Agent,吹得天花乱坠,但是你从来看不到任何客观的、可复现的基准测试成绩。 所有的效果都是"我感觉更好了","用户反馈说更好了"。 没有数据,没有量化,没有对比。

Trae Agent 上来就把 SWE-bench 的成绩拍在你脸上。 32.7% 的 verified 通过率。 在所有公开的开源 Agent 里面,这是最顶尖的水平之一。

这就是底气。


给研究者和开发者的建议

最后,给所有对 Agent 研究感兴趣的人几个非常实在的建议:

1. 现在就把代码拉下来跑一跑

不要等,不要等它更成熟了再看。 这是目前整个开源社区里,用于 Agent 研究的最好的基础平台之一。 而且它有字节团队在背后维护,质量有保证,后续的更新和迭代也会非常快。

2. 把它作为你的实验基准平台

如果你正在做 Agent 相关的研究,不要自己从零开始搭架子了。 直接基于它做。 它的架构设计非常干净,非常适合做各种修改和实验。 你可以把所有的精力都放在真正的创新上,而不是浪费时间写胶水代码搭基础设施。

3. 参与进来

这是一个非常新的项目,还有非常多可以改进的地方。 如果你是做 Agent 研究的,如果你有好的想法,直接去贡献。 这个项目的架构非常适合做创新,你的贡献可以非常方便地被全世界的研究者使用。


写在最后

在 Trae Agent 之前,我们做 Agent 研究的时候,总是很尴尬。 我们想做实验,但是没有一个好的基础框架。 所有的框架要么是为生产优化的,太黑盒,太耦合,改不动。 要么是学术圈做的玩具原型,太简陋,太脱离实际。

Trae Agent 的出现,给整个开源社区带来了一个非常好的基础平台。 一个工业级质量的、专门为研究设计的、透明的、可修改的 Agent 底座。

这对于整个 AI Agent 研究社区来说,价值是不可估量的。

而且更重要的是,字节把它完全开源了,用的是最宽松的 MIT 协议。 没有任何商业限制,没有任何锁死,没有任何隐藏的东西。 任何人都可以用,任何人都可以改,任何人都可以基于它做自己的研究。

这才是开源真正的意义。 这才是推动整个领域向前发展的正确方式。

非常期待看到基于这个底座,整个社区会涌现出什么样的创新。 非常期待看到,站在字节团队的肩膀上,我们接下来能走多远。


作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友