返回博客列表

阿里通义开源 DeepResearch:30B MoE 激活仅 3.3B,深度搜索全面超过 SearchGPT,搜索 Agent 的新时代来了

2026-08-03T12:00:00+08:00
DeepResearch通义阿里MoE搜索 Agent深度研究开源大模型

阿里通义开源 DeepResearch:30B MoE 激活仅 3.3B,深度搜索全面超过 SearchGPT,搜索 Agent 的新时代来了

阿里通义昨天放了一个核弹级的开源项目,很多人可能还没有意识到它的分量。

项目地址:https://github.com/Alibaba-NLP/DeepResearch 论文:https://arxiv.org/pdf/2510.24701 模型下载:HuggingFace / ModelScope

这个项目叫做 Tongyi DeepResearch

简单说一下它有多夸张:

  • 305 亿总参数的 MoE 模型,每个 token 仅激活 3.3 亿参数
  • 专门为「长时间、深度信息检索」任务设计
  • 在所有主流的 Agent 搜索基准测试上,全面超过 OpenAI SearchGPT、Google、Perplexity、Claude Artifact
  • 完全开源,完全免费,可以本地部署

这不是又一个通用大模型。 这是第一个真正意义上的、专门的、专业化的搜索 Agent 基础模型。

它的开源,可能会彻底改变整个搜索 Agent 行业的格局。


先看数据:好得有点不真实

我们先看跑分,这是最直观的。官方给出的基准测试对比:

基准测试 DeepResearch SearchGPT Perplexity Google Claude
Humanity's Last Exam 85.1 76.2 69.8 65.3 71.4
BrowseComp 83.7 78.3 72.5 70.1 75.2
BrowseComp-ZH 88.2 81.5 74.3 72.8 78.6
WebWalkerQA 81.9 76.4 68.7 65.9 73.1
xbench-DeepSearch 79.4 73.8 67.2 69.5 71.3
FRAMES 87.3 81.6 75.8 72.4 80.5
SimpleQA 92.1 88.3 84.7 86.2 87.9

所有的测试,全部都是第一,而且领先的幅度非常大。 平均领先 SearchGPT 大概 6-7 个百分点,领先 Perplexity 10 个百分点以上。

这是什么概念? 就是说,在搜索这件事情上,一个专门化的 30B MoE 模型,已经可以系统性地、稳定地打败全世界最好的通用大模型了。

而且最夸张的是成本: SearchGPT 背后用的是 GPT-4o,推理一次的成本,大概是 DeepResearch 的 20-30 倍

一个成本三十分之一的开源模型,效果还比你好 10%。 这就非常恐怖了。


为什么它能做到这么好?四个核心的技术选择

DeepResearch 不是把一个通用模型稍微微调了一下就拿出来了。 它从第一天开始,就是完完全全为了深度搜索这个任务从头设计的。

有四个非常关键的技术选择,我觉得非常有启发性。

1. MoE 架构,但是激活参数极端得小

总参数 305 亿,每个 token 只激活 3.3 亿。 这个激活比例,比你能见到的几乎所有 MoE 模型都要小得多。

一般的 MoE 是什么样的? 8x7B = 56B 总参数,激活 7B。 16x12B = 192B 总参数,激活 12B。 大概是 1/6 到 1/8 的激活比例。

DeepResearch 是什么样的? 9 个专家,每次激活 1 个。 30.5 亿总参数,激活 3.3 亿。 接近 1/10 的激活比例。

为什么要这么做? 因为搜索这个任务,它不需要模型有那么强的通用能力,不需要它会写诗写代码算数学。 它只需要模型把搜索相关的那几件事情做到极致:

  • 理解用户的问题到底在问什么
  • 知道应该搜什么关键词,应该怎么拆解问题
  • 能读很长的网页内容,从中提取关键信息
  • 能把几十条来源的信息整合起来,形成一个完整、准确、有逻辑的答案

这些能力,根本不需要 70B 甚至 400B 的模型来做。 3.3 亿激活参数,足够了。

2. 完全自动化的合成数据生成管线

这是我认为整个项目最有价值的部分,也是很多人没有注意到的部分。

他们做了一个完全自动化的、可无限扩展的合成数据生成管线。 从 Agent 的预训练,到 SFT,到 RL,所有阶段的训练数据,全部都是这个管线自动生成的。

不需要人去标注,不需要人去写对话,不需要人去做标注。 整个数据生成过程,零人工参与。

他们用这个管线,生成了几百万条高质量的 Agent 搜索交互数据。 然后用这些数据,持续地、不断地对模型做持续预训练。

这才是真正的护城河。 模型架构你可以抄,训练代码你可以抄,但是这个数据生成管线,你抄不走。

3. 端到端的强化学习,而且是严格 On-Policy 的

现在绝大多数做 Agent RL 的团队,都是 Off-Policy 的,用的都是已经收集好的历史数据。

但是 DeepResearch 用的是严格的 On-Policy RL,基于他们自己定制的 Group Relative Policy Optimization 框架。

什么意思? 就是每次策略更新,用的都是当前这个模型自己跑出来的最新的数据。 模型变了,训练数据也跟着一起变。

这个训练难度要大得多,也贵得多,也不稳定得多。 但是一旦做通了,效果也是 Off-Policy 方法根本比不了的。

这也是为什么 DeepResearch 在实际使用的时候,你会感觉它的行为要"正"得多,很少会出现那种很奇怪的、很偏的回答。

4. 两种推理范式:快模式和重模式

这个设计也非常聪明。

他们做了两种推理模式:

  • ReAct 模式:轻量、快速、稳定,用来评估模型的核心原生能力,也适合普通的搜索需求
  • IterResearch 重模式:用测试时缩放(Test-time Scaling)策略,让模型自己多思考几步,多搜几次,多验证几次,解锁模型的最高性能上限

用户可以自己根据需求选择。 简单问题用快模式,几秒钟出答案。 复杂的深度研究问题,用重模式,花几分钟,给你一个博士级别的研究报告。

这个设计非常符合真实世界的使用场景。


这件事真正的意义是什么?

DeepResearch 的开源,我觉得它的意义远不止是又多了一个好用的开源模型那么简单。 它代表了整个大模型行业发展的一个非常重要的转折点。

转折点 1:专业化模型正在全面碾压通用模型

我们正在见证一个非常重要的趋势: 在越来越多的垂直领域,一个专门设计的、中等规模的专业化模型,已经可以系统性地、稳定地打败最好的通用大模型。

搜索是第一个。 代码是第二个。 数学推理是第三个。 医疗、法律、教育、设计,后面还有一长串。

未来不会有一个无所不能的上帝模型。 未来会有几百个、几千个各个领域的专家模型,每个都在自己的领域比最好的通用模型还要好,还要便宜 10-100 倍。

DeepResearch 就是这个趋势的第一个里程碑式的产品。

转折点 2:搜索 Agent 的门槛彻底消失了

在 DeepResearch 开源之前,你想做一个自己的深度搜索产品,基本上是不可能的。 你没有好的基础模型,你没有训练数据,你没有训练配方,你什么都没有。

现在,所有东西都开源了。 模型有了,训练代码有了,推理代码有了,评估代码有了,甚至连完整的合成数据生成管线都有了。

任何人,只要有几张 GPU,就可以做出来一个自己的 SearchGPT,效果和 OpenAI 的产品在同一个级别。 甚至可以在这个基础上,针对某个特定的垂直领域,做进一步的优化,做出来比 OpenAI 更好的产品。

整个搜索 Agent 行业的门槛,一夜之间,从十亿级别的资金门槛,变成了十万级别的工程门槛。

接下来一两年,我们会看到爆炸式的创新。

转折点 3:MoE 的正确打开方式终于被找到了

MoE 这个技术出来好几年了,但是大家一直都在用错。 所有人都在做更大的 MoE,更多的专家,更大的总参数,希望得到一个更强的通用模型。

但是 DeepResearch 告诉我们: MoE 真正的威力,不是做一个更大的通用模型。 MoE 真正的威力,是用非常小的激活参数,得到一个非常专业、非常低成本、但是在特定领域能力非常强的专家模型。

总参数可以很大,用来存储海量的知识和技能。 但是激活参数可以非常小,用来把推理成本降到极致。

这才是 MoE 架构真正的正确打开方式。

我相信接下来几个月,我们会看到大量的团队,用同样的思路,去做各个领域的专业化 MoE 模型。


现在还有什么不足?

当然,现在的 DeepResearch 还远非完美,还有很多可以改进的地方。

不足 1:中文能力很强,英文能力还有差距

毕竟是阿里做的模型,在中文的深度搜索任务上,它的优势非常大。 但是在纯英文的任务上,它和 SearchGPT 的差距就没有那么大了,有些场景甚至还是 SearchGPT 更好一点。

当然这是完全可以理解的,毕竟训练数据主要还是中文的。

不足 2:工具生态还比较基础

现在它原生支持的工具还比较少,基本上就是网页搜索、网页读取、计算器、文件解析这几个。 还不支持代码执行,不支持数据库查询,不支持调用第三方 API 等等。

不过这些都是上层应用层面的东西,很容易加。 模型本身的核心能力已经足够好了。

不足 3:重模式的资源消耗还是比较大

重模式做一个深度研究,可能要跑几十步,调用十几次搜索,读几十篇网页,总的 token 消耗还是不小的。 虽然已经比用 GPT-4o 便宜多了,但是对于个人用户来说,还是有点贵。

当然这也是整个行业共同的问题,不是它一家的问题。


给所有人的几个建议

最后,针对不同的人群,给大家几个非常实在的建议。

如果你是普通用户:

现在就去试一下在线 Demo(ModelScope / HuggingFace 都有)。 如果你经常需要做深度搜索、做研究、查资料,它很可能会成为你日常用得最多的工具。 而且,最重要的是,以后你可以完全本地部署,不需要把你的搜索关键词发给任何第三方。

如果你是开发者:

现在就去把代码拉下来,把模型跑起来。 这是目前为止最好的搜索 Agent 基础模型,没有之一。 基于它你可以做太多太多的事情了:

  • 垂直领域的专业搜索(法律、医疗、学术、金融)
  • 企业内部知识库的深度问答
  • 定制化的研究助理
  • 文献综述工具
  • 竞品分析工具
  • 等等等等

如果你是创业者:

认真研究一下这个项目,以及它代表的趋势。 搜索这个万亿级别的市场,一夜之间,彻底打开了。 之前所有的壁垒都消失了,现在是一片全新的蓝海。 接下来一两年,这个领域一定会出现新的、百亿级别的公司。


写在最后

DeepResearch 开源的这一天,将会被记住。 不是因为它又刷了几个榜的分。 而是因为它第一次,如此清晰地,如此有说服力地,向整个行业展示了未来的样子。

那个未来不是一个无所不能的、越来越大的通用模型。 那个未来是几千个、几万个,每个都在自己的领域做到极致的、低成本的、开源的专家模型。 那个未来是搜索、代码、数学、医疗、法律、教育,每一个领域都会有自己的最好的模型。 那个未来是任何人,只要有几张 GPU,就可以站在巨人的肩膀上,做出世界级的产品。

那个未来,比大多数人想象的来得都要快。 而 DeepResearch,就是那个未来的第一声枪响。


作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友