返回博客列表

PPIO Fusion:用三个开源模型加一个主模型,十分之一价格打赢Claude

2026-08-10T22:14:00+08:00
PPIOFusion模型网关AI推理成本优化

PPIO Fusion:用三个开源模型加一个主模型,十分之一价格打赢Claude

猜猜结果是什么?和你想的一样吗?

WAIC 2026 上,PPIO 发布了一个叫 Fusion 的功能。官方宣传语很猛:"用十分之一的价格超越顶级模型的智商。"

听起来像营销话术,但拆开看技术实现和测试数据,这个说法有一半是站得住的。

Fusion 不是传统意义上的"模型融合"--不是把多个模型的权重合并成一个新的模型。它是一个智能模型网关:每次 API 调用时,把请求同时分发给多个模型并行回答,然后用一个主模型对多个答案做交叉验证和综合,最终输出一个融合后的回答。

在 DRACO 深度研究基准测试上,Fusion 用 Kimi K3、GLM 5.2、MiniMax M3 三个开源模型做参考,DeepSeek V4 Flash 做融合主模型,拿到了 57.34 分,超过了 Claude Fable 5 的 55.14 分。总成本 57.59 元,大约是 Claude Fable 5(566 元)的十分之一。

这不是魔法,而是一个工程上很巧妙的多模型协同架构。

本文提纲

  1. Fusion 到底是什么:不是权重融合,是思维编排
  2. 四步工作流:分发→并行→编排→融合
  3. DRACO 测试数据拆解:开源模型怎么赢的旗舰
  4. 为什么成本能压到十分之一
  5. Agent 场景的设计细节
  6. PPIO 的算盘:Token 工厂战略
  7. 这个方案的边界和局限

Fusion 到底是什么:不是权重融合,是思维编排

先澄清一个容易误解的点。看到"Fusion 融合模型"这个名字,第一反应可能是模型权重融合(Model Weight Merging)--把多个模型的参数做加权平均,生成一个新的模型。这不是 Fusion 做的事。

Fusion 是 PPIO 智能模型网关的一个功能,本质上是一个推理时的多模型协同机制。每次 API 调用,网关都会把请求分发给多个模型,拿到多份独立答案,然后通过一个"思维编排"过程做交叉验证和综合,最后由主模型输出融合后的回答。

用 PPIO CEO 姚欣的话说,每次调用都像是一次"专家会诊"--不是找一个医生看,而是找多个专科医生分别看,然后由一个主治医师综合所有意见给出最终诊断。

这个思路其实不新,MoE(Mixture of Experts)架构的直觉类似。区别在于:MoE 是模型内部的专家路由,Fusion 是模型之间的专家协同。MoE 的专家是训练出来的子网络,Fusion 的"专家"是完整的独立模型,可以自由组合。

四步工作流:分发→并行→编排→融合

graph TB
    A["User Request"] --> B["Step 1: Request Distribution"]
    B --> C1["Model A: Kimi K3"]
    B --> C2["Model B: GLM 5.2"]
    B --> C3["Model C: MiniMax M3"]
    C1 --> D["Step 3: Thought Orchestration"]
    C2 --> D
    C3 --> D
    D --> E["Step 4: Fusion Answer
DeepSeek V4 Flash"] E --> F["Final Response"] style A fill:#FF6B6B,color:#000000 style B fill:#4ECDC4,color:#000000 style C1 fill:#45B7D1,color:#000000 style C2 fill:#45B7D1,color:#000000 style C3 fill:#45B7D1,color:#000000 style D fill:#96CEB4,color:#000000 style E fill:#FFEAA7,color:#000000 style F fill:#DDA0DD,color:#000000

四个步骤值得逐个拆解:

第一步:请求分发。 网关把用户请求发送给多个参考模型。哪些模型参与、几个模型参与,是可配置的。DRACO 测试中用的是 Kimi K3、GLM 5.2、MiniMax M3 三个开源模型。

第二步:并行回答。 每个模型独立生成答案,互不干扰。因为是并行执行,整体延迟只取决于最慢的那个模型,而不是所有模型的时间之和。如果某个模型挂了或超时,系统会跳过它,不影响其他模型的回答。

第三步:思维编排。 这是整个架构最关键的一步。主模型拿到多个参考模型的答案后,不是简单拼接,而是做三件事:

  • 提取共识:多个模型都认同的部分,置信度高,直接采纳
  • 标记分歧:模型之间有分歧的部分,需要进一步审视,这往往是幻觉或错误的藏身之处
  • 消除错误:通过交叉验证,剔除单个模型的推理盲区和幻觉

这一步相当于给答案加了一层"二审"机制,用第二个视角拦截单个模型的幻觉。

第四步:融合回答。 主模型(DRACO 测试中是 DeepSeek V4 Flash)基于编排后的论据生成最终回复。

DRACO 测试数据拆解:开源模型怎么赢的旗舰

先说测试结果:

指标 PPIO Fusion Claude Fable 5
DRACO 得分 57.34 55.14
总成本 ¥57.59 ¥566
成本比 1x ~10x

DRACO 是一个专门评估 AI Agent 执行复杂深度研究任务的基准测试。具体测试了哪些任务类型,原始文章没有详细展开,但从"深度研究"这个定位看,涉及的多是需要多步推理、信息检索和综合判断的复杂任务。

Fusion 能赢的关键不在于单个参考模型有多强--Kimi K3、GLM 5.2、MiniMax M3 单独拿出来都不是各自领域最强的旗舰。赢在"思维编排"这一步:三个模型分别独立推理,各自的盲区和幻觉通过交叉验证被过滤掉,共识部分被强化。

这个逻辑在学术上有支撑。 ensemble learning 领域有一个经典结论:多个弱学习器的集成可以超过单个强学习器,前提是弱学习器之间有足够的多样性。Fusion 用的是不同厂商的开源模型,训练数据和训练方法不同,恰好满足了多样性条件。

但也需要注意:DRACO 只是一个特定维度的基准测试。Fusion 在代码生成、数学推理、日常对话等其他维度上表现如何,原始文章没有给出数据。说"超越顶级模型的智商"目前只在深度研究这一类任务上有数据支撑。

为什么成本能压到十分之一

成本优势的来源不是某一个单点,而是几个因素叠加:

参考模型是开源的。 Kimi K3、GLM 5.2、MiniMax M3 都是开源模型,PPIO 可以在自己的 GPU 集群上部署,推理成本远低于调用闭源 API。566 元的 Claude Fable 5 定价里包含了 Anthropic 的利润和 API 转售加价,开源模型没有这些。

主模型是轻量的。 DeepSeek V4 Flash 做融合主模型,"Flash"意味着是蒸馏/量化版本,推理成本比旗舰低得多。主模型的工作量不大--它不需要从零生成答案,只需要综合已有的多个答案,所以不需要旗舰级别的智能。

并行不增加时间成本。 三个模型并行推理,总延迟等于最慢模型的延迟。从延迟角度看,多模型并行的成本和一个模型差不多。

多轮对话复用参考结果。 在 Agent 场景中,多轮交互很常见。Fusion 会复用之前轮次已经获取的参考模型结果,避免重复消耗 Token。这一点对成本控制很关键,后面单独说。

把这些加在一起:开源模型省了 API 利润,轻量主模型省了融合步骤的成本,并行执行省了时间,多轮复用省了重复 Token。十分之一的价格不是折扣,是架构决定的。

Agent 场景的设计细节

Fusion 的设计明显是为 Agent 场景优化的,不是简单的"一次问答"。

多轮复用机制。 Agent 的典型工作模式是多轮工具调用:第 1 轮搜索,第 2 轮分析,第 3 轮总结。如果每轮都重新跑三个参考模型,Token 消耗会爆炸。Fusion 的做法是:之前轮次已经拿到的参考模型结果会被复用,不会重复请求。这意味着随着对话轮次增加,边际成本递减。

容错设计。 某个参考模型超时或报错,系统自动跳过,不影响其他模型和最终输出。在 Agent 长时间运行中,模型调用失败是常态,这个设计保证了鲁棒性。

全链路可追溯。 每次调用都记录:用了哪些模型、各消耗多少 Token、耗时多少、成本多少。这对 Agent 场景的调试和成本分析很重要--你能看到 Token 到底花在哪了。

性能指标。 PPIO 公布的数据:TPS ≥ 55/s,TTFT ≤ 0.9 秒,调用成功率 ≥ 99.9%。对于多模型并行的架构,TTFT(Time To First Token)控制在 1 秒以内不容易--三个模型中最慢的那个决定了下限。

PPIO 的算盘:Token 工厂战略

Fusion 不是孤立的产品功能,它服务于 PPIO 更大的战略。

PPIO 把自己定位为"中国领先的独立 Agentic Cloud 服务商",核心概念是"Token 工厂"。CEO 姚欣提出了一个公式:

Agent 生产力 = Token 智能密度 × Agent Loop 时长

这个公式的含义是:Agent 的产出取决于两个因素--单位 Token 的智能水平(智能密度)和 Agent 能持续运行的时间(Loop 时长)。Fusion 提升的是"智能密度"--用低成本模型组合出高智能输出;PPIO 的基础设施服务(GPU 云、Agent 托管、Sandbox)提升的是"Loop 时长"--让 Agent 能长时间稳定运行。

截至 2026 年 6 月,PPIO 的日均 Token 调用量超过 1.2 万亿,同比增长 8 倍。根据 CIC 的数据,在中国独立 AI 云计算服务商中,PPIO 的日均 Token 消耗量排名第一。注册用户 66.6 万+,全球分布计算节点 5000+。

PPIO 还提供了一系列 Agent 生态工具:

  • MCP Server:端点 https://mcp.ppio.com/mcp,支持 Claude Code、Cursor、VS Code、Codex、Zed 等主流工具
  • Skills:通过 npx skills add PPIO/ppio-skills 安装
  • Sandbox CLInpm i -g ppio-sandbox-cli
  • 企业 Token Plan:旗舰模型最低 6 折,支持 200 席位

Fusion 是这套体系里"提升 Token 智能密度"的那块拼图。对 PPIO 来说,如果用户通过 Fusion 能用更低的成本获得更高的智能,就会在 PPIO 平台上消耗更多 Token--而 PPIO 卖的就是 Token。

这个方案的边界和局限

客观说几个局限:

延迟代价。 虽然并行执行,但"思维编排"这一步是串行的--主模型必须等所有参考模型回答完才能开始工作。对于需要极低延迟的实时场景(如实时对话、代码补全),多模型协同的延迟可能不可接受。Fusion 更适合对延迟不那么敏感但要求高质量的场景。

成本不总是十分之一。 十分之一的成本对比是针对 DRACO 这类深度研究任务。对于简单问答,用一个轻量模型直接回答可能比 Fusion 更便宜--你不需要三个专家会诊来回答"今天天气怎么样"。

测试覆盖有限。 目前公开的只有 DRACO 一个基准测试。Fusion 在代码生成、数学推理、创意写作等其他维度上的表现缺乏数据。"超越顶级模型的智商"这个说法在更多维度上验证之前,需要保留。

最佳应用场景明确。 PPIO 自己也指出了:Fusion 适合错误代价高的场景--法律条款解读、医疗建议、金融合规。这类场景对准确率的要求远高于对成本和延迟的要求,多模型交叉验证的价值最大化。

模型选择是关键变量。 Fusion 的效果取决于参考模型的选择。三个模型如果同质化严重(比如都是同一家公司的不同版本),多样性不足,交叉验证的效果会打折扣。PPIO 用的是三个不同厂商的开源模型,这个选择是合理的。

如果你在做 Agent 开发,对推理质量要求高但预算有限,Fusion 值得试一下。MCP Server 端点直接对接 Claude Code 和 Cursor,接入成本很低。跑几个你自己的真实任务,和单独用 Claude 或 GPT 对比一下质量和成本,数据会说话。

参考文档与链接

你的Agent用什么模型?试过多模型协同吗?评论区聊聊。觉得有用点个赞让更多人看到。


作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友