PPIO发布Fusion融合模型:以约1/10成本超越顶级模型评分
2026/08/07 09:39阅读量 3
PPIO于8月6日推出智能模型网关新功能Fusion融合模型,将一次请求分发给多个模型并行作答,再经编排与融合生成最终结果。在DRACO深度研究基准测试中,三个开源模型融合后得分为57.34,超过Claude Fable 5的55.14,总成本约57.59元,仅为后者的约十分之一。
事件概述
8月6日,PPIO正式推出智能模型网关新功能Fusion融合模型。与传统API网关仅做请求转发不同,Fusion将每次调用组织成一次“专家会诊”:网关把复杂任务同时分发给多个各有所长的模型并行作答,再通过思考编排与交叉验证,由主模型融合生成最终答案。PPIO表示,融合方式可将回答质量稳定在头部旗舰模型梯队,同时把成本控制在中低梯队。
核心信息
为什么需要多模型融合
- 2026年主流大模型进入密集迭代期,但每个模型都有各自短板,代码生成、长文档理解、数学推理、多语言翻译等维度上,当前没有一个模型全面领先。
- 单模型面对同一问题只有一条推理路径,难以自我发现幻觉,复杂问题容易因视角遗漏出错;在Agent多步骤执行中,关键步骤出错会放大整条链路的返工成本。
Fusion融合模型调用流程
- 请求分发:把问题同时发给多个参考模型。
- 并行作答:各模型独立生成答案,互不干扰。
- 思考编排:提取共识、标记分歧、排除错误,并压缩上下文。
- 融合作答:主模型基于整理后的多方论证生成最终回复。
关键在第三步。多个模型的一致结论可相互印证,降低偏科带来的盲区;冲突处被标记出来进一步推敲,为拦截幻觉提供第二视角;不同推理路径汇总后的覆盖面大于任何单一路径。
多个模型并行执行,等待时间取决于最慢的一个,不会随模型数量线性增长;单模型调用失败时网关会跳过该模型继续融合;Agent多轮交互中,同一回合已获得的参考结果会被复用,避免重复消耗Token。每次调用的模型、Token消耗、耗时和成本都会留痕。
基准测试结果
在DRACO深度研究基准测试中,PPIO以Kimi K3、GLM 5.2、MiniMax M3作为参考模型,DeepSeek V4 Flash作为融合主模型,得到以下结果:
- 得分:57.34分,超过Claude Fable 5的55.14分。
- 总成本:约57.59元,仅为Claude Fable 5(约566元)的约1/10。
参与融合的三个模型单独看均非各自赛道榜首,性能提升主要来自编排层。这说明智能增量可以来自调用层的组织方式,而不必全部依赖基座模型的参数规模。
值得关注
- PPIO联合创始人兼CEO姚欣在WAIC 2026期间提出Agent时代公式:Agent生产力 = Token智能密度 × Agent Loop时长。Fusion融合模型试图在调用层提升Token智能密度,而不是被动等待下一代模型发布。
- 截至2026年6月,PPIO日均Token调用量超1.2万亿,较2025年同期增长超8倍;据灼识咨询统计,在中国独立AI云计算服务提供商中,PPIO日均Token消耗量排名第一。
- PPIO入选中国信通院首批“企业级Token服务性能攀登基线”,通用场景指标为TPS≥55个/秒、TTFT≤0.9秒、调用成功率≥99.9%。
