无问芯穹PDD架构破局:跨集群异构推理延迟砍半、成本直降近40%

2026/07/30 14:14阅读量 2

无问芯穹在WAIC 2026发布跨集群异构推理架构PDD,通过P-RLD-MD三级分离设计,利用本地中继节点掩盖以太网传输延迟,在DeepSeek-V4-pro模型实测中实现首Token延迟降低51.5%、单Token成本降低37.5%,有效盘活全国分散算力集群。

事件概述

无问芯穹在2026 WAIC世界人工智能大会上公布跨集群异构推理架构PDD(Prefill-RelayDecode-MainDecode),并发布完整技术报告。该架构通过广域网以太网串联多地同构数据中心,将传统PD分离的两层结构扩展为三层,重点攻克了KV Cache跨集群传输的延迟瓶颈。

核心架构与机制

三阶段分离设计

  • P实例(Prefill):位于主集群,负责计算密集型的前缀计算。
  • RLD实例(RelayDecode):与P实例同机房,通过高速RDMA网络连接,作为延迟掩盖中继。
  • MD实例(MainDecode):位于远端集群,通过广域网以太网连接,承担绝大部分解码任务。

关键机制:Extend-Decode Handoff

当MD实例通过以太网收到完整KV Cache时,RLD仅将已生成的Token ID(几KB数据)传给MD,MD本地重新计算对应KV Cache并继续解码。实测重算100个Token的KV Cache平均仅需305.2ms,远优于以太网传输的185.4ms(峰值512.6ms)。该机制将不可控的网络操作转化为确定性本地计算。

负载调度策略

基于命中率分布高度偏斜的规律(约70%-80%请求命中率>95%):

  • 高命中率请求直接走P-MD流水线,不使用RLD。
  • 仅低命中率、携带大KV Cache的“刺头请求”才触发P-RLD-MD流水线。
    实测中RLD仅承担6.2%的Token生成任务,MD包揽93.8%。

关键洞察与痛点

团队在前期研究中发现三个核心规律:

  1. 硬件性能极度偏科:部分芯片在Decode阶段性能可达旗舰GPU的210%,但在Prefill阶段仅81%,同构部署无法发挥特长。
  2. DRC技术将带宽需求降低10倍:通过Decode端前缀缓存(RadixCache),90%命中率下跨集群传输需求缩减一个数量级。
  3. 非均匀延迟特点:Agent业务中输出极短(30%请求<100 Token),但KV Cache传输延迟占端到端总延迟43%-56%,且长尾集中在极少数低命中率请求。

实测成绩单

在DeepSeek-V4-pro模型、真实Agentic工作负载下:

  • 延迟表现:P90 TTFT从18.3秒降至9.8秒(降46%),P99从29.7秒降至14.4秒(降51.5%),基本消除以太网慢速传输影响。
  • 性价比:相比单机房同构旗舰GPU集群(IDC-PD),总成本下降3.5%-7.1%,有效吞吐提升27.8%,性价比(Benefit-Cost Ratio)提升37.5%。
  • 负载分布:RLD与MD负载比1:15.2,验证了“只掩延迟不干重活”的设计目标。

总结与展望

PDD架构通过“极简局部异构+灵活远端分离”模式,使行业中分散的存量算力集群能够通过低成本以太网互联,由本地极小比例的中继算力掩盖网络延迟,将主流解码负载外溢到远端低成本节点。该方案不仅有效降低推理成本,也为未来MaaS基础设施提供了弹性扩展蓝本。

技术报告地址:https://github.com/infinigence/pdd

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。