无问芯穹PDD架构破局:跨集群异构推理延迟砍半、成本直降近40%
2026/07/30 14:14阅读量 2
无问芯穹在WAIC 2026发布跨集群异构推理架构PDD,通过P-RLD-MD三级分离设计,利用本地中继节点掩盖以太网传输延迟,在DeepSeek-V4-pro模型实测中实现首Token延迟降低51.5%、单Token成本降低37.5%,有效盘活全国分散算力集群。
事件概述
无问芯穹在2026 WAIC世界人工智能大会上公布跨集群异构推理架构PDD(Prefill-RelayDecode-MainDecode),并发布完整技术报告。该架构通过广域网以太网串联多地同构数据中心,将传统PD分离的两层结构扩展为三层,重点攻克了KV Cache跨集群传输的延迟瓶颈。
核心架构与机制
三阶段分离设计
- P实例(Prefill):位于主集群,负责计算密集型的前缀计算。
- RLD实例(RelayDecode):与P实例同机房,通过高速RDMA网络连接,作为延迟掩盖中继。
- MD实例(MainDecode):位于远端集群,通过广域网以太网连接,承担绝大部分解码任务。
关键机制:Extend-Decode Handoff
当MD实例通过以太网收到完整KV Cache时,RLD仅将已生成的Token ID(几KB数据)传给MD,MD本地重新计算对应KV Cache并继续解码。实测重算100个Token的KV Cache平均仅需305.2ms,远优于以太网传输的185.4ms(峰值512.6ms)。该机制将不可控的网络操作转化为确定性本地计算。
负载调度策略
基于命中率分布高度偏斜的规律(约70%-80%请求命中率>95%):
- 高命中率请求直接走P-MD流水线,不使用RLD。
- 仅低命中率、携带大KV Cache的“刺头请求”才触发P-RLD-MD流水线。
实测中RLD仅承担6.2%的Token生成任务,MD包揽93.8%。
关键洞察与痛点
团队在前期研究中发现三个核心规律:
- 硬件性能极度偏科:部分芯片在Decode阶段性能可达旗舰GPU的210%,但在Prefill阶段仅81%,同构部署无法发挥特长。
- DRC技术将带宽需求降低10倍:通过Decode端前缀缓存(RadixCache),90%命中率下跨集群传输需求缩减一个数量级。
- 非均匀延迟特点:Agent业务中输出极短(30%请求<100 Token),但KV Cache传输延迟占端到端总延迟43%-56%,且长尾集中在极少数低命中率请求。
实测成绩单
在DeepSeek-V4-pro模型、真实Agentic工作负载下:
- 延迟表现:P90 TTFT从18.3秒降至9.8秒(降46%),P99从29.7秒降至14.4秒(降51.5%),基本消除以太网慢速传输影响。
- 性价比:相比单机房同构旗舰GPU集群(IDC-PD),总成本下降3.5%-7.1%,有效吞吐提升27.8%,性价比(Benefit-Cost Ratio)提升37.5%。
- 负载分布:RLD与MD负载比1:15.2,验证了“只掩延迟不干重活”的设计目标。
总结与展望
PDD架构通过“极简局部异构+灵活远端分离”模式,使行业中分散的存量算力集群能够通过低成本以太网互联,由本地极小比例的中继算力掩盖网络延迟,将主流解码负载外溢到远端低成本节点。该方案不仅有效降低推理成本,也为未来MaaS基础设施提供了弹性扩展蓝本。
