平头哥发布真武V900及全栈算力方案:从单芯片竞争转向系统级协同
2026/09/23 13:55阅读量 2
2026年9月,平头哥在杭州云栖大会发布新一代AI芯片真武V900及ICN Switch、磐脉网卡等全栈产品,标志着其算力布局从单一芯片扩展至算存网协同。真武V900凭借216GB显存和1200GB/s互联带宽,支持千卡高速互联以应对万亿参数模型的MoE架构需求。随着Agentic AI负载对CPU依赖度提升,倚天CPU路线图同步更新,旨在通过软硬件全链路优化解决硬件与软件发展代差问题。
事件概述
在2026年9月22日举行的杭州云栖大会上,平头哥首次在主论坛完整展示其AI算力全栈布局。此次发布不仅包括最新一代训推一体AI芯片真武 V900,还涵盖了互联芯片 ICN Switch、智能网卡 磐脉、SSD主控 镇岳 以及通用计算 倚天 CPU 的演进路线。这一系列动作反映了AI行业从“单卡性能比拼”向“整个计算系统协同”的竞争范式转变,核心驱动力来自 Agentic(智能体)时代负载结构的变化。
核心信息
1. 真武 V900:突破单卡极限,支撑千卡互联
- 性能指标:真武 V900 搭载 216GB 显存,片间互联带宽提升至 1200GB/s。相比上一代真武 M890(144GB显存,800GB/s带宽),其单芯片性能提升3倍,是目前中国算力性能最强的AI芯片。
- 精度支持:原生支持 FP8 和 FP4,覆盖高精度训练及低精度/超低精度推理场景。
- 量产计划:预计于 2027年第一季度 进入量产销售;下一代真武 J900 计划于 2028年第三季度 推出。
- 技术演进:从2024年的真武 810E 到 M890 再到 V900,平头哥持续强化训练、推理、显存容量及低精度计算能力,以适配模型参数规模的指数级增长。
2. 互联与系统协同:解决MoE架构下的通信瓶颈
- 背景挑战:随着模型进入万亿参数规模,Mixture of Experts (MoE) 成为主流架构。虽然MoE降低了单次计算的参数量,但专家间的频繁数据交换对芯片间通信速度提出了极高要求。仅靠单卡显存无法部署超大模型,必须依赖多卡协作。
- ICN Switch 作用:作为阿里超节点形态算力的核心芯片,ICN Switch 为真武 V900 提供原生内存语义和统一编址能力,实现 千卡全带宽高速互联。这使得上千颗芯片能像一颗“超级芯片”一样协同工作,保障高吞吐、低延迟的数据交换。
- 应用案例:基于真武 M890 的超节点已跑通 Qwen3.8、Kimi K3 等超2万亿参数模型;众擎机器人利用真武搭建千卡平台,端到端训练效率提升34%;小鹏汽车使用真武处理自动驾驶业务,整机性能提升70%,集群故障减少50%。
3. 倚天 CPU 路线图:适应 Agentic AI 的新负载特征
- 负载变化:在传统训练中,GPU/CPU比例约为 8:1;而在 Agentic AI 场景中,Agent 需执行搜索、代码验证、状态保存等多步骤任务,CPU 密度向 1:1 甚至更高演变。
- 产品规划:
- 2027年:推出倚天 720(面向吞吐并发型场景)和倚天 730(面向延迟敏感型场景,单核性能达上一代1.4倍)。
- 未来:计划推出基于第二代自研核心的倚天 750,支持与真武 AI 芯片通过同一套高速互联体系交换数据,降低 CPU 与 AI 芯片间的数据交换开销。
4. 软件栈 SAIL 与全链路优化
- SAIL 软件栈:覆盖操作系统、SDK、驱动及调试工具,兼容 Python、TensorFlow、vLLM、SGLang 等 260+ 主流框架。对于超过 1 亿 Star 的主流 AI 仓库,SAIL 覆盖率超 96%,新框架适配平均时间不超过 1 周。
- 实际效果:以 Kimi K3 适配真武 M890 为例,通过算子优化,首 Token 时延下降约 35%,单卡解码吞吐提升 1.8 倍。
- 云平台协同:阿里云灵骏真武超节点实例在 Agentic 推理场景中,通过软硬件协同可实现最多 1.5 倍的推理性能提升。
值得关注
- 研发周期与模型迭代的矛盾:AI 芯片从立项到流片通常需 1.5-4 年,而 AI 模型架构(如从 Dense 到 MoE 再到 Sparse MoE)和应用形态(从 Chat 到 Agent)迭代极快。平头哥依托阿里内部“千问模型+阿里云+电商/支付场景”的闭环,能够更早洞察趋势,使硬件设计提前匹配未来负载需求,这是其区别于纯硬件厂商的核心优势。
- 基础设施目标:吴泳铭提出,到 2032 年,阿里云运营的全球数据中心规模目标超过 20GW,并计划继续训练 5万亿至 10万亿参数规模的新模型,显示出资本投入和技术路线的长期确定性。
