趋境科技与摩尔线程达成战略合作,国产异构方案实现高品质AI Token生产级落地
2026/09/04 17:23阅读量 2
9月3日,趋境科技与摩尔线程签署战略合作协议,基于趋境自研PD异构技术与摩尔线程MTT S5000智算卡及MUSA平台深度融合,共同推进国产化高品质AI Token工厂建设。该联合方案已投入生产并承接头部模型厂商真实流量,在同等标准下兼顾性能与成本,整体性价比超越国际先进算力。目前方案以平均超50 TPS生成速度、超90% KV Cache命中率及99.9%稳定性通过生产验证,标志着国产PD异构推理正式进入生产环境。
事件概述
2026年9月3日,趋境科技(Qijing Technology)与摩尔线程(Moore Threads)正式签署战略合作协议。双方将基于趋境科技自研的国产Prefill-Decode(PD)异构技术,与摩尔线程MTT S5000智算卡及MUSA软件平台进行深度整合,共同研发和推广以Token Pod(Token超节点)为载体的联合解决方案,旨在建设能够承接真实业务的高品质AI Token国产化生产工厂。
核心信息与技术路径
1. PD异构架构优化成本结构
该合作的核心优势在于对大模型推理中Prefill(预填充)与Decode(解码)两个阶段的资源解耦与优化:
- Prefill阶段:由摩尔线程MTT S5000承担输入计算与KV Cache生成。凭借高密度AI算力、原生FP8精度及MUSA软件栈支持,MTT S5000被构建为可独立供给、计费优化的算力资源池。
- Decode阶段:由高带宽GPU负责Token生成。
- 协同效应:趋境科技通过自研技术完成跨设备协同,减少Prefill阶段对高成本资源的占用,避免按单一峰值配置基础设施。数据显示,由4至5台MTT S5000组成的Prefill资源池,其输入Token处理性价比超过国际先进算力方案。
2. 生产级性能指标验证
方案已从实验环境走向规模化生产,并在头部模型厂商的真实Token流量中运行。关键生产数据如下:
- 生成速度:平均超过50 TPS(Tokens Per Second)。
- 缓存效率:KV Cache命中率超过90%。
- 稳定性:达到99.9%的服务可用性。
- 时延保障:实现了生产级的低首Token时延(TTFT)。
3. “少模型、深优化”策略
趋境科技坚持“少模型、深优化”路线,聚焦具有明确规模化需求的重点模型,围绕模型、芯片及真实负载进行持续工程优化。相关经验已沉淀至ATaaS平台,形成可复用的生产能力。
值得关注
- 标准化交付载体Token Pod:双方将推出软硬一体化的Token Pod解决方案,具备共享KV Cache、流量感知配置、弹性扩展和故障隔离能力,可适配国产与国际主流硬件组合,加速解决方案落地。
- 产能基础:截至2026年8月,趋境科技已完成日均万亿级高品质AI Token的生产项目共建,并在多个项目中形成日均千亿级生产能力,为大规模国产化Token工厂建设积累了实证经验。
- 行业意义:此次合作标志着国产PD异构推理技术率先进入生产环境,证明了国产算力在系统级Token生产效率上具备替代国际先进算力的潜力,为万亿参数大模型的规模化推理提供了兼顾性能与成本的国产路径。
