扩散语言模型(dLLM)加速落地端侧:Agent推理速度提升5-10倍,挑战自回归范式
2026/09/01 12:34阅读量 2
中国团队DiffuSpace与亚洲智能体计算平台Acrab达成合作,将扩散语言模型(dLLM)适配于端侧AI场景。测试显示,dLLM凭借“全局生成”机制,在Coding Agent和视频剪辑等任务中,使端侧Agent运行速度提升5至10倍。这一进展标志着AI技术路线从单纯追求云端大模型规模,转向通过改变生成方式结合端侧并行算力以提升实时响应效率的新方向。
事件概述
中国扩散语言模型(diffusion Large Language Model, dLLM)研发团队 DiffuSpace 已与亚洲智能体计算平台公司 Acrab 达成战略合作协议。双方旨在共同推进 dLLM 在 AI PC、智能汽车、机器人及智能家居等端侧 AI 场景中的落地应用。此次合作的核心在于解决端侧 Agent 面临的实时响应与计算效率瓶颈,通过模型与算力的协同适配,实现性能突破。
核心技术与性能表现
- 生成范式差异:传统 GPT 类自回归模型采用“从左至右、逐个 Token”的生成方式;而 dLLM 借鉴图像生成的扩散机制,采用“全局生成”策略,能够结合上下文持续调整结果,类似“先整体生成再修正”。
- 速度提升显著:在部分场景中,dLLM 的推理速度可达 GPT 式自回归模型的 10 倍。在与 Acrab 的适配测试中,端侧 Agent 的运行速度提升了 5 倍。
- 应用场景验证:
- Coding Agent:利用 dLLM 并行处理多个代码位置的能力,显著提升代码生成和修改效率。
- 视频剪辑智能体:利用其全局建模能力,协同处理图像、语音和文字等多模态信息。
产业背景与硬件支撑
- DiffuSpace 的技术积累:该团队是全球最早投入 dLLM 范式研究的团队之一,自 2022 年起陆续推出 DiffuSeq、RDM、DiffuLLaMA 等成果,并研发出代表性模型 Dream 7B。其在条件生成、离散信号建模及 Scaling 三大核心问题上拥有领先突破。
- Acrab 的硬件底座:作为已量产的端侧 AI 计算平台提供商,Acrab 推出了第一代端侧 AI 芯片 GΞLIX 1 及 Agent Box 智能终端。GΞLIX 1 提供超过 700 TOPS 的 AI 算力和 273GB/s 的统一内存带宽,支持消费和工业场景下的离线智能体部署。Acrab 累计融资超 4.8 亿美元。
行业趋势分析
- 新变量崛起:今年以来,Google、Inception、蚂蚁集团等企业纷纷布局 dLLM。行业内出现观点认为,扩散语言模型可能在未来两年内成为替代 GPT 类自回归模型的基础模型新范式。
- 端侧需求驱动:随着 AI Agent 深入 PC、汽车和家庭设备,用户对本地化、快速响应的 Agent 需求增加。dLLM 与端侧计算的结合,并非简单的模型移植,而是围绕 Agent 工作负载进行的系统级优化,有望成为下一轮模型竞争中的重要变量。
