Synaptics Torq NPU 与 Gemma 3 协同:边缘端高效大模型推理的三支柱优化

2026/08/10 16:00阅读量 2

Synaptics 与 Google Research 合作推出 Astra SL2610 系列 IoT 边缘 AI 处理器,集成 Coral NPU,并通过 Torq NPU 实现 Gemma 3 270M 模型的高效本地推理。通过静态模型转换、硬件加速激活函数和混合精度量化三大优化,推理速度提升 3.5 倍,兼顾隐私、离线可靠性与低延迟。

事件概述

Synaptics 与 Google Research 合作,推出面向边缘端大语言模型(LLM)推理的解决方案。该方案基于 Synaptics Astra SL2610 系列——业界首款集成 Google Coral NPU 的 IoT 边缘 AI 处理器。Torq NPU 采用异构架构,结合 Synaptics 自研的 transformer 专用核心(T1)与 Google 开发的标量 RISC-V 核心(Coral NPU),实现高效的多模态 AI 本地推理。

核心信息

边缘 LLM 推理的挑战

  • 大多数边缘硬件并非针对 LLM 的动态执行模式、激活瓶颈和内存搬运需求设计。
  • 在标准 CPU(Arm、RISC-V、x86)上运行数十亿参数的 transformer 模型效率低下,且挤占应用堆栈的计算资源。
  • 传统边缘 NPU 难以应对动态序列长度和注意力掩码,静态运行时无法管理变化的张量维度;GELU、Softmax 等激活函数在通用加速器上产生延迟和功耗瓶颈;内存带宽往往成为主要瓶颈。

Torq NPU 的三大优化支柱

  1. 静态模型转换:编译工具链将动态图转换为静态图,预分配 KV 缓存,实现静态注意力掩码和位置编码,保证执行时间可预测。

  2. 硬件加速激活函数:通过查表(LUT)和线性插值分解 GELU 和 Softmax 计算。GELU 推理速度提升 10 倍,Softmax 推理速度提升 12.5 倍(无除法注意力机制)。

  3. 混合精度权重量化:基于敏感度引导的压缩策略,84% 的层量化到 4-bit,16% 的敏感层(如语言建模头)保持 8-bit。权重从 16-bit 降至平均 4.3-bit,模型保真度损失可忽略;压缩权重在流入计算单元时实时反量化为 bf16,有效吞吐提升 2.7 倍。

实际效果

  • 综合以上优化,Torq NPU 将推理速度提升 3.5 倍,消除动态分配开销,激活计算加速 10 倍,并显著改善内存带宽利用率。
  • 在 Gemma 3 270M 上支持设备端本地推理,实现数据隐私、离线可靠性、即时延迟和降低云 API 成本。可用于自然语言工具调用、离线翻译、消息摘要和文档处理等场景。

值得关注

  • 该方案满足欧洲《网络弹性法案》(CRA)等严格安全法规对本地执行的要求。
  • 开发资源已公开:Torq 示例和文档可在 GitHub 获取;硬件评估可通过 Synaptics Astra SL2610(Machina)开发套件进行。Synaptics Coralboard 预计将在 Google I/O 2026 后正式发布。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。