Imagination E系列GPU首秀:AI超分仅需2.3ms,Prefill性能提升4.7倍
2026/09/28 09:21阅读量 2
Imagination发布最新E系列GPU IP,通过整合神经核与低精度计算能力,实现AI超分辨率渲染耗时仅2.3毫秒,并支持MXFP8/MXFP4格式使LLM Prefill性能提升4.7倍。该架构旨在通过减少数据搬运和统一软件栈,解决端侧SoC中图形处理与AI负载(如Agent应用)的融合难题,降低开发维护成本。
事件概述
Imagination Technologies发布了其最新GPU IP产品——E系列。该系列旨在应对终端设备日益增长的AI计算需求,特别是本地大模型推理、Agent应用以及多模态数据处理。E系列通过将图形渲染、矩阵乘法和卷积运算整合到可编程架构中,试图在单一硬件平台上高效处理传统图形任务与新兴AI负载,从而优化算力利用率并降低软件开发与维护成本。
核心技术与性能表现
1. AI超分辨率渲染(Neural Core)
- 机制创新:引入“神经核”概念,利用AI超分技术替代传统高分辨率渲染。GPU先以低分辨率渲染画面,再通过神经网络重建高分辨率图像。
- 架构优势:摒弃了传统的GPU+NPU异构路径,由GPU独自承担图形计算和矩阵运算,大幅减少了图像在DDR内存中的读写往返,降低了延迟和带宽消耗。
- 算法优化:结合自研压缩技术,单次神经网络处理可降低超过一半的权重数据量,进一步减少存储和读取开销。
- 性能数据:
- 单核E系列将画面从540p提升至1080p仅需2.3毫秒。
- 在540p至4K的提升过程中,带宽消耗最高降低54%,帧率最高达到对照结果的2.5倍。
- TBDR技术加持:沿用基于分块的延迟渲染(Tile-Based Deferred Rendering),将屏幕拆分为多个Tile逐块渲染,使中间数据保留在片上缓存,并与AI处理结合,进一步减少外部内存访问。
2. 大语言模型(LLM)推理加速
- 低精度计算支持:首次引入LLM常用的MXFP8和MXFP4低精度格式。低位宽提高了矩阵运算吞吐,显著加速Prefill阶段。
- 性能提升:相比上一代产品,E系列在Prefill阶段的性能提升了4.7倍。
- 带宽缓解:低精度量化减少了模型权重和中间数据的字节占用,缓解了Decode阶段的带宽压力。
- 内存接口:通过AXI接口适配LPDDR、GDDR和HBM等不同内存类型,最高可支持768GB/s的读取带宽。
3. 多模态处理能力
- 卷积运算增强:针对视觉识别、感知等多模态AI任务,同步提升卷积计算能力,性能为上一代的4.4倍。
- ALU执行优化:改造算术逻辑单元(ALU)执行机制,将相关运算组织成连续工作流,最大化数据复用,最小化不必要的数据搬运,带来最高**39%**的每瓦性能提升。
软件生态与系统整合
- 通用性与兼容性:开发者可使用OpenCL、Vulkan编写Kernel,并接入Llama.cpp、ONNX、PyTorch等上层生态。Imagination致力于保持跨代软件栈的统一性,确保优化代码可迁移复用。
- 异构SoC分工:尽管GPU承担了更多AI任务,但Imagination强调其在SoC中仍作为关键一环而非唯一处理器。CPU负责协调任务流程,GPU与其他专用单元(如NPU、传感器控制器)配合。
- 协作机制:通过硬件mailbox传递状态指令,利用共享内存减少数据拷贝,缩短处理器间切换等待时间,客户可将GPU软件集成至自有SDK以实现灵活的资源调度。
战略意义
Imagination E系列的推出标志着其AI战略重心回归通用性更强的GPU架构。通过证明同一套硬件和软件体系能够同时高效处理图形渲染和复杂AI任务,Imagination向芯片设计厂商展示了一种降低长期构建成本、提高数据效率的平台型解决方案。
