Jetson Orin NX低光视频优化:从400ms到28ms的全栈重构实践
2026/09/11 16:00阅读量 2
针对Jetson Orin NX边缘设备上的低光监控视频处理,传统模型因架构臃肿导致推理延迟高达400ms,无法满足30FPS实时性要求。Nota AI通过重新定义问题,采用YUV通道分离策略并开发仅98K参数的轻量级DeltaViT模型,将处理时间降至28ms以下。该方案在保持自然图像质量和亮度顺序的同时,显著提升了吞吐量并优于主流基准模型。
事件概述
在商业闭路电视(CCTV)部署中,低光视频增强不仅面临实时性挑战,还需在无参考图像(Ground Truth-free)环境下保证图像质量。某项目原有模型在Jetson Orin NX上单帧处理耗时约400ms,远超33ms(30 FPS)的实时目标。通用优化手段如量化和剪枝均触及瓶颈,最终通过全栈定制化设计实现了性能突破。
核心信息
1. 现有模型的优化瓶颈
- 初始状态:客户端原有模型由低光增强模块和独立去噪模块组成,结构沉重。在AGX Orin开发板上测试时延迟约为180ms,在目标设备Jetson Orin NX上则高达400ms。
- 通用优化失效:
- ONNX图优化(减少Transpose/Reshape、增加下采样率)将延迟降至60ms,但TensorRT运行时自动执行类似优化后无进一步空间。
- INT8量化因可用层比例有限,实际运行速度慢于FP16。
- 50%剪枝导致速度停滞在15 FPS且出现可见画质下降。
- 尝试RUAS、Zero-DCE++、LiteIE和Wave-mamba等主流模型,均未突破33ms限制。
- 根本原因:现有模型及替代方案均采用“从头生成或恢复整张图像”的重计算模式,无法在边缘硬件上实现实时处理。
2. 架构重构策略:YUV通道分离与轻量化设计
Nota AI放弃对现成模型的微调,转而基于边缘硬件约束从头设计轻量级模型,核心决策如下:
- YUV色彩空间分离:将输入图像分为亮度(Y)和色度(UV)通道。由于低光监控的核心是亮度恢复,模型骨干网络仅处理Y通道,输入数据量减少至三分之一,并移除了沉重的颜色重建解码器。
- 激进下采样:鉴于UV通道已分离,可对鲁棒性较强的Y通道应用约2/5比例的激进下采样,避免高频空间信息丢失导致的色彩溢出。
- 双线性上采样与颜色校正:恢复后的Y通道通过双线性插值还原分辨率,并与经过轻量级颜色校正层处理的原始UV通道合并。此方法无需深度学习解码器即可保持颜色一致性。
3. DeltaViT模型性能表现
- 模型规格:采用内部开发的轻量级Vision Transformer(DeltaViT),参数量仅为98K,相比排行榜前列的RetinexFormer(1.6M参数)缩小了约16倍。
- 推理速度:
- 在Jetson Orin NX上,GPU计算时间低于28ms,满足30 FPS实时要求并留有5ms余量。
- 在RTX 3090上,1080p推理时间为8.92ms(约112 FPS),比RetinexFormer快约63倍。
- 负载弹性优异:输入像素从480p增至1080p(6.7倍增长)时,推理时间仅增加1.93倍,而Zero-DCE++和RetinexFormer分别增加6.72倍和7.87倍。
- 画质指标:在无参考评估中,DeltaViT在NIQE(自然图像质量评估)和LOE(亮度顺序误差)两项关键指标上均排名第一,优于LYT-Net、RUAS、Zero-DCE++和RetinexFormer。(注:LYT-Net在1080p下因显存溢出无法运行)
值得关注
该案例表明,在资源受限的边缘设备上,单纯依赖通用优化技术(如量化、剪枝)难以解决实时性瓶颈。通过深入理解业务场景(如监控主要依赖亮度信息),重新定义算法架构(如YUV分离),并结合硬件特性进行端到端设计,是实现高性能低光视频处理的关键路径。
