一、AI ISP到底是什么

AI ISP不是什么神秘概念。它是在传统ISP固定硬件管线中嵌入深度学习模块的一种架构。要理解为什么这样设计有价值,得先回到传统ISP的流水线上看一看。

传统ISP 是一套串联工序。光从场景反射,穿过镜头,打到CMOS Sensor上,芯片开始工作。Sensor输出的是Bayer Raw——一种每个像素只记录R、G、B三色之一、按马赛克排列的原始数据。这个原始数据和你在手机屏幕上看到的彩色图片之间,隔着七八道依次执行的工序:

黑电平校正先上场。Sensor即使完全无光,读出电路也会有一个微小的偏置电压,这就是黑电平。把它扣掉,才算拿到了真实的信号零点。

坏点校正紧随其后。Sensor上总有极少数像素不听话——永远输出最大值,或者完全没反应。用周围像素插值补上,别让它们影响后续处理。

接下来是最关键的一步:Demosaic(去马赛克)。Bayer Raw每个像素只有一个颜色通道,Demosaic通过邻域插值,给每个像素补全缺失的R、G、B三个通道。从这一刻起,数据量翻了三倍。

之后是白平衡。场景的光源色温不同——钨丝灯偏暖,阴天偏冷。白平衡根据色温估计,给R、G、B通道分别乘上不同的增益系数,把白色校准回白色。

色彩校正接着做。Sensor的RGB三通道光谱响应和人眼的三色刺激曲线不完全吻合,需要一个色彩校正矩阵把Sensor看到的颜色映射到人眼感知的颜色空间。

然后才轮到降噪。在经过Demosaic把噪声扩散到三个通道、白平衡把噪声放大到不同程度之后,降噪模块终于登场,试图把已经被污染得不成样子的噪声分布收拾干净。

最后是色调映射和输出。把高动态范围的线性数据压缩到显示设备的有限动态范围里,同时保留高光和暗部的细节。

这个流水线看起来完整流畅,但里面藏着一个结构性问题:降噪排在Demosaic之后。

为什么这是个问题?设想Sensor上一个像素,它的R通道因为光子散粒噪声的随机波动多积累了几个电子——这是一个干干净净的单通道偏差。但经过Demosaic时,这个像素缺失的G和B通道要靠周围像素插值补上。周围像素自身也有噪声。于是:原本只有R通道偏离了几个电子,经过Demosaic后,R偏了几个、G也偏了几个(因为被周围有噪声的G像素影响)、B也偏了几个(同理)。三个通道的偏差不再独立,而是耦合在一起,形成了一个谁也说不清分布的联合噪声。

白平衡紧接着再补一刀。白平衡对不同颜色通道的增益差异可能很大——极端场景下,R通道增益可能是B通道的1.5倍甚至2倍。原本不同通道噪声虽然耦合但幅度相近,被不同的增益系数一乘,噪声的统计分布从一个相对规整的形态,被拉伸成了一个高维的非线性怪物。

这不是谁故意把降噪放在后面使坏。它是传统ISP逐模块串联架构的必然结果——每个模块只对自己的任务负责,不管输出对下游意味着什么。Demosaic不管"我插值会不会恶化噪声",白平衡不管"我放大R通道的同时也在放大R通道的噪声"。因果链条一路向下传递,最终全部压在降噪模块身上。

那如果把降噪放在Demosaic之前呢?这时候数据还在Bayer Raw域——每个像素只有一个颜色通道,噪声还保持着它最原始的分布形态。这个原始噪声主要由两部分构成:泊松分量来自光子散粒噪声的物理规律,光子到达的随机性天然服从泊松分布;高斯分量来自Sensor读出电路的电子热运动。两个分布都干净、独立、可建模。在这个域上做降噪,面对的是噪声的源头,而不是被插值和增益污染过的下游残留。

一句话总结:Demosaic前的降噪是"在源头清理",Demosaic后的降噪是"在下游治污"。而AI ISP的核心突破之一,就是把降噪模块前移到Bayer Raw域,在噪声还"干净"的时候把它解决掉。

二、为什么AI能解决传统算法解决不了的问题

理解了降噪位置的差异之后,下一个问题是:就算把降噪放在Bayer Raw域,传统的滤波降噪不就够了吗?为什么一定需要深度学习?

传统降噪算法——不管是3DNR(三维降噪)还是BM3D(三维块匹配滤波)——本质上是同一套方法论:设计一个固定的滤波核,用运动估计找到相邻帧的对应像素块,根据一个预设的阈值判断"这是噪声还是信号",然后该抹的抹、该留的留。

这套方法能工作的核心假设是:噪声和信号在某个变换域上是可分离的。在光照充足的场景里,这个假设基本成立。信号的能量集中在低频,噪声的能量分布在高频,频域或小波域上一刀切,大致分得开。

但当信噪比暴跌——比如暗光场景——这个假设就开始崩塌。信号微弱到和噪声处于同一量级,两者的统计特征高度相似。一个噪声的波动幅度和一块微弱纹理的灰度变化,在数值上看不出本质区别。用固定规则去区分它们,就像是让裁判在雾里判断哪个是选手、哪个是影子——不是裁判水平不行,是规则本身就失效了。

深度学习降噪的思路完全不同。它不靠规则判断,靠样本学习。

给一个神经网络喂足够多的Noisy-Clean图像对——同一场景的带噪声版本和干净版本——经过足够次数的反向传播,网络的权重会逐渐"理解"一条布纹的经纬走向和一粒噪声的随机颗粒之间的本质区别。这种区别不是某个频段的截断,不是某个阈值的判断,而是一种对图像内容的语义级理解:它认识"纹理",也认识"噪声",所以能把它们分开。

这种基于语义的分离能力,是固定滤波核永远无法企及的。滤波核不问"这个像素属于布纹还是噪声",它只问"这个像素的梯度有没有超过阈值"。当噪声的梯度和布纹的梯度数字上差不多时,滤波核只能连布纹带噪声一起抹,输出一张光滑但丢失细节的画面。

但深度学习降噪也有它自己的问题——而且很棘手。

第一个问题是端侧算力。经典的去噪网络,比如U-Net,在GPU上跑推理当然没问题。但ISP芯片面向的是摄像头设备——没有几百瓦的显卡,没有几十GB的显存,只有一块NPU,算力以T为单位,功耗以毫瓦计量。直接把U-Net部署上去,一帧都算不完。

解决思路是知识蒸馏。Teacher大模型在云端用海量数据和充足算力,吃到最充分,学会最精细的噪声分布区分能力。然后Student小模型——也许是Teacher的千分之一参数量——在训练过程中不仅学Noisy-to-Clean的映射,还学Teacher的中间层特征表达。相当于Teacher把毕生所学浓缩成一本薄薄的"考试重点",Student带着这本重点笔记去NPU上跑实时推理。准确率不比Teacher,但足够把传统算法远远甩在后面。

第二个问题是Sensor适配。不同Sensor的噪声特性差异显著——Sony的Starvis系列和国产Sensor的读出噪声分布不一样,同一个Sensor在不同温度下的暗电流噪声也不一样。换Sensor就是换噪声分布,换了噪声分布就需要重新适配模型参数。

这就意味着,AI ISP的工具链必须开放——不能让模型出厂固化,不能让客户每换一款Sensor就回原厂重新训练。必须提供一套校准工具和微调流程,让客户在自己的场景里、用自己量产的Sensor、按自己的光照条件完成模型适配。这是深度学习从"实验室Demo"走向"工程落地"的分水岭。

三、暗光是最极端的考场

一个有趣的事实:为什么AI ISP最显著的差异化表现,几乎总是出现在暗光场景?

因为暗光是传统ISP最无力的地带。光照充足的时候,信噪比够高,信号和噪声在频域上的分离度足够大,传统滤波和深度学习都能交出不错的答卷,差异在毫厘之间——可能是某块纹理保留得完整一点,可能是某个边缘稍微锐利一点,普通人未必看得出来。

但暗光不一样。当照度降到一定程度,传统ISP的方案直接从"还不错"退化到"不可用"。画面上密密麻麻的色噪、大块大块的涂抹、运动物体的拖尾——这些都指向同一个根源:信噪比太低,固定规则的区分能力丧失了。而AI ISP在同样照度下的表现,差异放大到肉眼可辨——不是因为AI在暗光下变得更强了,而是因为传统方案在暗光下退得更快。

给两个照度数据建立直观感知:0.001 Lux大约是晴朗无月星空下的地面照度——摄影里叫"星光级"。0.0001 Lux比星光还暗一个数量级——基本是伸手不见五指。在这个照度下,传统ISP的输出基本上只剩下噪声,必须切红外补光灯才能看到点什么,而且一补光就失去了色彩信息——输出只能黑白。

而一个在Bayer Raw域做了深度学习降噪的AI ISP,在0.0001 Lux下仍然能输出彩色图像。不是效果有多完美——噪声当然还有——但色彩信息保住了,场景结构可辨了,从"不可用"变成了"能用"。这背后就是在Demosaic前把噪声按住,避免它在后续流水线中被扩散和放大的结构优势。

但暗光也是一道极端的工程考题,考的不只是算法。

端侧NPU的算力池是固定的。降噪网络占用了算力,人形检测、人脸识别、运动跟踪等其他智能任务就得靠边站。所以暗光降噪的算力消耗不仅要比传统算法好,还要省——省出来的算力留给其他任务。这要求网络结构必须极致紧凑:不是把U-Net蒸馏到几十分之一就完事了,而是要针对Bayer Raw的数据特性和ISP的多任务并行场景,从零开始设计网络结构。

还有实时性的硬约束。以4M分辨率15帧每秒为例——每一帧从进来到出去,整个ISP的耗时预算是66毫秒。降噪推理的延迟必须控制在30到40毫秒以内,超过这个窗口,后续的Demosaic、白平衡、色彩校正、编码输出全部被堵死,帧率直接崩塌。这不是"跑得快更好"的问题,是"必须在规定时间内跑完"的问题。

四、下篇预告

理论部分讲到这里。我们理清了三条线索:第一,降噪放在Bayer Raw域比放在Demosaic之后更合理——源头治理优于下游治污。第二,深度学习能做的不是"更好的滤波",而是"基于语义的噪声与信号分离",这是传统算法的方法论天花板。第三,暗光放大了这两条线索的价值,但同时也施加了端侧算力和实时性的双重硬约束。

三条线索交汇,指向同一个工程问题:你怎么把上面这些理论做进一颗芯片里?

下一章,我们回到地面。讲GK7206V1是怎么把AI ISP的学术路径走通到工程实现的——NPU怎么和ISP管线分工协作、AI降噪网络怎么部署在Bayer Raw域、整个ISP 的架构长什么样、从模型训练到芯片量产的六阶段链路怎么一步步打通。

从"Bayer Raw域处理更优"的学术结论,到一片以0.5T算力跑通4M@15fps实时AI降噪的芯片,中间的工程填平过程——下篇展开。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐