【脑机接口】深度学习网络层 & 模型架构术语(第7弹)
201.CNN 卷积神经网络:CNN 是一种以卷积操作为核心的深度学习模型。它通过卷积核在局部范围内滑动,提取局部特征。在 EEG 任务中,CNN 可以用于提取时间维度上的波形变化、空间维度上的通道关系,也可以用于提取时频图中的局部模式。相比全连接网络,CNN 参数更少,适合处理 EEG 这种样本量有限但结构规律明显的数据。
202.Conv1d 一维卷积:Conv1d 是一维卷积,常用于处理时间序列数据。对于 EEG 来说,它可以沿时间轴提取局部时序特征,例如短时间内的振幅变化、节律波动和诱发响应形态。也可以把通道维度作为输入特征,在某些结构中沿通道方向做卷积。Conv1d 结构简单,计算量较低,常用于 MI、ERP、SSVEP 等 EEG 分类模型。
203.Conv2d 二维卷积:Conv2d 是二维卷积,常用于图像处理,也可以用于 EEG。使用时通常需要把 EEG 构造成二维形式,例如“通道 × 时间”“频率 × 时间”或脑电拓扑图。对于时频图,Conv2d 可以提取局部时频模式;对于通道拓扑图,Conv2d 可以利用电极空间邻近关系。需要注意的是,EEG 电极不是规则图像像素,直接使用 Conv2d 时要合理设计输入排列。
204.深度可分离卷积:深度可分离卷积是一种轻量化卷积结构,通常由深度卷积和逐点卷积组成。深度卷积对每个输入通道分别卷积,逐点卷积再用 1×1 卷积融合通道信息。它可以显著减少参数量和计算量。EEGNet 中就使用了类似思想,因此深度可分离卷积在轻量化 BCI 模型中很常见。
205.空洞 / 膨胀卷积:空洞卷积也叫膨胀卷积,它会在卷积核采样点之间加入间隔。这样可以在不明显增加参数量的情况下扩大感受野。对于 EEG 时序建模,空洞卷积可以让模型看到更长时间范围内的信号变化。它适合捕获较长周期的节律信息,但如果膨胀率设置不合适,也可能遗漏局部细节。
206.因果卷积:因果卷积是一种只使用当前时刻和过去时刻信息的卷积方式。它不会使用未来时间点的数据。这个特点适合在线 BCI,因为在线系统在当前时刻无法获得未来信号。因果卷积常用于实时 EEG 解码、连续控制和在线预测任务。
207.转置卷积:转置卷积常用于特征图上采样,也常被称为反卷积,但严格来说它不是普通卷积的数学逆运算。它可以把低分辨率特征恢复到更高分辨率,用于信号重构、生成模型或编码器-解码器结构。在 EEG 中,转置卷积可以用于重构时序信号、恢复时频图,或在自编码器中生成输出。分类模型中一般不一定需要转置卷积。
208.分组卷积:分组卷积是把输入通道分成若干组,每组分别进行卷积。它可以减少参数量和计算量,也可以让不同通道组学习相对独立的特征。在 EEG 模型中,分组卷积可用于分离不同频带、不同通道组或不同特征子空间。它的设计需要与 EEG 输入结构匹配,否则可能限制通道间信息融合。
209.逐点卷积 1×1 Conv:1×1 卷积是在空间或时间位置上使用大小为 1 的卷积核。它主要用于通道维度的升维、降维和通道特征融合。对于 EEG 模型,1×1 卷积可以把多个特征通道重新组合,也可以压缩冗余特征,降低后续计算量。它不直接扩大时间或空间感受野,但对特征通道交互很重要。
210.池化 Pooling:池化是一种下采样操作,用于减少特征维度和计算量。最大池化取局部范围内的最大值,平均池化取局部平均值。EEG 模型中,池化常用于压缩时间维度或频率维度,使特征更稳定。池化可以提高一定的平移鲁棒性,但过强的池化可能丢失细粒度时序信息。
211.GAP 全局平均池化:GAP 是 Global Average Pooling 的缩写,表示全局平均池化。它会对每个特征通道在空间或时间维度上求平均,得到一个较短的特征向量。GAP 常用于替代大规模全连接层,从而减少参数量,降低过拟合风险。在 EEG 小样本任务中,GAP 比直接展平后接大 FC 层更稳健。
212.感受野:感受野是指网络中某个特征单元能够看到的原始输入范围。在 EEG 中,感受野可以对应一段时间范围、一组电极范围,或者一块时频区域。感受野太小,模型可能只能捕获局部波动;感受野太大,模型可能忽略细节或引入无关噪声。卷积核大小、网络深度、池化和空洞卷积都会影响感受野。
213.共享权重:共享权重是卷积神经网络的重要特点。一个卷积核会在不同位置重复使用同一组参数。这样可以减少参数量,并让模型在不同时间点或不同局部区域识别相同类型的模式。在 EEG 中,共享权重有助于检测不同时间位置出现的相似节律或诱发响应。
214.残差连接:残差连接是一种短路连接方式,它会把输入直接加到后续层的输出上。这样可以缓解深层网络中的梯度消失问题,使网络更容易训练。对于 EEG 深度模型,残差连接可以帮助模型在加深网络时保持稳定。它还可以让模型学习输入与输出之间的增量变化,而不是完全重新学习整个映射。
215.瓶颈层:瓶颈层是一种先降维再升维的结构设计。它通常用较小的中间维度压缩特征,再恢复到需要的输出维度。这样可以减少参数量和计算量,同时保留主要信息。ResNet、MobileNet 等模型中都有类似思想。在 EEG 模型中,瓶颈层常用于压缩高维通道特征或多频带特征。
216.门控机制:门控机制是一种控制信息通过程度的结构。它会根据输入生成一个权重或开关,用来决定哪些信息保留、哪些信息抑制。LSTM 和 GRU 中都有典型的门控结构。EEG 信号噪声较多,门控机制可以帮助模型选择更重要的时间片段、频段或通道特征。
217.LSTM/GRU:LSTM 和 GRU 都是循环神经网络的改进结构,用于建模序列数据中的长期依赖关系。LSTM 使用输入门、遗忘门和输出门控制信息流,GRU 结构更简化,参数量通常更少。它们可以用于 EEG 时间序列建模,例如识别一段时间内持续变化的脑电模式。缺点是训练速度通常慢于卷积网络,并且对长序列计算成本较高。
218.BiLSTM 双向循环网络:BiLSTM 是双向 LSTM,由正向 LSTM 和反向 LSTM 组成。它既利用过去时间信息,也利用未来时间信息,因此适合离线 EEG 分析。对于已经完整采集的一段 EEG,BiLSTM 可以学习前后时序上下文,提高特征表达能力。但在线 BCI 中不能直接使用未来数据,所以 BiLSTM 不适合严格实时预测场景,除非使用延迟窗口。
219.嵌入层 Embedding:嵌入层是把低维、离散或原始输入映射到高维连续特征空间的结构。在自然语言处理中,它常用于词向量表示;在 EEG 中,它可以用于把通道编号、频段编号、时间片段或离散标签映射成可学习特征。某些 Transformer 型 EEG 模型会先把 EEG 片段切成 patch,再通过线性层或卷积层得到 embedding。它的作用是形成模型后续处理所需的统一特征表示。
220.位置编码:位置编码用于向模型提供时序顺序或空间位置信息。Transformer 本身不具备循环结构,也没有卷积的局部滑动顺序,因此需要位置编码来区分不同时间点或不同 patch 的位置。EEG 中的位置编码可以表示时间顺序,也可以表示电极位置或频段位置。没有位置编码时,模型可能难以理解 EEG 序列的先后关系。
221.层归一化 LayerNorm:LayerNorm 是对单个样本内部的特征维度进行归一化。它不依赖 batch 中其他样本,所以在小 batch 或变长序列任务中更稳定。Transformer 中通常使用 LayerNorm 来稳定注意力模块训练。EEG 数据常受个体差异和试次波动影响,LayerNorm 可以帮助缓解特征尺度变化。
222.批量归一化 BatchNorm:BatchNorm 是对一个 batch 内的样本统计均值和方差进行归一化。它可以加速 CNN 收敛,稳定训练过程,并具有一定正则化效果。在 EEG CNN 模型中,BatchNorm 常放在卷积层之后。需要注意的是,当 batch size 很小或不同受试者混合训练时,BatchNorm 的统计量可能不稳定。
223.实例归一化 InstanceNorm:InstanceNorm 是对每个样本的每个通道单独进行归一化。它不使用 batch 维度统计量,因此更关注单个样本内部的分布调整。对于 EEG 来说,不同受试者、不同试次之间信号幅值和分布差异较大,InstanceNorm 有时可以帮助模型适配个体差异。但它也可能削弱某些有用的幅值信息,所以需要结合任务判断。
224.Dropout 随机失活:Dropout 是一种防止过拟合的正则化方法。训练时,它会随机将一部分神经元输出置为 0,使模型不能过度依赖少数特征。测试时,所有神经元都会参与计算。EEG 数据样本量通常较小,Dropout 在全连接层或深层特征层中很常用,但过高的 Dropout 比例会导致欠拟合。
225.全连接层 FC:全连接层是把输入特征映射到输出空间的线性层。每个输出神经元都会连接到所有输入特征。在 EEG 分类模型中,FC 层常用于把卷积或循环网络提取的特征转换为类别得分。它表达能力强,但参数量可能很大,因此容易在小样本 EEG 任务中过拟合。
226.多分支网络:多分支网络是指模型中存在多个并行处理路径。不同分支可以分别提取空间特征、时间特征、频域特征或不同尺度特征。EEG 信号具有多维属性,多分支结构可以让不同模块专注于不同信息来源。最后再通过拼接、相加或注意力方式进行融合。
227.特征拼接 Concat:Concat 是把多个特征在某个维度上直接连接起来。多分支网络中常用 Concat 融合不同分支输出,例如把时域特征、频域特征和空间特征拼成一个更长的向量。它可以保留各分支的完整信息。缺点是会增加特征维度,可能带来更多参数和过拟合风险。
228.特征相加 Add:Add 是把多个形状相同的特征逐元素相加。它常用于残差连接和轻量化特征融合。与 Concat 不同,Add 不会增加特征维度,因此参数和计算量更低。缺点是它要求输入特征维度一致,并且融合后不同分支的信息边界不如拼接清楚。
229.特征金字塔 FPN:FPN 是 Feature Pyramid Network 的缩写,原本常用于计算机视觉中的多尺度目标检测。它通过自上而下路径和横向连接融合不同层级的特征。迁移到 EEG 中时,FPN 思想可以用于融合不同时间尺度、频率尺度或网络层级的特征。它适合处理既需要局部细节又需要全局信息的任务。
230.全局上下文模块:全局上下文模块用于建模输入中远距离位置之间的依赖关系。普通卷积主要关注局部范围,全局上下文模块可以补充整体信息。在 EEG 中,全局上下文可以表示长时间依赖、跨通道关系或不同频段之间的整体联系。常见实现包括全局池化、注意力机制、非局部模块和轻量化上下文聚合结构。
231.梯度消失:梯度消失是指神经网络反向传播时,梯度在多层传递后变得非常接近 0。这样前面层的参数几乎无法更新,模型训练变慢甚至失效。深层网络、循环网络和不合适的激活函数都可能导致梯度消失。残差连接、归一化层、合适的初始化和门控结构都可以缓解这个问题。
232.梯度爆炸:梯度爆炸是指反向传播过程中梯度变得非常大,导致参数更新幅度过大。训练时可能表现为 loss 剧烈震荡、变成 NaN,或者模型无法收敛。循环神经网络和长序列训练中较容易出现梯度爆炸。常见处理方法包括梯度裁剪、降低学习率、归一化和稳定的网络初始化。
233.特征解耦:特征解耦是指让模型中的不同特征分量或不同分支学习相对独立的信息。对于 EEG 来说,可以把空间特征、频率特征、时间特征分开建模,再进行融合。这样有助于减少不同信息之间的干扰,也能提高特征解释性。特征解耦不是简单拆分网络,而是要让不同分支确实承担不同的表达功能。
234.模型容量:模型容量是指模型拟合复杂数据分布的能力。参数更多、层数更深、非线性更强的模型通常容量更大。容量太小会欠拟合,无法学到 EEG 中的有效模式;容量太大则可能在小样本 EEG 数据上过拟合。BCI 模型设计中需要在表达能力、样本量、计算成本和泛化能力之间平衡。
235.参数冗余:参数冗余是指模型中存在大量对最终性能贡献较小或重复表达相似功能的参数。冗余参数会增加计算量和存储成本,也可能提高过拟合风险。在 EEG 任务中,由于数据量通常有限,过大的模型容易出现参数冗余。剪枝、低秩分解、权重共享、深度可分离卷积和知识蒸馏都可以用于减少冗余。
更多推荐


所有评论(0)