深度学习与眼动追踪(附数据和分析代码)
视觉搜索的眼动追踪数据虽富含时空信息,却常因传统分析依赖简化指标而丢弃大量原始变异性。本研究将卷积神经网络直接作用于原始眼动轨迹时程,无需手动提取特征,即可从时程中学习并成功分类任务无关分心物的位置。网络不仅跨数据集泛化,且表现优于首次眼跳落点等常规指标。特征可视化进一步揭示,网络捕捉到了反射性注意捕获与后续注视纠正的精细时空模式。这项工作为充分挖掘眼动时程数据中以往难以触及的认知信号,提供了可推广的计算路径。相关数据和代码可在公众号后台回复“深度学习与眼动追踪”直接获取。
摘要
视觉搜索过程中的眼动追踪产生了时空信息高度丰富但维度复杂的数据。传统分析方法多依赖简化指标(如眼跳落点、停留时间等),这一简化过程不可避免地舍弃了原始眼动数据中相当大比例的变异信息。本文探究了深度学习能否为研究者提供一种客观手段,将这些被排除在分析之外的数据重新纳入研究视野。卷积神经网络是一类在生物数据分类任务中表现优异的监督式机器学习工具。本研究构建了多个卷积神经网络,使其直接从原始眼动位置时程数据中学习,以实现对相关刺激(如搜索目标/分心物)位置的分类。每项分析中,本研究在三分之二的数据上训练网络,并在剩余数据上进行交叉验证,进而通过传统频率学派检验与分层贝叶斯建模,将分类准确率与随机水平进行比较。利用本实验室先前两项视觉搜索研究的数据,卷积神经网络成功分类了具有“曾作为搜索目标历史”的分心物的位置,在每项眼动数据集中均发现了反射性、经验驱动外显注意的证据。更为重要的是,分心物位置的预测成功泛化至第三个完全独立的数据集,无需任何额外训练,且其表现优于传统眼跳落点指标。特征可视化进一步揭示,卷积神经网络在试次早期主要从靠近分心物位置的眼动样本中学习,而在试次后期则转向分心物对侧位置的眼动样本,这一时空模式提示存在朝向分心物的反射性注意分配,以及随后的注视纠正性偏移。综上,本研究验证了基于卷积神经网络的分析方法,并凸显了该方法在解析视觉搜索眼动追踪所获时空数据方面的实用价值。
引言
高分辨率时程数据是视觉领域心理物理学实验与神经影像学实验的重要产物。其中,来自眼动追踪的眼动时程数据在视觉研究中十分常见,且蕴含的信息极为丰富。然而,正因为这种丰富性,眼动数据的分析通常依赖启发式方法和简化假设,以大幅降低数据复杂度、确保分析的可处理性。启发式算法固然是探索数据集特征的有力工具,但其开发过程耗时较长,往往仅基于数据集中的一小部分特征,且需要研究者做出主观决策,这可能导致分析结果偏向眼动信息的某一特定方面,而忽视其他维度。近年来,机器学习领域的快速进展催生了大量新方法,其中卷积神经网络尤其适合对复杂而数据丰沛的生物过程进行建模。卷积神经网络是一类利用密集排列的序列化计算滤波器层对输入进行变换的神经网络。尽管卷积神经网络本质上自身也产生启发式规则,但它们能够快速、大规模地完成这一过程,且其规则的形成由数据集中的所有样本共同决定。与之相对,研究者往往通过聚焦于数据的局部特征来构建启发式规则,而卷积神经网络则在整个数据集上进行弥散式训练,从而降低了卷积神经网络的启发式规则仅在数据子集上表现良好的概率。此外,作为机器学习算法,卷积神经网络能够高效地依据整个数据集评估众多随机初始化的启发式规则,无需人工干预,因而能够挖掘数据集中更为丰富的特征和更高的复杂度。在这里,本研究将卷积神经网络应用于眼动时程数据,旨在探究其是否能从原始眼动数据中学会预测相关搜索对象(如目标和/或分心物)的位置,从而为外显注意到这些对象的分配提供证据。
在典型的视觉搜索任务中,参与者会面对一组由多个刺激构成的“搜索阵列”。他们通过一系列眼动在阵列中视觉定位某一特定刺激(搜索目标),随后做出知觉判断(例如,判断目标圆圈内的线条是垂直还是水平)。视觉搜索过程中的连续眼动追踪能够捕捉眼动位置的逐时变化,这为研究提供了超越知觉决策速度与准确性的额外经验数据源。然而,此类眼动追踪数据虽时空信息丰富,却也极为复杂。在视觉搜索研究领域,通常的做法是推导出简化指标以降低这种复杂性。例如,许多研究根据首次记录眼跳的落点位置计算试次比例,或量化注视在阵列特定区域内的停留时间。但此类简化处理无意中舍弃了眼动数据中可能对揭示进行中心理过程极具信息价值的方面。处理连续眼动追踪数据复杂性的另一种方法是,借助机器学习领域的前沿进展,训练卷积神经网络从整个时程中自主学习。
由于视觉搜索实验中每个试次通常包含多个固定的刺激呈现位置,我们要解决的问题本质上是一个分类问题。多种类型的卷积神经网络均可经训练后,根据两个(二分类)或多个(多水平分类)不同类别中最可能的一项对输入进行归类。在视觉搜索的情境下,可向卷积神经网络输入眼动位置数据的时程,并训练其预测搜索对象(如目标、分心物或其他相关刺激)的位置作为输出,即执行多水平分类。举例而言,假设训练一个卷积神经网络从原始眼动轨迹中预测任务无关分心物的位置。该网络会为每个试次产出一组数值,每个数值对应于分心物出现在给定位置的概率。这组数值中的最大值反映了卷积神经网络对该试次中分心物位置的最佳估计。若该估计与该试次中分心物的实际位置一致,则分类被视为正确;否则视为不正确。在学习过程中,训练机制通过梯度下降等优化例程更新卷积神经网络的参数,以持续提升分类准确率。为确保训练所得参数具备泛化能力,网络通常会在训练期间留出的数据子集上进行交叉验证。关键之处在于,在对验证集进行分类时,卷积神经网络的参数保持不变。验证集上的正确分类比例,可作为衡量卷积神经网络整体性能的准确率指标。
在以上述方式将卷积神经网络应用于眼动数据之后,我们便可以确定眼动轨迹中哪些时空特征对分类最具信息量。尽管前述性能指标能够揭示卷积神经网络是否检测到了注意向分心物分配的眼动信号,却无法提供关于该信号本身属性的任何信息。为间接表征这一信号,可将分类准确率与传统眼动指标进行比较,以此判断卷积神经网络预测所依据的信息是否已完全被既有技术所捕获。若要进行更为直接的刻画,SHAP分析等特征可视化技术能够量化每个输入特征对模型输出预测的贡献。在当前语境下,SHAP分析可量化每条眼动轨迹中各个眼动位置样本对网络整体预测的贡献大小。这些“SHAP值”能够展示卷积神经网络用于分心物分类的时空模式,进而可与搜索过程中已知的眼动现象进行比较。
在此,本研究利用卷积神经网络对来自本实验室三项既有视觉搜索数据集中引发“经验驱动注意”分配的分心物位置进行分类。这些实验分为两个阶段,第一阶段的搜索目标由其颜色定义,第二阶段的搜索目标由其形状定义。在每一阶段,参与者需在五个颜色各异的独特色调分心物中定位目标,并报告目标内部所含线条的朝向。在第二阶段,其中一个分心物元素的颜色与第一阶段搜索目标的颜色相匹配。这些分心物既非任务相关,亦非物理突显,却因其“曾作为搜索目标的历史”而引发了外显注意的反射性偏移。若参与者确实将外显注意反射性地分配至此类分心物,那么这些注意偏移的证据理应蕴含于原始眼动轨迹之中,我们据此假设卷积神经网络能够从中习得这一模式。结果显示,卷积神经网络成功预测了Massa等人以及Grubb与Li研究中搜索目标(作为初步的“健全性检验”)和任务无关分心物的位置,传统频率学派检验与分层贝叶斯建模均证实了这一点。此外,在Massa等人眼动数据上训练的卷积神经网络,能够进一步利用Doyle等人一组完全独立的眼动轨迹预测分心物位置,从而有力证明了网络所习得的注意眼动特征具有跨数据集的泛化性。卷积神经网络准确率与传统眼跳指标的比较表明,网络学习所依据的眼动信息并不局限于首次眼跳落点。SHAP分析则揭示,卷积神经网络在试次早期主要从靠近分心物位置的眼动样本中学习(即经验驱动注意的反射性分配),而在试次后期则转向分心物对侧位置的眼动样本(即注视离开分心物的纠正性偏移)。综上,本研究验证了基于卷积神经网络方法的有效性,并凸显了该方法在解析视觉搜索眼动追踪所获时空数据方面的实用价值。
方法
设备
所有数据集所涉及的知觉任务均使用PsychoPy编写,并在Mac Mini计算机上运行。刺激呈现在一台27.0英寸LED背光戴尔游戏显示器(型号S2716DG)上,屏幕分辨率为2560×1440像素。参与者坐在一间昏暗的实验测试室内,通过罗技F310手柄做出反应。
知觉任务
本研究采用了Massa等人(2024)此前发表的数据,该研究中79名参与者完成了一项两阶段的视觉搜索实验。具体而言,本研究使用了第二阶段的眼动数据集(图1,左)。在该阶段中,每位参与者完成480个试次,任务是在五个分心形状中,报告由形状定义的目标(菱形中的圆形,或圆形中的菱形)内部线条的朝向(二择一迫选:垂直或水平),每个刺激均以独特的颜色呈现。这些刺激围绕注视点呈圆形等距排列。在由六个刺激组成的搜索阵列中,两个刺激位于水平经线上,其余四个刺激均匀分布于二者之间。参与者的反应时间窗为1200ms。在一半的试次中,某一分心物以第一阶段曾指示搜索目标的四种颜色之一(红色、青柠色、黄色或青色,四种颜色在第一阶段中以等比例出现)呈现;在另一半第二阶段试次中,所有分心物均未使用第一阶段搜索目标的颜色。当该特定分心物出现时,其出现在搜索阵列中除目标位置外五个位置中任一位置的概率均等。(注:第一阶段操纵了目标颜色与奖赏幅度之间的关联,以及目标颜色与工具性信息之间的关联。尽管信息关联在调节注意捕获的程度上存在差异,但所有类型分心物均表现出偏转眼动的证据。因此,就本研究目的而言,我们不对分心物类型加以区分。)

图1.Massa等人和Grubb与Li研究中的示例搜索阵列。
本研究还对Grubb与Li(2018)报告的数据进行了建模,该研究中104名参与者完成了一项两阶段的视觉搜索实验。本研究使用了第二阶段产生的眼动数据集(图1,右)。在该阶段中,参与者完成240个试次,任务是在五个分心物中,报告由形状定义的目标(菱形中的圆形或圆形中的菱形)内部线条的朝向(二择一迫选:垂直或水平),每个分心物均以独特的颜色呈现。这些刺激围绕注视点呈圆形等距排列。在由六个刺激组成的搜索阵列中,两个刺激位于垂直经线上,其余四个刺激均匀分布于二者之间。参与者有1200ms的时间做出反应。在一半的试次中,其中一个分心物以第一阶段指示搜索目标的颜色(红色或绿色,两种颜色在第一阶段中出现的比例相等)呈现。在另一半试次中,所有分心物均未使用第一阶段搜索目标的颜色。当该特定分心物出现时,其出现在搜索阵列中除目标位置外五个位置中任一位置的概率均等。Grubb与Li的研究由一项背景研究和一项注册报告组成,两者实验方案相同,仅在与显示器相关的观看距离和反馈操作上有所不同。
本研究还利用了Doyle等人(2025)的眼动数据,其中120名参与者完成了一项基于Massa等人两阶段视觉搜索实验的修改版本。该研究的实验方案与Massa等人完全相同,仅存在以下区别:(1)在Massa等人的研究中,正确反应会获得逐试次奖赏,而Doyle等人研究中的参与者仅接受基于正确率的反馈,并在实验结束时获得固定金额的报酬;(2)若任一参与者曾参加过Massa等人的研究,其数据在分析前即被排除,以防止任何残余关联对结果产生影响。
眼动追踪
两项研究均使用EyeLink 1000红外视频眼动仪记录眼动,并在每项研究的每个阶段开始前执行九点校准程序。在Massa等人和Doyle等人的数据集中,参与者将下颌置于距离显示器70cm的下颌托上。对于Grubb与Li的研究,参与者可自由移动头部,坐于距显示器约96cm处,眼动仪设置为“远程观看模式”;而在该研究的注册报告部分,参与者将下颌置于距离显示器60cm的下颌托上。本研究使用eyelinkReader包将所有生成的EDF文件导入R Studio。
排除标准
对于每位参与者,本研究计算了每个试次中刺激阵列呈现期间眼动位置缺失的样本比例,并排除了平均缺失数据比例超过组平均值两个标准差的参与者。将该排除标准应用于Massa等人的数据集,排除了7名参与者的数据,最终纳入72名参与者的眼动数据用于第二阶段分析。将该排除标准应用于Grubb与Li数据集的第二阶段,排除了7名参与者的数据,剩余97名参与者的眼动数据用于当前分析。将该排除标准应用于Doyle等人数据集的第二阶段,排除了10名参与者的数据,最终纳入110名参与者的数据进行分析。
数据预处理
在两个数据集中,参与者注视的x位置和y位置均以500Hz的采样率进行采样,每个特征(以像素为单位的注视x位置和y位置)存储为时程向量。针对每个试次和每位参与者,提取搜索阵列呈现期间的眼动位置数据。任何缺失的眼动样本(在未处理的眼动数据中以NA表示)均替换为相应的中心注视点坐标值(x位置向量为1279.5像素,y位置向量为719.5像素)。鉴于做出反应时搜索阵列即消失,在每个试次的时程末尾填充具有相应注视点坐标的额外样本,以使向量长度相等(每项研究1200ms窗口对应600个样本)。若任一时程向量因眼动仪采样率与指示反应窗口结束的信号之间存在轻微时间错位而长于规定的最大长度,则删除多余的样本。该预处理为每位参与者的每个试次生成两个完整的最大长度时程向量,分别包含x位置和y位置信息。然后将这些向量串联成每个特征的二维眼动位置数据阵列,创建仅包含x位置数据的阵列和仅包含y位置数据的阵列。在这些阵列中,行代表试次,列代表样本。上传至分析脚本后,试次级眼动位置样本的二维阵列随后被转换为三维阵列,该阵列的行、列和切片分别对应整个预处理后眼动数据集的试次、特征和样本。
对于预测目标位置的神经网络,本研究还为每个试次创建了标记搜索目标在阵列中实际位置的标签。这些标签由单一数值构成,通过0-5范围内的数字编码(代表所有六个可能的目标位置)来表示目标位置。在构建特征阵列的过程中,标签被串联为一个一维阵列(x轴,试次),其顺序与对应的眼动位置数据保持一致。这些标签最终与所应用神经网络的输出进行比较,以评估其预测是否正确。对于预测分心物位置的神经网络,该过程完全相同,区别仅在于保存的是分心物的位置,而非目标的位置。
训练/验证集划分
对于所有预测目标位置的卷积神经网络,预处理后的试次级眼动位置数据按三分之二/三分之一的比例划分为训练集/验证集。具体而言,从每位参与者的数据集中抽取每第三个试次以构成验证集。其余试次则构成训练集。对于预测分心物位置的神经网络,首先排除无分心物的试次,然后在包含分心物的试次子集上执行三分之二/三分之一训练/验证集划分。在展示使用Massa等人数据训练的卷积神经网络的模型泛化能力时,将Doyle等人的全部眼动位置数据集直接用于验证,无需进行训练/验证集划分。
小批量处理
在输入神经网络之前,每个训练数据集中的试次及其对应标签被划分为若干大小为64的组,即“小批量”。若数据集的总试次数无法被64整除,则最后一个小批量包含剩余的额外试次。与在遍历整个数据集后才更新参数(每个epoch仅进行一次参数更新)的方式不同,这种小批量处理技术允许所应用的神经网络在每个批次后更新其参数(总共进行[n/64]次参数更新,向上取整,其中n为整个数据集中的试次数),从而加快其学习速度。
CNN架构
所有神经网络分析均使用PyTorch(https://pytorch.org/)在Google Colab Notebook中编码与执行。本研究采用了一个一维卷积神经网络,其结构由一个输入层、三个包含神经元的隐藏层及一个输出层组成(图2)。在小批量内,表示眼动位置的时间序列试次逐次由输入层处理。该输入层对试次的值与其卷积核执行一维卷积,卷积核的权重通过训练习得。该卷积核沿输入时程迭代推进:每次推进时,计算卷积核的习得权重与由核大小所界定的一段样本的点积;随后,将核按设定的步长平移,并计算下一个点积。此过程在输入的整个长度上重复进行。本文所用卷积神经网络的完整实现细节详见源代码(https://github.com/nicholasdcrotty/CDVMBG_BRM_CNNOculomotorAnalysis)。简言之,网络使用的卷积层核大小为3,以步长1沿输入推进。该卷积操作产生了一个具有64个特征的二维输出。卷积层的输出随即通过修正线性单元(ReLU)激活函数,其中若x > 0,则ReLU(x)=x,否则为0。该输出继而通过一种称为dropout的正则化方法,该方法以概率p将层输入中的每个值置零,从而降低网络内单个神经元对其他单个神经元值的过度依赖。本研究将dropout率(p)设置为0.25,即输入中的每个值有25%的概率被置零。经过正则化后,所得输出通过一个大小和步长均为5的最大池化函数。最大池化函数虽不影响卷积神经网络对单个输入的计算,但能通过将搜索算法聚焦于输入区域内的最大值来提高训练效率。该池化操作产生了另一个具有64个特征的二维输出。

图2.CNN架构。
所得二维输出被展平为一个包含7616个数值的一维序列,并依次通过多个无激活函数的全连接线性层,此处统称为线性变换。共计三个线性变换,分别包含7616个神经元、64个神经元和32个神经元;输出变换则包含六个神经元,产生六个值(即logits)。这六个输出值随后与当前试次对应的目标(或分心物)位置标签进行直接比较。若输出中最大logit的位置与标签中的数字匹配,则表明卷积神经网络成功从该试次的眼动位置数据中预测了目标的位置;若不匹配,则表明卷积神经网络对该试次目标位置的预测不正确。
损失函数
在经历训练集的每个小批量后,所有神经网络均根据其预测目标(或分心物)位置的准确率来更新习得权重,这一过程称为反向传播。预测的整体准确率通过损失函数进行评估,该函数须随准确率的提高而递减,其性质类似于负似然函数。本研究采用分类交叉熵作为所有神经网络的损失函数,该方法常用于多水平分类任务。在参数更新过程中,神经网络计算该损失函数相对于当前参数值的梯度,并利用一个称为学习率的系数对该梯度值进行缩放。随后,将该缩放值从当前参数值中减去,即生成用于下一轮学习迭代的更新权重。
早停
对于所有在数据上进行训练的卷积神经网络分析(即模型泛化能力演示除外),本研究均实施了早停(early stopping)程序。该程序的设计初衷是:一旦观察到验证集上的损失停止下降,即终止训练/验证过程,从而限制网络对训练数据过拟合的可能性。本研究采用了一个为PyTorch实现而设计的现有早停协议版本。在每个训练/验证循环结束后,若验证损失达到新的最小值,则保存卷积神经网络的参数权重;若验证损失未降至新的最小值,则追踪早停标准的计数器递增1。本研究的早停协议将耐心值(Patience)设为10,意味着在连续10个epoch内验证损失最小值未出现下降后,训练/验证循环将终止。一旦满足该标准,则恢复产生该最小损失所对应的卷积神经网络参数权重。本研究在后续统计分析中使用该卷积神经网络迭代产生的分类准确率。
学习率的指数衰减
若神经网络以恒定学习率进行训练/验证循环,反向传播过程中计算的梯度可能会急剧增大乃至趋近无穷,从而削弱网络收敛到解的精度。为解决此类“梯度爆炸”问题,本研究对学习率实施了指数衰减策略。该方法在每个训练/验证循环结束时,通过将学习率乘以衰减因子γ(其中γ<1)来逐步缩减其幅度。本研究采用γ=0.9,即每个循环结束后,学习率衰减至其先前幅度的90%。
超参数
每个卷积神经网络以小批量方式接收试次,批量大小设为64。使用Adam优化器将卷积神经网络拟合至数据。鉴于各网络均执行多水平分类任务,统一使用分类交叉熵作为损失函数。所有卷积神经网络的学习率均初始化为10⁻³,并在每个循环后以0.9的因子(γ)衰减。本研究采用耐心值为10的早停协议。
为在机器学习语境下促进开放科学实践,本研究报告了上述超参数设定的顺序、时机和过程(图3)。损失函数(分类交叉熵)、批量大小(64)及学习率(10⁻³)的选择与PyTorch文档“Learn the Basics”教程中所采用的设置保持一致。Adam优化器的选择基于文档中另一个专门介绍不同类型优化器的教程。这些超参数在任何卷积神经网络拟合数据之前即已确定,且在整个研究过程中保持不变。

图3.超参数时间线。
统计分析
配对t检验。对于每个神经网络,将参与者水平的分类准确率与代表随机水平表现的向量(16.67%,即六个潜在目标位置间的随机猜测)进行比较。
置信区间。每个卷积神经网络分类准确率的95%置信区间使用参与者水平卷积神经网络准确率的10000次自助抽样计算。
分层贝叶斯建模。对于每个卷积神经网络,本研究对验证集的二分类结果(即分类成功或不成功)应用了一个分层贝叶斯模型(公式1)。将每个个体i的正确分类次数C建模为从二项分布中抽取N次的结果,其概率为p(公式1,第1行)。将每个个体的p定义为从形状参数为α和β的贝塔分布中的一次随机抽取(公式1,第2行)。为每个形状参数分配弱信息先验(公式1,第3行和第4行),以使贝塔分布的先验更集中于随机水平附近。本研究使用哈密顿蒙特卡洛方法进行后验采样,对所有模型各运行四条链,每条链迭代1000次,该过程使用R语言中的rethinking包执行。所有模型将公开提供,并附有相应的电子表格,详细报告各后验分布的均值、标准差、95%置信区间、有效样本数以及(一种用于评判蒙特卡洛算法收敛性的指标)。

SHAP分析
本研究使用SHAP分析来可视化分类目标位置的卷积神经网络如何从输入数据中学习并形成预测。SHAP值源于博弈论概念,是一种可加性指标,用于量化每个输入特征对模型输出预测的贡献,该贡献是相对于应用于数据子集的“解释器模型”而言的。本研究对每个基于卷积神经网络分析的验证集执行了SHAP分析,包括预测目标位置和预测分心物位置的分析。本研究采用专用于具有隐藏层网络的“Deep SHAP”方法,其中SHAP值通过DeepLIFT算法进行近似计算。通过SHAP库,本研究将解释器应用于前100个验证试次,随后为验证集中每个试次级时程内的每个眼动位置样本计算SHAP值。对于每一个样本,共计算12个值:六个表示x位置对预测各潜在对象位置的贡献,六个表示y位置对预测各潜在位置的贡献。然后,取跨类别和跨特征的平均绝对值,为每个样本生成一个单一的“全局特征重要性”指标,在后续分析中统称为“SHAP值”。
高斯加权核密度估计
为精确可视化对目标分类最具信息量的空间区域,本研究在将每个试次的眼动轨迹旋转以对齐目标位置后,对试次级最大SHAP值进行了高斯加权核密度估计(KDE)。简言之,核密度估计通过将每个数据点“平滑”为一个已知的对称函数(此处为高斯函数),然后对所得分布集求和,来刻画给定数据集的底层密度函数。核带宽(即每个对称函数的相对展宽)采用Silverman经验法则计算,该法则同时考虑了坐标数量及其标准差(在x维度和y维度上取平均)。在将所得核密度估计绘制为密度热图时,使用10像素的分辨率,并对密度值进行归一化处理,以便在不同热图之间进行定量比较。
结果
预测搜索目标的位置:初步的“合理性检验”
卷积神经网络准确率的频率学派解释
若有望利用原始眼动轨迹正确分类任务无关分心物的位置,则理应能够率先实现对任务相关目标位置的分类,因为在每个试次中,目标均预期获得外显注意。事实上,卷积神经网络仅凭借原始眼动轨迹所蕴含的信息,便成功学会了分类视觉搜索目标的位置。本研究通过一系列训练/验证循环,将结构相同的卷积神经网络拟合至Massa等人研究第二阶段的数据。每个循环包含对训练数据集的一轮训练,此后冻结网络参数权重,并在验证试次上测试其性能。Massa等人的数据集包含23040个训练试次和11520个验证试次。经过47个训练/验证循环后满足早停标准,并恢复了第37次迭代(即验证损失最小的循环)所对应的参数权重。随后,该卷积神经网络在7751个验证试次上正确分类了目标位置,总体分类准确率为67.28%,远高于在六个潜在目标位置间随机猜测的期望值(1/6=16.67%)。平均参与者水平准确率(图4A)显著高于随机水平(p<0.0001)。如图4B混淆矩阵所示,该网络在六个不同潜在目标位置上的分类准确率相对均衡。

图4.预测目标位置。
另一个卷积神经网络使用Grubb与Li研究的眼动位置数据,同样成功学会了预测搜索目标的位置。该网络在Grubb与Li数据集的15520个训练试次上进行训练,并在7760个验证试次上进行测试。经过55轮训练后满足早停标准,并恢复了第45轮的权重。该网络随后正确预测目标位置4697次(准确率60.53%)。参与者的平均准确率(60.53%,图4D)具有一个远高于随机水平的参与者水平自助抽样置信区间[56.19–64.81%],单样本t检验表明参与者水平平均准确率显著高于随机水平(p<0.0001)。该网络在六个不同潜在目标位置上的分类准确率相对一致(图4E)。
卷积神经网络准确率的贝叶斯解释
为评估给定卷积神经网络对目标位置的分类是否优于随机水平,本研究将一个分层贝叶斯模型拟合至每个卷积神经网络验证数据集的二分类试次水平结果(即分类成功或不成功)。本模型假设如下:(1)每位参与者的眼动位置数据包含可供卷积神经网络正确分类目标位置的信息,其正确概率对于每个个体而言是独特的,记为pi(见方法,模型1,第1行)。(2)pi值的分布由一个形状参数为α和β的贝塔分布生成(模型1,第2行)。本研究使用弱信息先验分布和哈密顿蒙特卡洛方法估计α和β的后验分布,进而可计算出由这些参数所定义的贝塔分布的均值(mean=α/(α+β))。图4C展示了拟合至Massa等人数据集的卷积神经网络的后验分布,表明有95%的把握认为生成pi值的贝塔分布的均值落在0.62至0.72之间(虚线)。95%最高概率密度区间(HPDI,虚线)远离随机水平(实线),虚线区间未包含实线即明确指示了这一点。此外,经验观察到的正确比例值(点线)恰好落在该HPDI的中央,证明数据与模型之间拟合良好。拟合至Grubb与Li数据集的卷积神经网络的后验分布如图4F所示。此处,经验测量的正确比例值(点线)位于95% HPDI(虚线)中心附近,表明模型拟合良好,且HPDI [0.56, 0.64]未包含随机水平(实线),进一步证实该卷积神经网络成功分类了目标位置。
卷积神经网络能否成功预测经验驱动分心物的位置?
预测任务无关分心物的位置
一个卷积神经网络仅利用原始眼动位置数据时程中所包含的信息,便成功学会了分类任务无关分心物的位置。本研究将一个新的卷积神经网络拟合至Massa等人数据中包含分心物存在试次的子集,并将输出logits与分心物的位置(而非如前节所述的目标位置)进行比较。该卷积神经网络在遍历数据集64个循环后满足早停标准,之后恢复了第54个循环的权重。该网络随后在5760个验证试次中的1147个试次上正确预测了分心物位置,准确率为19.91%。在参与者水平上(图5A),卷积神经网络对57/72名参与者的数据表现优于随机水平。参与者的平均准确率(19.91%)具有一个高于随机水平的参与者水平自助抽样置信区间[18.82–21.01%],单样本t检验确认参与者水平平均准确率显著高于随机水平(p<0.0001)。

图5.预测分心物位置。
基于卷积神经网络的方法在预测分心物位置上的成功也通过分层贝叶斯建模得到了证实。与先前的贝叶斯建模流程一致,本研究将一个分层模型应用于二分类结果,并利用拟合的形状参数计算生成pi值的贝塔分布的均值。该均值的分布如图5B所示,其95% HPDI(虚线)介于0.19至0.21之间。经验测量的正确比例值(点线)落在该HPDI中心附近,表明模型拟合良好。由于该HPDI未包含随机水平(实线),我们可以得出结论:该卷积神经网络在预测任务无关分心物位置方面表现出优于随机水平的准确率。
另一个卷积神经网络使用Grubb与Li的眼动位置数据成功学会了预测任务无关分心物的位置。再次将一个新的卷积神经网络拟合至该数据集中分心物存在试次的子集,并将输出logits与分心物位置进行比较。该卷积神经网络在遍历数据集38个循环后满足早停标准,随即恢复第28个epoch的参数权重。该网络随后在3880个验证试次中的744个试次上正确预测了分心物位置,准确率为19.18%。在参与者水平上(图5C),卷积神经网络对60/97名参与者的数据表现优于随机水平。跨参与者平均分类准确率(19.18%)具有一个高于随机水平的置信区间[17.84–20.54%],且参与者水平平均准确率显著高于随机水平(p<0.0005)。本研究再次使用分层贝叶斯方法对二分类结果进行建模(图5D)。经验测量的正确比例值(点线)落在95% HPDI(虚线)中心附近,表明模型拟合良好,且HPDI [0.18, 0.21]未包含随机水平(实线),进一步证实该卷积神经网络在预测分心物位置方面表现出优于随机水平的表现。
预测分心物位置的网络泛化能力
证明分心物引发外显注意偏移的最有力证据,在于展示网络习得参数的泛化能力。简言之,我们能否使用一个实验的数据训练卷积神经网络,来分类另一个完全独立实验中的分心物位置?若能,便可确信该卷积神经网络并非从生成训练数据集的参与者所特有的眼动模式中学习。接下来,本研究展示了此类泛化能力的证据:使用基于Massa等人数据训练的、用于预测分心物位置的卷积神经网络的参数权重,直接对一项近期发表的后续研究中的分心物位置进行分类,而无需在该新数据集上进行任何额外训练。
在Massa等人数据集上训练的卷积神经网络对Doyle等人研究中共计26400个试次中的5270个试次进行了分心物位置分类,准确率为19.96%。在参与者水平上(图6A),该网络对92/110名参与者的数据表现优于随机水平。跨参与者平均准确率(19.96%)具有一个高于随机水平的参与者水平置信区间[19.37–20.58%],且参与者水平平均准确率显著高于随机水平(p<0.0001)。本研究再次将分层贝叶斯模型应用于二分类试次水平结果(图6B)。模型对数据拟合良好,经验测量的正确比例值(点线)落在95% HPDI(虚线)中心附近,且HPDI [0.19, 0.21]未包含随机水平(实线)。因此,一个在Massa等人眼动数据上训练的卷积神经网络,成功利用来自另一项研究、此前完全未见过的原始眼动位置数据预测了分心物位置,且无需任何额外学习。

图6.在全新数据集中预测分心物位置。
卷积神经网络分心物位置分类准确率与传统眼动指标的比较
尽管上述结果为卷积神经网络能够检测并学习搜索过程中朝向任务无关分心物的外显注意偏移提供了有力证据,但并未阐明这些网络是否从传统眼动指标难以捕获的信息中习得。为此,本研究将卷积神经网络的表现与每个试次的首次眼跳落点进行了比较,后者是用于量化分心物引发外显注意偏移的常用指标。Massa等人和Doyle等人均报告了此类指标,即将搜索阵列划分为六个扇形“区块”(每个区块以一个潜在对象位置为中心),并计算首次眼跳落入包含分心物区块的试次比例(编码为二分类试次水平结果)。本研究将这些参与者水平比例与对应的卷积神经网络准确率进行比较,以间接评估网络所学习的信息是否完全被该汇总指标所涵盖。若卷积神经网络准确率并未显著高于基于眼跳落点的比例值,则网络可能仅学习了该指标已能表征的信息。反之,若卷积神经网络的表现优于该指标,则表明网络利用了该启发式方法所未能捕获的额外信息进行学习。
使用Massa等人数据训练的卷积神经网络,其分类准确率显著高于使用首次眼跳落在分心物附近比例的启发式方法。在同时包含有效眼动数据和已记录眼跳的试次中,该卷积神经网络的总体准确率为20.14%(参与者平均值,19.73%)。在同一子集中,首次记录的眼跳在17.01%的试次中落在包含分心物的区块内(参与者平均比例,17.10%)。参与者水平卷积神经网络准确率显著高于参与者水平首次眼跳启发式方法(图7A,p<0.003)。此外,参与者水平卷积神经网络准确率与首次眼跳落点启发式方法之间的平均差异为2.63%,其95%参与者水平自助抽样置信区间为[1.03–4.23%](图7B)。因此,使用Massa等人眼动数据训练以预测分心物位置的卷积神经网络优于使用分心物区域内首次眼跳落点的传统启发式方法,表明卷积神经网络在形成预测时使用了该指标未能捕获的眼动信息。

图7.卷积神经网络表现与传统眼动启发式方法的比较。
当应用于Doyle等人的数据集时,基于Massa等人数据训练的卷积神经网络再次以显著高于启发式方法的准确率预测了分心物位置,该启发式方法使用首次眼跳落在包含分心物“区块”内的比例。在Doyle等人研究中同时包含有效眼动数据和已记录眼跳的试次中,卷积神经网络的总体准确率为20.64%(参与者平均值,20.41%),而首次记录的眼跳仅在17.01%的此类试次中落在包含分心物的区块内(参与者平均值,16.33%)。如图7C所示,卷积神经网络参与者水平准确率显著高于对应的首次眼跳落点率(p<0.0001)。参与者水平卷积神经网络准确率与参与者水平眼跳落点率之间的平均差异为4.09%,其95%参与者水平自助抽样置信区间为[3.10–5.03%](图7D)。这些发现表明,在一个检验效力更高的试次样本中,卷积神经网络再次优于传统眼动指标,进一步证实卷积神经网络在习得关于分心物位置的预测时并非仅使用首次眼跳落点这一单一信息源。
卷积神经网络从何种信息中学习以准确形成预测?
特征重要性与反应时间的比较:“合理性检验”
作为SHAP分析的初步探索,本研究首先确认了预测分心物的卷积神经网络仅利用反应执行前记录的眼动位置样本来形成预测。本研究提取了最大SHAP值的位置(即该试次时程中最具信息量的样本点),并将该试次水平位置指标与对应的行为反应时间(RT)进行对比绘图(图8)。对于两个卷积神经网络(分别为Massa等人和Grubb & Li,图8A和8B),绝大多数数据点位于或低于单位线,表明这些试次上的反应时间均大于最大SHAP值所处的时程位置。这一结果模式证实了网络在生成预测时,主要依赖于反应执行之前采集的时程数据(即该试次中实际采集的眼动数据)。

图8.预测分心物的卷积神经网络特征重要性的时间模式。
特征重要性中时空模式的表征
为评估特征重要性的空间模式,本研究在围绕注视点旋转所有眼动轨迹以对齐所有分心物位置后,对每个试次上最大SHAP值的空间分布进行了可视化。具体而言,在验证集的每个试次上,提取对应于最大SHAP值的眼动位置样本(即对每个试次水平分类最具信息量的样本)。然后,将每个搜索阵列的参考坐标系进行旋转,使分心物位置在所有试次中对齐于同一方位,并据此绘制了试次水平最大SHAP值的旋转后空间分布(图9A和B)。在此基础上,通过对这些旋转后的试次水平最大SHAP值进行高斯加权核密度估计(KDE),以量化空间重要性区域(图9C–F)。

图9.预测分心物的卷积神经网络特征重要性的空间模式。
尽管预测分心物的卷积神经网络在形成预测时受到目标位置的影响,但它们同样从经验驱动分心物对侧的眼动位置值中进行学习。图9C展示了Massa等人数据集的核密度估计(分心物位于右侧水平经线)。从图形上看,试次水平最大SHAP值似乎聚集在除分心物位置以外的每个潜在对象位置附近。单从这一模式来看,它可能表明卷积神经网络依赖于目标位置(目标可能出现在分心物以外的任何位置),通过使用朝向目标的注意信号排除该位置,并从其余五个位置中进行随机猜测,从而形成约20%的预测准确率。然而,当仅针对卷积神经网络正确预测分心物位置的试次重复此分析时(图9E),出现了不同的模式:试次水平的最大SHAP值显著集中于分心物对侧的极角。这一结果同样适用于在Grubb与Li数据集中预测分心物位置的卷积神经网络(图9D,全部试次;图9F,正确预测试次;分心物位于上方垂直经线)。这组发现表明,虽然网络受到朝向目标的注意眼动信号的影响,但它们也检测到并习得了经验驱动分心物对注视所产生的排斥效应。
为了进一步表征经验驱动注意所对应的眼动信号,有必要将卷积神经网络真正利用该信号的试次与网络排除目标位置且恰好猜对的试次区分开来。一种方法是使用卷积神经网络预测正确且首次眼跳未落在目标位置“区块”的试次子集重复上述分析。施加这一额外约束,目标位置的眼动信号更有可能被移除,因为对目标预测卷积神经网络的SHAP分析(以及一般直觉)表明,该信号主要源于反应执行前朝向目标的眼跳。然而,从先前使用的正确预测试次子集中进一步剔除首次眼跳朝向目标的试次,可能带来统计检验效力不足的风险。值得庆幸的是,本研究的迁移学习演示使用了整个Doyle等人数据集,且无需进行额外的网络训练,这意味着用于生成预测的习得权重(涉及SHAP值的计算)在两个网络之间共享。因此,针对Doyle等人数据集进行的SHAP分析,实质上可视为对基于Massa等人数据集训练的卷积神经网络所执行的一次更高统计效力的特征可视化。通过从Doyle等人的数据中筛选出同时满足卷积神经网络预测正确且首次眼跳未朝向目标的试次,会得到一个具有足够统计功效的子集。基于该子集进行SHAP分析,能够显著提高分离出经验驱动注意所对应眼动信号的可能性。
对检验效力更高的Doyle等人数据集进行的空间SHAP分析发现,最具信息量的眼动位置值位于分心物相同和相反的极角,且前者在时间上早于后者。本研究从Doyle等人的数据集中分离出卷积神经网络预测正确且首次眼跳未朝向目标的试次,并在该子集上重复了空间SHAP分析(图10A、B)。如核密度估计结果所示(图10B),最大SHAP值显著集中于分心物位置及其对侧位置。图10C以直方图形式展示了不同极角下试次水平最大SHAP值的分布,并以颜色编码标示了各区间内样本的平均试次水平时间点。该图清晰地揭示出,位于分心物附近的最大SHAP值在时间上早于分心物对侧的最大SHAP值。这一模式表明,卷积神经网络习得了朝向经验驱动分心物的反射性注意分配,以及随后注视点离开分心物位置的纠正性转移。

图10.更高检验效力数据集中的时空SHAP分析。
结论
视觉搜索任务中眼动数据的传统分析依赖于简化指标或启发式方法,以确保数据的可处理性。本研究开发了一种基于卷积神经网络的分析方法,该方法能够充分挖掘眼动时程数据所蕴含的复杂而丰富的信息,从整个时程中实现自主学习。对于视觉搜索领域的研究者而言,基于卷积神经网络的方法为眼动数据分析提供了一种有价值的补充选项。卷积神经网络能够直接从时程眼动位置数据中分类搜索对象的位置,其分类准确率可作为因变量,并且适用于多种统计分析。这些网络能够在相同的眼动数据中检测多种形式的注意过程,无论其是任务相关还是任务无关。此外,在一个眼动数据集上训练所得的网络,可成功泛化至来自不同研究的眼动数据集,这表明存在跨研究共享的反射性外显注意眼动特征。借助特征可视化技术,本研究方法能够精细刻画构成该特征的时空模式,其中包含了许多被传统眼动启发式方法所忽略的注视行为维度。最后,本方法保留了时程记录固有的时空复杂性,并将分析过程中对数据排除与汇总指标的需求降至最低限度。因此,利用卷积神经网络对目标位置或其他实验刺激进行分类,将为寻求视觉搜索眼动数据补充分析的研究者提供有力支撑。
参考文献:Crotty, N., Doyle, A., Volkova, K. et al. Deep learning and eye tracking: Convolutional neural networks provide converging evidence for experience-driven attention within visual search. Behav Res 58, 187 (2026). https://doi.org/10.3758/s13428-026-03057-2
更多推荐

所有评论(0)