正常压力脑积水:解读错误应答时的视线

正常压力脑积水患者在图片命名中出错时的视线揭示了什么?本文阅读一篇网络摄像头眼动追踪论文,梳理在错误回答中扩大的组间差异以及解读上的局限。

本文译自韩文原文。 韩文原文

语言评估通常以“答对了几题”收尾。然而,即使两个人得分相同,得出答案的过程也可能不同。答错的题目通常只是从分数中扣除,那一刻发生了什么并不会留下记录。

已有报告指出,正常压力脑积水患者在命名任务中存在困难。如果分析患者给出错误应答那一刻的眼动,能否捕捉到仅凭正确率看不到的语言加工特征?

下面来读一篇回答这一问题的论文。

  • 标题:Language processing characteristics in normal pressure hydrocephalus: insights from eye-tracking analysis of incorrect responses
  • 期刊:Frontiers in Aging Neuroscience
  • 年份:2025
  • DOI:10.3389/fnagi.2025.1527962

该论文以 CC BY 许可公开发表。本文中的表格摘取了 Kim et al. (2025) 表2、表3、表4中的部分数值并重新整理。

研究团队让正常压力脑积水(Normal Pressure Hydrocephalus, NPH)患者和健康老年人(Healthy Elderly, HE)看图说出名称,并在任务过程中用网络摄像头记录视线。该任务称为词汇提取任务(Lexical Retrieval Task, LRT)。与一般的命名测验不同,LRT 只对第一个反应计分。即使起初答错、随后自行纠正为正确答案,也按错误处理。

本文使用的核心术语如下。

  • 眼动追踪(eye-tracking):记录被试注视屏幕何处、注视多久的方法。
  • 注视(fixation):视线在一个位置停留 70 ms 以上的状态。
  • 眼跳(saccade):两次注视之间视线快速移动的运动。本论文将移动速度超过 30°/s 的运动归为眼跳。
  • 正确应答与错误应答:第一个反应正确即为正确应答。无应答、错误回答和自我纠正的回答都属于错误应答。

动机:仅凭正确率看不到 NPH 患者的命名过程

为什么 NPH 的语言加工很重要

论文列出了需要关注 NPH 语言问题的以下理由。

  • NPH 是可逆性痴呆之一,早期发现可使症状得到改善。
  • NPH 中脑脊液循环受阻,导致脑室扩大。扩大的脑室压迫枕叶、颞叶、额叶和海马,可能因此削弱视知觉、词汇通达、语音编码和语义记忆加工。
  • Chung (2018) 回顾了 529 名接受分流手术的 NPH 患者的病历,其中 23.1% 存在语言障碍。在有语言障碍的患者中,约 75% 存在表达性语言缺陷,尤其是物体命名缺陷。
  • NPH 与帕金森病(Parkinson’s disease, PD)的主要症状有重叠,因此需要对二者进行鉴别诊断。

物体命名要经过多个阶段:视觉识别、语义加工、词汇通达、语音加工依次进行。神经认知障碍患者往往在词汇、语义和视知觉方面减弱,因而常常出现命名困难。

既往研究未涉及的部分

NPH 患者的命名结果在不同研究中并不一致。在 Kim et al. (2024) 中,NPH 组和 PD 组的命名表现显著差于正常老年人。NPH 组反应也更慢,语义错误和非词错误也更多。相反,Saito et al. (2011) 在特发性 NPH、阿尔茨海默病(Alzheimer’s disease, AD)和正常老年人之间没有发现显著差异。

也有眼动追踪研究。Lehtola et al. (2022) 在快速读出数字的 King-Devick 测验中比较了特发性 NPH、AD 和正常老年人,NPH 组和 AD 组的眼跳幅度都小于正常老年人。Ungrady et al. (2019) 让原发性进行性失语(primary progressive aphasia, PPA)和 AD 患者对 200 张图片进行命名,并同时分析了正确与错误应答。

论文指出的空白如下。

  • 结果与过程的区分:有观点认为,NPH 的语言缺陷源于更广泛的认知损害,而非语言系统本身。若如此,困难在加工过程中可能比在最终分数中表现得更明显。既往研究结果不一致,也可能源于任务差异。
  • NPH 眼动研究的不足:针对 NPH 的眼动追踪研究很少。
  • 以正确应答为主的分析:既往研究主要关注正确应答的数量差异,对正确与错误应答的眼动模式进行质性比较的研究很少。

方法:只对第一个反应计分,并分别比较正确与错误应答的视线

论文的研究目标是组间比较、分数与指标的关系、按正确与错误应答的比较以及视线可视化。本文先介绍被试,再将方法分为五个步骤加以整理。

图 1. 从任务设计到网格分析,分别比较正确与错误应答视线的五步流程。

资料与被试

被试共 26 名。NPH 组为 65 岁以上患者 14 名,HE 组为 12 名。

NPH 组的纳入标准如下。

  • 症状隐匿起病。
  • 症状持续 3~6 个月以上。
  • 没有其他可解释症状或影像学表现的疾病。
  • 脑室扩大。
  • 存在步态障碍、认知障碍和排尿障碍。
  • 脑脊液压力不超过诊断标准范围(70–245 mmH2O)。
  • 尚未接受分流手术。

NPH 被试由神经外科医生和神经内科医生协商一致后选定。HE 组选取无感觉、神经及躯体障碍,且韩国版简易精神状态检查第2版(Korean Mini-Mental State Examination-2, K-MMSE2)得分在第16百分位数以上的人。

项目NPH 组HE 组组间差异
平均年龄(岁)79.1476.33p = 0.078
平均受教育年限(年)7.0010.08p = 0.126
K-MMSE2 得分19.9326.58p = 0.001

来源:论文第2.1节

两组在年龄、性别和受教育年限上没有显著差异,只有 K-MMSE2 得分差异显著。

第1步:词汇提取任务的设计与计分

  • 输入:Kim et al. (2024) 编制的词表
  • 处理:匹配频率、音节数和语义类别,确定 30 个词,只对第一个反应计分
  • 输出:每名被试的 LRT 得分、每题的正误标记、错误类型
  1. 划分词频。按照 Jo (2002) 的标准,频率低于 15 为低频,15 及以上为高频。结果纳入高频词 13 个、低频词 17 个。
  2. 匹配音节数。2音节 5 个、3音节 13 个、4音节 11 个、5音节 1 个。为提高任务难度,加大了3音节和4音节词的比重。
  3. 将语义类别分为 15 类并均衡安排,如陆地动物、昆虫、水果、交通工具、乐器、花、工具、鸟等。
  4. 只对第一个反应计分。即使无应答也不给提示。
  5. 对错误应答分类。按照 Dell et al. (1997),分为语义错误、形式错误、混合错误、无关错误和非词错误。这些资料用于辅助解释的补充分析。

研究团队这样选词是为了诱发错误。同一语义类别中相似的词越多,越容易在语义层面选错词;语音越复杂,越容易在提取阶段出错。

第2步:视线记录与预处理

  • 输入:任务中记录的视线坐标和时间信息
  • 处理:校准、注视与眼跳分类、剔除兴趣区以外的数据
  • 输出:兴趣区内的注视列表和眼跳列表
  1. 布置设备。被试距显示器 55 cm、距麦克风 30 cm。显示器为 Dell E2422HS(1,920 × 1,080 像素),摄像头为每秒 30 帧的 Pengca Webcam 1080p。眼动追踪软件使用 VisualCamp 的 SeeSo,实际采样率约为 28.43 Hz。
  2. 进行五点校准。被试依次注视屏幕中央和四角的点。只有五个点的视线都在 5 秒内保持在 1.7° 以内,才进入任务。只要有一个点失败,就从头重新校准。
  3. 分类注视与眼跳。停留 70 ms 以上的视线为注视,超过 30°/s 的移动为眼跳。
  4. 整理注视段坐标。将一次注视内的所有坐标替换为该注视的第一个坐标。被归为眼跳的中间坐标不纳入分析。
  5. 确定兴趣区(Area of Interest, AOI)。只分析屏幕中央显示图片的 1,483 × 707 像素区域。为只保留加工图片的视线,该区域以外的视线全部剔除。

第3步:计算眼动指标

  • 输入:第2步得到的注视列表和眼跳列表
  • 处理:逐题计算六项指标
  • 输出:各被试、各应答类型的指标值

研究团队使用的六项指标如下。

指标含义单位
注视时间(FD)注视时间之和ms
注视次数(FC)发生注视的次数次
眼跳次数(SC)发生眼跳的次数次
眼跳时间(SD)眼跳时间之和ms
眼跳路径总长(SST)眼跳移动距离之和像素
眼跳幅度总和(SAT)眼跳角度变化之和度

来源:根据 Kim et al. (2025) 表1和表2重新整理(CC BY)

各指标的计算方式如下。

  • FD(Fixation Duration):将每次注视的结束时刻减去开始时刻,再全部相加。只纳入 70 ms 以上的注视。
  • SD(Saccade Duration):将每次眼跳的结束时刻减去开始时刻,再相加。
  • SST(Saccade Scanpath Total):将眼跳起点与终点之间的直线距离全部相加。
  • SAT(Saccade Amplitude Total):用眼跳的纵向变化除以横向变化,对所得值取反正切求出角度,再将角度相加。

论文将时间和频次指标与认知加工联系起来,将空间指标与视知觉能力联系起来。因此,NPH 组若在时间和频次上存在差异,就解释为认知加工异常;若空间指标存在差异,则解释为视知觉缺陷。

第4步:统计分析

  • 输入:各被试的 LRT 得分和眼动指标
  • 处理:组间比较、相关分析、组别 × 应答类型分析
  • 输出:检验统计量和 p 值
  1. 组间比较:由于数据不满足正态性假设,采用 Mann–Whitney U 检验比较两组的 LRT 得分和眼动指标。
  2. 相关分析:计算 LRT 得分与各眼动指标之间的 Pearson 相关。
  3. 应答类型分析:以组别(NPH、HE)和应答类型(正确、错误)为两个因素,进行双因素混合方差分析(two-way mixed ANOVA)。事后比较采用 Bonferroni 校正。
  4. 检验效能确认:用 G*Power 3.1 计算事后统计检验力。

组别是每个人只属于其中一组的组间因素,应答类型则是同一个人身上正确与错误应答都会出现的组内因素。混合方差分析同时检验两个主效应和交互作用。

第5步:可视化与网格分析

  • 输入:正确率高的两道题和错误率高的两道题的注视数据
  • 处理:比较热图和扫视路径,计算 10 × 10 网格指标
  • 输出:各题、各组的网格指标

研究团队选取正确率超过 90% 的“摩托车”和“茄子”作为正确题目,选取两组错误率均超过 60% 的“木琴”和“自动扶梯”作为错误题目,比较了这四道题的热图(heatmap,用颜色表示视线停留较多之处的图)和扫视路径(scanpath,视线经过的路径)。

为了用数值验证质性比较,研究团队把图片划分为 10 × 10 网格,即 100 个单元格,并计算了以下五项指标。

  • 网格熵(grid entropy):反映注视在各单元格中分布的均匀程度。值越大,视线分布越分散。
  • 空间离散度(spatial dispersion):相邻两次注视之间的平均直线距离。
  • 网格占有率(grid occupancy):至少出现过一次注视的单元格所占比例(0–1)。
  • 转移密度(transition density):在所有可能的单元格间移动中,实际出现的不同移动所占比例。
  • 最近邻指数(Nearest Neighbor Index, NNI):小于 1 表示注视聚集,大于 1 表示注视分散。

举一个网格占有率的计算例子。在木琴题中,NPH 组的占有率为 0.72。共有 100 个单元格,因此表示有 0.72×100=72个单元格出现了注视。HE 组为 0.59,即 0.59×100=59个单元格。

结果:NPH 组的视线差异在错误应答时表现得更明显

词汇提取得分:NPH 组明显偏低

LRT 平均分 NPH 组为 52.14 分(SD = 16.88),HE 组为 84.17 分(SD = 7.26),差异显著(U = 2.500,p = 0.000)。事后统计检验力超过 90%。作者认为应将这一得分差异与眼动结果结合起来解释。

整体眼动指标:六项指标 NPH 组均更大

合并所有应答比较两组,六项指标均存在显著差异。

指标NPH 平均HE 平均p
注视次数(FC)22.6312.310.001
注视时间(FD, ms)6139.763263.670.001
眼跳次数(SC)21.6511.310.001
眼跳时间(SD, ms)4143.482018.580.000
眼跳路径(SST, 像素)6064.022617.300.000
眼跳幅度(SAT, 度)666.74311.280.000

来源:仅摘取 Kim et al. (2025) 表2中的平均值和 p 值重新整理(CC BY)

作者这样解释结果:注视时间长,可能意味着将注意转向别处的能力较弱;注视次数多,说明浏览图片的效率较低;眼跳时间长、次数多,则可能是将视觉信息分成碎片加工。

作者将其原因归于脑结构受压。额叶参与注意转换,基底节参与眼球运动调控。扩大的脑室压迫这些结构时,视觉信息加工会减弱,也可能影响词汇提取。

解读这一结果时需要同时考虑两组认知水平的差异。作者认为,NPH 组的认知功能显著低于 HE 组,但并非重度(讨论部分记为 K-MMSE = 20.33)。第2.1节中的 K-MMSE2 平均分为 NPH 19.93、HE 26.58(p = 0.001)。因此笔者判断,眼动指标的差异究竟是 NPH 特有的特征,还是源于整体认知水平的差异,这一设计无法区分。受教育年限平均为 7.00 年和 10.08 年,也存在差异(不显著)。

得分与眼动指标:呈负相关

LRT 得分与六项指标均呈负相关。

  • FC:r = −0.569 (p = 0.002)
  • FD:r = −0.566 (p = 0.003)
  • SC:r = −0.569 (p = 0.002)
  • SD:r = −0.554 (p = 0.003)
  • SST:r = −0.488 (p = 0.011)
  • SAT:r = −0.462 (p = 0.017)

眼动指标值越大的被试,命名得分往往越低。这一结果是相关关系,并未证明眼动导致得分降低的因果关系。作者在讨论部分指出系数主要在 0.400.60 范围内,解释为中等程度的相关。摘要中则写的是系数大多在 0.50 以上,原文内部表述不一致。实际 r 为 −0.462−0.569。事后统计检验力大多超过 80%,但 SAT 为 74% 以上,SST 为 68% 以上,相对较低。对这两项空间指标的相关需要更谨慎地解释。

正确与错误应答:两组在错误应答中指标都增大

各应答类型的平均值如下。

图 2. 两组的眼跳时间在错误应答中都增加。NPH 组增加接近 3 倍,增加幅度大于 HE 组。
指标组别正确错误
FCNPH14.0534.23
FCHE9.9422.26
FD(ms)NPH3925.589216.46
FD(ms)HE2634.165663.05
SD(ms)NPH2249.656425.71
SD(ms)HE1658.814152.57
SST(像素)NPH3599.139484.76
SST(像素)HE2076.575236.22

来源:仅摘取 Kim et al. (2025) 表3中四项指标的平均值重新整理(CC BY)

在双因素混合方差分析中,组别主效应在六项指标上均显著。例如,SD 为 F[1,24] = 13.600(p = 0.001),FD 为 F[1,24] = 8.281(p = 0.008)。应答类型的主效应也全部显著。SD 为 F[1,24] = 94.014,FC 为 F[1,24] = 60.922(均为 p = 0.000)。这说明两组在错误应答中眼动指标都增大。

组别 × 应答类型交互作用仅在 SD 上显著(F[1,24] = 5.981,p = 0.022)。这意味着从正确应答到错误应答时,眼跳时间的增加幅度在 NPH 组更大。计算增加幅度,NPH 组为 6425.71−2249.65=4176.06 ms,HE 组为 4152.57−1658.81=2493.76 ms。按倍数计算,NPH 组为 6425.71÷2249.65≈2.86倍,HE 组为 4152.57÷1658.81≈2.50倍。

对错误类型的补充分析显示,NPH 组中语义错误(例:老虎 → 狮子)最多。正文未给出各错误类型的具体数值。作者据此推论,从物体识别开始的视觉加工缺陷可能阻碍语义层面的词汇提取。这一推论是作者基于未给出数值的补充分析提出的假设。

可视化与网格分析:正确题目中两组的值接近

在热图中,HE 组无论正确题目还是错误题目都注视图片中央。NPH 组在错误题目中视线向边缘分散,这一差异在自动扶梯图片上最明显。

题目(应答)组别空间离散度网格占有率
木琴(错误)NPH5.200.72
木琴(错误)HE2.200.59
自动扶梯(错误)NPH4.300.60
自动扶梯(错误)HE1.350.38
摩托车(正确)NPH1.880.40
摩托车(正确)HE1.770.39
茄子(正确)NPH1.660.33
茄子(正确)HE1.510.29

来源:仅摘取 Kim et al. (2025) 表4中的两项指标重新整理(CC BY)

在错误题目中,NPH 组的空间离散度大于 HE 组;在正确题目中,两组的值接近。不过,正文表4只给出了四道题的组水平数值,没有给出检验统计量(详见附录5)。网格熵也呈现类似趋势:错误题目木琴为 5.58 和 5.45,正确题目摩托车为 4.95 和 4.86。

扫视路径也显示出差异。HE 组在错误题目中路径变得复杂。NPH 组在正确题目中路径就已经较为多样,在错误题目中则更加复杂。也有例外:患者 P04 答错木琴时,路径却非常简单。这类被试在 NPH 组内的命名成绩也偏低。作者解释说,错误应答中出现的简单路径反映的可能不是高效,而是“不活跃”的加工。

意义与局限

带来了什么变化

  • 错误应答的分析:没有舍弃错误应答,而是将其作为眼动数据加以分析。组别 × 应答类型交互作用在 SD 上显著,四道题的描述性比较也显示,错误题目中的组间差异更大。
  • 严格计分:只对第一个反应计分,自我纠正也按错误处理。针对的不是最终是否成功,而是提取过程中的缺陷。
  • 量化:用五项网格指标将热图的质性印象数值化。
  • 与其他疾病的对照:作者在讨论部分写道,Ungrady et al. (2019) 中的 PD、PPA 患者在错误应答时注视次数较少,而本论文的 NPH 组在错误应答时注视更多。作者将这一差异区分为 PD 的“注视本身”的困难与 NPH 的“注视低效”,并提出可作为鉴别诊断的候选指标。不过,同一研究的比较对象在引言中写作 PPA 和 AD,在讨论部分写作 PD 和 PPA,原文内部表述不一致。

对实践者的用处

作者在结论中提出的建议如下。

  • 评估题目:评估 NPH 患者的词汇提取缺陷时,使用多音节低频词。
  • 辅助指标:由于得分与眼动指标存在相关,作者提出视线效率分析有可能成为更敏感的指标。不过,本研究并未进行敏感性比较。可将其视为值得作为辅助指标加以探索的方向。
  • 分阶段干预:对于命名困难且眼动模式不典型的患者,在以准确命名为目标之前,先设置简化眼动模式的中间阶段。
  • 促进探索:作者认为,答错同时视线路径过于简单的患者可能是缺陷最严重的情况。对这类患者,作者建议在提取训练之前采用视觉搜索策略可能有所帮助。这一解释是从 P04 等个案观察中得出的假设,干预效果在本研究中并未得到验证。

对研究者的用处

本论文提供了一种将“结果”与“过程”分开考察的设计。把正确与错误应答设为组内因素,就可以通过交互作用检验组间差异在哪种条件下变大。

研究团队没有使用专用设备,而是用网络摄像头、笔记本电脑和商用软件记录视线。本研究将时间和频次指标与认知加工相联系,将空间指标与视知觉相联系来进行解释。论文强调,应结合任务和情境来解释眼动模式。这一解释框架能否用于其他疾病,值得结合任务和情境加以考察(笔者意见)。

论文自述的局限

论文自述的局限有三点。

  • 样本量:样本较小,需要用更大的群体提高结果的可靠性。
  • 对照组:需要开展将 NPH 与难以鉴别诊断的 PD、AD 组进行比较的研究。
  • 术后变化:NPH 在手术后可能好转,因此需要追踪术后词汇提取和视觉加工的变化。

笔者看到的适用条件

以下并非论文中的内容,而是笔者补充的条件。认知水平差异的影响已在前面的结果部分讨论。

  • 视线记录的精度:基于网络摄像头的记录精度约为 1.7°,采样率约为 28.43 Hz。对于需要精细区分短眼跳的用途,同样的条件可能并不适用。
  • 可视化范围:可视化和网格分析只是四道题的组水平数值,且未给出检验统计量,难以直接用作个体诊断标准。
  • 解释的依据:作者将 SD 交互作用解释为两组在正确应答中的 SD 没有差异。但描述统计中正确应答的 SD 为 2249.65 ms 和 1658.81 ms,相应的事后比较数值正文中并未给出。
  • 数值核对:正文与表格中有部分数值不一致。K-MMSE2 平均分在第2.1节为 19.93,在讨论部分为 20.33。SD 的 U 值在正文中为 20.000,在表2中为 10.000。引用时请直接核对原文。

可以马上尝试的事

  • 只对第一个反应重新计分。在已有的命名记录中,将无应答和自我纠正重新归为错误应答。把原有得分与新得分并列,查看哪些被试的排名发生了变化。
  • 分别计算正确与错误应答的平均值。如果有视线记录,按组别对每种应答类型分别计算 FC、FD、SC、SD 的平均值。按组计算两种应答类型之间的增加幅度,就能在交互作用分析之前先确认趋势。
  • 计算网格占有率。各选一道正确率高和正确率低的题目,将图片划分为 10 × 10 网格,按组计算至少出现过一次注视的单元格所占比例。

关键词

相关文章