语言评估通常以“答对了几题”收尾。然而,即使两个人得分相同,得出答案的过程也可能不同。答错的题目通常只是从分数中扣除,那一刻发生了什么并不会留下记录。
已有报告指出,正常压力脑积水患者在命名任务中存在困难。如果分析患者给出错误应答那一刻的眼动,能否捕捉到仅凭正确率看不到的语言加工特征?
下面来读一篇回答这一问题的论文。
- 标题:Language processing characteristics in normal pressure hydrocephalus: insights from eye-tracking analysis of incorrect responses
- 期刊:Frontiers in Aging Neuroscience
- 年份:2025
- DOI:10.3389/fnagi.2025.1527962
该论文以 CC BY 许可公开发表。本文中的表格摘取了 Kim et al. (2025) 表2、表3、表4中的部分数值并重新整理。
研究团队让正常压力脑积水(Normal Pressure Hydrocephalus, NPH)患者和健康老年人(Healthy Elderly, HE)看图说出名称,并在任务过程中用网络摄像头记录视线。该任务称为词汇提取任务(Lexical Retrieval Task, LRT)。与一般的命名测验不同,LRT 只对第一个反应计分。即使起初答错、随后自行纠正为正确答案,也按错误处理。
本文使用的核心术语如下。
- 眼动追踪(eye-tracking):记录被试注视屏幕何处、注视多久的方法。
- 注视(fixation):视线在一个位置停留 70 ms 以上的状态。
- 眼跳(saccade):两次注视之间视线快速移动的运动。本论文将移动速度超过 30°/s 的运动归为眼跳。
- 正确应答与错误应答:第一个反应正确即为正确应答。无应答、错误回答和自我纠正的回答都属于错误应答。
动机:仅凭正确率看不到 NPH 患者的命名过程
为什么 NPH 的语言加工很重要
论文列出了需要关注 NPH 语言问题的以下理由。
- NPH 是可逆性痴呆之一,早期发现可使症状得到改善。
- NPH 中脑脊液循环受阻,导致脑室扩大。扩大的脑室压迫枕叶、颞叶、额叶和海马,可能因此削弱视知觉、词汇通达、语音编码和语义记忆加工。
- Chung (2018) 回顾了 529 名接受分流手术的 NPH 患者的病历,其中 23.1% 存在语言障碍。在有语言障碍的患者中,约 75% 存在表达性语言缺陷,尤其是物体命名缺陷。
- NPH 与帕金森病(Parkinson’s disease, PD)的主要症状有重叠,因此需要对二者进行鉴别诊断。
物体命名要经过多个阶段:视觉识别、语义加工、词汇通达、语音加工依次进行。神经认知障碍患者往往在词汇、语义和视知觉方面减弱,因而常常出现命名困难。
既往研究未涉及的部分
NPH 患者的命名结果在不同研究中并不一致。在 Kim et al. (2024) 中,NPH 组和 PD 组的命名表现显著差于正常老年人。NPH 组反应也更慢,语义错误和非词错误也更多。相反,Saito et al. (2011) 在特发性 NPH、阿尔茨海默病(Alzheimer’s disease, AD)和正常老年人之间没有发现显著差异。
也有眼动追踪研究。Lehtola et al. (2022) 在快速读出数字的 King-Devick 测验中比较了特发性 NPH、AD 和正常老年人,NPH 组和 AD 组的眼跳幅度都小于正常老年人。Ungrady et al. (2019) 让原发性进行性失语(primary progressive aphasia, PPA)和 AD 患者对 200 张图片进行命名,并同时分析了正确与错误应答。
论文指出的空白如下。
- 结果与过程的区分:有观点认为,NPH 的语言缺陷源于更广泛的认知损害,而非语言系统本身。若如此,困难在加工过程中可能比在最终分数中表现得更明显。既往研究结果不一致,也可能源于任务差异。
- NPH 眼动研究的不足:针对 NPH 的眼动追踪研究很少。
- 以正确应答为主的分析:既往研究主要关注正确应答的数量差异,对正确与错误应答的眼动模式进行质性比较的研究很少。
方法:只对第一个反应计分,并分别比较正确与错误应答的视线
论文的研究目标是组间比较、分数与指标的关系、按正确与错误应答的比较以及视线可视化。本文先介绍被试,再将方法分为五个步骤加以整理。
资料与被试
被试共 26 名。NPH 组为 65 岁以上患者 14 名,HE 组为 12 名。
NPH 组的纳入标准如下。
- 症状隐匿起病。
- 症状持续 3~6 个月以上。
- 没有其他可解释症状或影像学表现的疾病。
- 脑室扩大。
- 存在步态障碍、认知障碍和排尿障碍。
- 脑脊液压力不超过诊断标准范围(70–245 mmH2O)。
- 尚未接受分流手术。
NPH 被试由神经外科医生和神经内科医生协商一致后选定。HE 组选取无感觉、神经及躯体障碍,且韩国版简易精神状态检查第2版(Korean Mini-Mental State Examination-2, K-MMSE2)得分在第16百分位数以上的人。
| 项目 | NPH 组 | HE 组 | 组间差异 |
|---|---|---|---|
| 平均年龄(岁) | 79.14 | 76.33 | p = 0.078 |
| 平均受教育年限(年) | 7.00 | 10.08 | p = 0.126 |
| K-MMSE2 得分 | 19.93 | 26.58 | p = 0.001 |
来源:论文第2.1节
两组在年龄、性别和受教育年限上没有显著差异,只有 K-MMSE2 得分差异显著。
第1步:词汇提取任务的设计与计分
- 输入:Kim et al. (2024) 编制的词表
- 处理:匹配频率、音节数和语义类别,确定 30 个词,只对第一个反应计分
- 输出:每名被试的 LRT 得分、每题的正误标记、错误类型
- 划分词频。按照 Jo (2002) 的标准,频率低于 15 为低频,15 及以上为高频。结果纳入高频词 13 个、低频词 17 个。
- 匹配音节数。2音节 5 个、3音节 13 个、4音节 11 个、5音节 1 个。为提高任务难度,加大了3音节和4音节词的比重。
- 将语义类别分为 15 类并均衡安排,如陆地动物、昆虫、水果、交通工具、乐器、花、工具、鸟等。
- 只对第一个反应计分。即使无应答也不给提示。
- 对错误应答分类。按照 Dell et al. (1997),分为语义错误、形式错误、混合错误、无关错误和非词错误。这些资料用于辅助解释的补充分析。
研究团队这样选词是为了诱发错误。同一语义类别中相似的词越多,越容易在语义层面选错词;语音越复杂,越容易在提取阶段出错。
第2步:视线记录与预处理
- 输入:任务中记录的视线坐标和时间信息
- 处理:校准、注视与眼跳分类、剔除兴趣区以外的数据
- 输出:兴趣区内的注视列表和眼跳列表
- 布置设备。被试距显示器 55 cm、距麦克风 30 cm。显示器为 Dell E2422HS(1,920 × 1,080 像素),摄像头为每秒 30 帧的 Pengca Webcam 1080p。眼动追踪软件使用 VisualCamp 的 SeeSo,实际采样率约为 28.43 Hz。
- 进行五点校准。被试依次注视屏幕中央和四角的点。只有五个点的视线都在 5 秒内保持在 1.7° 以内,才进入任务。只要有一个点失败,就从头重新校准。
- 分类注视与眼跳。停留 70 ms 以上的视线为注视,超过 30°/s 的移动为眼跳。
- 整理注视段坐标。将一次注视内的所有坐标替换为该注视的第一个坐标。被归为眼跳的中间坐标不纳入分析。
- 确定兴趣区(Area of Interest, AOI)。只分析屏幕中央显示图片的 1,483 × 707 像素区域。为只保留加工图片的视线,该区域以外的视线全部剔除。
第3步:计算眼动指标
- 输入:第2步得到的注视列表和眼跳列表
- 处理:逐题计算六项指标
- 输出:各被试、各应答类型的指标值
研究团队使用的六项指标如下。
| 指标 | 含义 | 单位 |
|---|---|---|
| 注视时间(FD) | 注视时间之和 | ms |
| 注视次数(FC) | 发生注视的次数 | 次 |
| 眼跳次数(SC) | 发生眼跳的次数 | 次 |
| 眼跳时间(SD) | 眼跳时间之和 | ms |
| 眼跳路径总长(SST) | 眼跳移动距离之和 | 像素 |
| 眼跳幅度总和(SAT) | 眼跳角度变化之和 | 度 |
来源:根据 Kim et al. (2025) 表1和表2重新整理(CC BY)
各指标的计算方式如下。
- FD(Fixation Duration):将每次注视的结束时刻减去开始时刻,再全部相加。只纳入 70 ms 以上的注视。
- SD(Saccade Duration):将每次眼跳的结束时刻减去开始时刻,再相加。
- SST(Saccade Scanpath Total):将眼跳起点与终点之间的直线距离全部相加。
- SAT(Saccade Amplitude Total):用眼跳的纵向变化除以横向变化,对所得值取反正切求出角度,再将角度相加。
论文将时间和频次指标与认知加工联系起来,将空间指标与视知觉能力联系起来。因此,NPH 组若在时间和频次上存在差异,就解释为认知加工异常;若空间指标存在差异,则解释为视知觉缺陷。
第4步:统计分析
- 输入:各被试的 LRT 得分和眼动指标
- 处理:组间比较、相关分析、组别 × 应答类型分析
- 输出:检验统计量和 p 值
- 组间比较:由于数据不满足正态性假设,采用 Mann–Whitney U 检验比较两组的 LRT 得分和眼动指标。
- 相关分析:计算 LRT 得分与各眼动指标之间的 Pearson 相关。
- 应答类型分析:以组别(NPH、HE)和应答类型(正确、错误)为两个因素,进行双因素混合方差分析(two-way mixed ANOVA)。事后比较采用 Bonferroni 校正。
- 检验效能确认:用 G*Power 3.1 计算事后统计检验力。
组别是每个人只属于其中一组的组间因素,应答类型则是同一个人身上正确与错误应答都会出现的组内因素。混合方差分析同时检验两个主效应和交互作用。
第5步:可视化与网格分析
- 输入:正确率高的两道题和错误率高的两道题的注视数据
- 处理:比较热图和扫视路径,计算 10 × 10 网格指标
- 输出:各题、各组的网格指标
研究团队选取正确率超过 90% 的“摩托车”和“茄子”作为正确题目,选取两组错误率均超过 60% 的“木琴”和“自动扶梯”作为错误题目,比较了这四道题的热图(heatmap,用颜色表示视线停留较多之处的图)和扫视路径(scanpath,视线经过的路径)。
为了用数值验证质性比较,研究团队把图片划分为 10 × 10 网格,即 100 个单元格,并计算了以下五项指标。
- 网格熵(grid entropy):反映注视在各单元格中分布的均匀程度。值越大,视线分布越分散。
- 空间离散度(spatial dispersion):相邻两次注视之间的平均直线距离。
- 网格占有率(grid occupancy):至少出现过一次注视的单元格所占比例(0–1)。
- 转移密度(transition density):在所有可能的单元格间移动中,实际出现的不同移动所占比例。
- 最近邻指数(Nearest Neighbor Index, NNI):小于 1 表示注视聚集,大于 1 表示注视分散。
举一个网格占有率的计算例子。在木琴题中,NPH 组的占有率为 0.72。共有 100 个单元格,因此表示有 0.72×100=72个单元格出现了注视。HE 组为 0.59,即 0.59×100=59个单元格。
结果:NPH 组的视线差异在错误应答时表现得更明显
词汇提取得分:NPH 组明显偏低
LRT 平均分 NPH 组为 52.14 分(SD = 16.88),HE 组为 84.17 分(SD = 7.26),差异显著(U = 2.500,p = 0.000)。事后统计检验力超过 90%。作者认为应将这一得分差异与眼动结果结合起来解释。
整体眼动指标:六项指标 NPH 组均更大
合并所有应答比较两组,六项指标均存在显著差异。
| 指标 | NPH 平均 | HE 平均 | p |
|---|---|---|---|
| 注视次数(FC) | 22.63 | 12.31 | 0.001 |
| 注视时间(FD, ms) | 6139.76 | 3263.67 | 0.001 |
| 眼跳次数(SC) | 21.65 | 11.31 | 0.001 |
| 眼跳时间(SD, ms) | 4143.48 | 2018.58 | 0.000 |
| 眼跳路径(SST, 像素) | 6064.02 | 2617.30 | 0.000 |
| 眼跳幅度(SAT, 度) | 666.74 | 311.28 | 0.000 |
来源:仅摘取 Kim et al. (2025) 表2中的平均值和 p 值重新整理(CC BY)
作者这样解释结果:注视时间长,可能意味着将注意转向别处的能力较弱;注视次数多,说明浏览图片的效率较低;眼跳时间长、次数多,则可能是将视觉信息分成碎片加工。
作者将其原因归于脑结构受压。额叶参与注意转换,基底节参与眼球运动调控。扩大的脑室压迫这些结构时,视觉信息加工会减弱,也可能影响词汇提取。
解读这一结果时需要同时考虑两组认知水平的差异。作者认为,NPH 组的认知功能显著低于 HE 组,但并非重度(讨论部分记为 K-MMSE = 20.33)。第2.1节中的 K-MMSE2 平均分为 NPH 19.93、HE 26.58(p = 0.001)。因此笔者判断,眼动指标的差异究竟是 NPH 特有的特征,还是源于整体认知水平的差异,这一设计无法区分。受教育年限平均为 7.00 年和 10.08 年,也存在差异(不显著)。
得分与眼动指标:呈负相关
LRT 得分与六项指标均呈负相关。
- FC:r = −0.569 (p = 0.002)
- FD:r = −0.566 (p = 0.003)
- SC:r = −0.569 (p = 0.002)
- SD:r = −0.554 (p = 0.003)
- SST:r = −0.488 (p = 0.011)
- SAT:r = −0.462 (p = 0.017)
眼动指标值越大的被试,命名得分往往越低。这一结果是相关关系,并未证明眼动导致得分降低的因果关系。作者在讨论部分指出系数主要在 0.400.60 范围内,解释为中等程度的相关。摘要中则写的是系数大多在 0.50 以上,原文内部表述不一致。实际 r 为 −0.462−0.569。事后统计检验力大多超过 80%,但 SAT 为 74% 以上,SST 为 68% 以上,相对较低。对这两项空间指标的相关需要更谨慎地解释。
正确与错误应答:两组在错误应答中指标都增大
各应答类型的平均值如下。
| 指标 | 组别 | 正确 | 错误 |
|---|---|---|---|
| FC | NPH | 14.05 | 34.23 |
| FC | HE | 9.94 | 22.26 |
| FD(ms) | NPH | 3925.58 | 9216.46 |
| FD(ms) | HE | 2634.16 | 5663.05 |
| SD(ms) | NPH | 2249.65 | 6425.71 |
| SD(ms) | HE | 1658.81 | 4152.57 |
| SST(像素) | NPH | 3599.13 | 9484.76 |
| SST(像素) | HE | 2076.57 | 5236.22 |
来源:仅摘取 Kim et al. (2025) 表3中四项指标的平均值重新整理(CC BY)
在双因素混合方差分析中,组别主效应在六项指标上均显著。例如,SD 为 F[1,24] = 13.600(p = 0.001),FD 为 F[1,24] = 8.281(p = 0.008)。应答类型的主效应也全部显著。SD 为 F[1,24] = 94.014,FC 为 F[1,24] = 60.922(均为 p = 0.000)。这说明两组在错误应答中眼动指标都增大。
组别 × 应答类型交互作用仅在 SD 上显著(F[1,24] = 5.981,p = 0.022)。这意味着从正确应答到错误应答时,眼跳时间的增加幅度在 NPH 组更大。计算增加幅度,NPH 组为 6425.71−2249.65=4176.06 ms,HE 组为 4152.57−1658.81=2493.76 ms。按倍数计算,NPH 组为 6425.71÷2249.65≈2.86倍,HE 组为 4152.57÷1658.81≈2.50倍。
对错误类型的补充分析显示,NPH 组中语义错误(例:老虎 → 狮子)最多。正文未给出各错误类型的具体数值。作者据此推论,从物体识别开始的视觉加工缺陷可能阻碍语义层面的词汇提取。这一推论是作者基于未给出数值的补充分析提出的假设。
可视化与网格分析:正确题目中两组的值接近
在热图中,HE 组无论正确题目还是错误题目都注视图片中央。NPH 组在错误题目中视线向边缘分散,这一差异在自动扶梯图片上最明显。
| 题目(应答) | 组别 | 空间离散度 | 网格占有率 |
|---|---|---|---|
| 木琴(错误) | NPH | 5.20 | 0.72 |
| 木琴(错误) | HE | 2.20 | 0.59 |
| 自动扶梯(错误) | NPH | 4.30 | 0.60 |
| 自动扶梯(错误) | HE | 1.35 | 0.38 |
| 摩托车(正确) | NPH | 1.88 | 0.40 |
| 摩托车(正确) | HE | 1.77 | 0.39 |
| 茄子(正确) | NPH | 1.66 | 0.33 |
| 茄子(正确) | HE | 1.51 | 0.29 |
来源:仅摘取 Kim et al. (2025) 表4中的两项指标重新整理(CC BY)
在错误题目中,NPH 组的空间离散度大于 HE 组;在正确题目中,两组的值接近。不过,正文表4只给出了四道题的组水平数值,没有给出检验统计量(详见附录5)。网格熵也呈现类似趋势:错误题目木琴为 5.58 和 5.45,正确题目摩托车为 4.95 和 4.86。
扫视路径也显示出差异。HE 组在错误题目中路径变得复杂。NPH 组在正确题目中路径就已经较为多样,在错误题目中则更加复杂。也有例外:患者 P04 答错木琴时,路径却非常简单。这类被试在 NPH 组内的命名成绩也偏低。作者解释说,错误应答中出现的简单路径反映的可能不是高效,而是“不活跃”的加工。
意义与局限
带来了什么变化
- 错误应答的分析:没有舍弃错误应答,而是将其作为眼动数据加以分析。组别 × 应答类型交互作用在 SD 上显著,四道题的描述性比较也显示,错误题目中的组间差异更大。
- 严格计分:只对第一个反应计分,自我纠正也按错误处理。针对的不是最终是否成功,而是提取过程中的缺陷。
- 量化:用五项网格指标将热图的质性印象数值化。
- 与其他疾病的对照:作者在讨论部分写道,Ungrady et al. (2019) 中的 PD、PPA 患者在错误应答时注视次数较少,而本论文的 NPH 组在错误应答时注视更多。作者将这一差异区分为 PD 的“注视本身”的困难与 NPH 的“注视低效”,并提出可作为鉴别诊断的候选指标。不过,同一研究的比较对象在引言中写作 PPA 和 AD,在讨论部分写作 PD 和 PPA,原文内部表述不一致。
对实践者的用处
作者在结论中提出的建议如下。
- 评估题目:评估 NPH 患者的词汇提取缺陷时,使用多音节低频词。
- 辅助指标:由于得分与眼动指标存在相关,作者提出视线效率分析有可能成为更敏感的指标。不过,本研究并未进行敏感性比较。可将其视为值得作为辅助指标加以探索的方向。
- 分阶段干预:对于命名困难且眼动模式不典型的患者,在以准确命名为目标之前,先设置简化眼动模式的中间阶段。
- 促进探索:作者认为,答错同时视线路径过于简单的患者可能是缺陷最严重的情况。对这类患者,作者建议在提取训练之前采用视觉搜索策略可能有所帮助。这一解释是从 P04 等个案观察中得出的假设,干预效果在本研究中并未得到验证。
对研究者的用处
本论文提供了一种将“结果”与“过程”分开考察的设计。把正确与错误应答设为组内因素,就可以通过交互作用检验组间差异在哪种条件下变大。
研究团队没有使用专用设备,而是用网络摄像头、笔记本电脑和商用软件记录视线。本研究将时间和频次指标与认知加工相联系,将空间指标与视知觉相联系来进行解释。论文强调,应结合任务和情境来解释眼动模式。这一解释框架能否用于其他疾病,值得结合任务和情境加以考察(笔者意见)。
论文自述的局限
论文自述的局限有三点。
- 样本量:样本较小,需要用更大的群体提高结果的可靠性。
- 对照组:需要开展将 NPH 与难以鉴别诊断的 PD、AD 组进行比较的研究。
- 术后变化:NPH 在手术后可能好转,因此需要追踪术后词汇提取和视觉加工的变化。
笔者看到的适用条件
以下并非论文中的内容,而是笔者补充的条件。认知水平差异的影响已在前面的结果部分讨论。
- 视线记录的精度:基于网络摄像头的记录精度约为 1.7°,采样率约为 28.43 Hz。对于需要精细区分短眼跳的用途,同样的条件可能并不适用。
- 可视化范围:可视化和网格分析只是四道题的组水平数值,且未给出检验统计量,难以直接用作个体诊断标准。
- 解释的依据:作者将 SD 交互作用解释为两组在正确应答中的 SD 没有差异。但描述统计中正确应答的 SD 为 2249.65 ms 和 1658.81 ms,相应的事后比较数值正文中并未给出。
- 数值核对:正文与表格中有部分数值不一致。K-MMSE2 平均分在第2.1节为 19.93,在讨论部分为 20.33。SD 的 U 值在正文中为 20.000,在表2中为 10.000。引用时请直接核对原文。
可以马上尝试的事
- 只对第一个反应重新计分。在已有的命名记录中,将无应答和自我纠正重新归为错误应答。把原有得分与新得分并列,查看哪些被试的排名发生了变化。
- 分别计算正确与错误应答的平均值。如果有视线记录,按组别对每种应答类型分别计算 FC、FD、SC、SD 的平均值。按组计算两种应答类型之间的增加幅度,就能在交互作用分析之前先确认趋势。
- 计算网格占有率。各选一道正确率高和正确率低的题目,将图片划分为 10 × 10 网格,按组计算至少出现过一次注视的单元格所占比例。