言語評価は通常、「いくつ正解したか」で終わります。しかし、同じ点数を取った二人でも、答えに至る過程は異なりえます。誤答した項目は多くの場合、点数から除かれ、その瞬間に何が起きていたのかは記録に残りません。
正常圧水頭症の患者は呼称に困難を示すという報告があります。誤答を出した瞬間の視線の動きを分析すれば、正答率だけでは見えない言語処理の特性をとらえられるのでしょうか。
この問いに答えた論文を一編読んでみます。
- タイトル: Language processing characteristics in normal pressure hydrocephalus: insights from eye-tracking analysis of incorrect responses
- 学術誌: Frontiers in Aging Neuroscience
- 年: 2025
- DOI: 10.3389/fnagi.2025.1527962
この論文は CC BY ライセンスで公開されています。この記事の表は、Kim et al. (2025) の表 2、表 3、表 4 から一部の数値を抜き出して再構成したものです。
研究チームは、正常圧水頭症(Normal Pressure Hydrocephalus, NPH)の患者と健常高齢者(Healthy Elderly, HE)に、絵を見て名前を言ってもらいました。課題の間、ウェブカメラで視線を記録しました。この課題の名称は語彙検索課題(Lexical Retrieval Task, LRT)です。一般的な呼称検査と異なり、LRT は最初の反応一つだけを採点します。最初に誤り、自分で訂正して正答した場合も誤答として扱います。
この記事で使う主要な用語は次のとおりです。
- 視線追跡(eye-tracking): 画面のどこをどれだけ長く見ているかを記録する方法です。
- 固視(fixation): 視線が一点に 70 ms 以上とどまっている状態です。
- サッカード(saccade): 固視と固視の間に視線が素早く移る動きです。この論文では、移動速度が 30°/s を超えるとサッカードに分類しました。
- 正答反応と誤答反応: 最初の反応が正しければ正答反応です。無反応、誤答、自己訂正による答えはすべて誤答反応です。
動機: 正答率だけでは NPH 患者の呼称過程は見えない
なぜ NPH の言語処理が重要なのか
論文は、NPH の言語の問題を調べる理由として次の点を挙げています。
- NPH は可逆性認知症の一つです。早期に発見すれば症状が改善することがあります。
- NPH では脳脊髄液の循環が悪くなり、脳室が拡大します。拡大した脳室は後頭葉、側頭葉、前頭葉、海馬を圧迫します。その結果、視知覚、語彙アクセス、音韻符号化、意味記憶の処理が弱まることがあります。
- Chung (2018) は、シャント手術を受けた NPH 患者 529 人の記録を検討しました。そのうち 23.1% に言語障害がありました。言語障害のある患者の約 75% は、表出言語、とくに物の呼称に障害がありました。
- NPH とパーキンソン病(Parkinson’s disease, PD)は主な症状が重なります。そのため、両者を区別する鑑別診断が必要です。
物の呼称は複数の段階を経ます。視覚認識、意味処理、語彙アクセス、音韻処理が順に起こります。神経認知障害のある人は、語彙、意味、視知覚が弱まることが多く、呼称に困難を示しがちです。
先行研究が扱っていない部分
NPH 患者の呼称の結果は、研究によって異なっていました。Kim et al. (2024) では、NPH 群と PD 群が健常高齢者より有意に呼称が不良でした。NPH 群は反応も遅く、意味性錯語と非語の誤りも多く出しました。一方、Saito et al. (2011) は、特発性 NPH、アルツハイマー病(Alzheimer’s disease, AD)、健常高齢者の間に有意な差を見いだしませんでした。
視線追跡の研究もありました。Lehtola et al. (2022) は、数字を素早く読む King-Devick 検査で、特発性 NPH、AD、健常高齢者を比較しました。NPH 群と AD 群はいずれも、健常高齢者よりサッカードの振幅が小さいという結果でした。Ungrady et al. (2019) は、原発性進行性失語(primary progressive aphasia, PPA)と AD の患者に絵 200 枚で呼称をさせ、正答と誤答をあわせて分析しました。
論文が指摘する空白は次のとおりです。
- 結果と過程の区別: NPH の言語障害は、言語体系そのものよりも広い認知的損傷に由来するという見方があります。そうであれば、最終的な点数よりも処理過程に困難がより大きく現れる可能性があります。先行研究の結果が食い違った理由も、課題の違いかもしれません。
- NPH の視線研究の不足: NPH を扱った視線追跡研究は少ないです。
- 正答中心の分析: 先行研究は主に正答反応の量的な差を見ていました。正答と誤答の視線パターンを質的に比較した研究は少なかったです。
方法: 最初の反応だけを採点し、正答と誤答の視線を分けて比較した
論文の研究目的は、群間比較、得点と指標の関係、正答・誤答別の比較、視線の可視化です。この記事では、参加者をまず紹介し、方法を五つの段階に分けて整理しました。
データと参加者
参加者は全部で 26 人です。NPH 群は 65 歳以上の患者 14 人、HE 群は 12 人です。
NPH 群の選定基準は次のとおりです。
- 症状が緩徐に始まった。
- 症状が 3〜6 か月以上続いている。
- 症状や画像所見を説明できる他の疾患がない。
- 脳室が拡大している。
- 歩行障害、認知障害、排尿障害がある。
- 脳脊髄液圧が診断基準の範囲(70–245 mmH2O)を超えない。
- まだシャント手術を受けていない。
脳神経外科医と神経内科医が合意して NPH 参加者を選定しました。HE 群は、感覚、神経、身体の障害がなく、韓国版簡易精神状態検査(Korean Mini-Mental State Examination-2, K-MMSE2)の得点が 16 パーセンタイル以上の人としました。
| 項目 | NPH 群 | HE 群 | 群間差 |
|---|---|---|---|
| 平均年齢(歳) | 79.14 | 76.33 | p = 0.078 |
| 平均教育年数(年) | 7.00 | 10.08 | p = 0.126 |
| K-MMSE2 得点 | 19.93 | 26.58 | p = 0.001 |
出典: 論文 2.1 節
両群は、年齢、性別、教育年数で有意な差がありませんでした。K-MMSE2 の得点だけが有意に異なりました。
ステップ 1: 語彙検索課題の設計と採点
- 入力: Kim et al. (2024) が作成した単語リスト
- 処理: 頻度、音節数、意味カテゴリーを調整して単語 30 個を決め、最初の反応だけを採点
- 出力: 参加者ごとの LRT 得点、項目ごとの正誤の表示、誤り の種類
- 単語の頻度を分けます。Jo (2002) の基準に従い、頻度 15 未満を低頻度、15 以上を高頻度に分類しました。その結果、高頻度 13 個、低頻度 17 個が入りました。
- 音節数を調整します。2 音節 5 個、3 音節 13 個、4 音節 11 個、5 音節 1 個です。課題を難しくするため、3 音節と 4 音節の比重を高めました。
- 意味カテゴリーを 15 個に分け、バランスよく配置します。陸上動物、昆虫、果物、乗り物、楽器、花、道具、鳥などのカテゴリーです。
- 最初の反応だけを採点します。無反応にもヒントを与えません。
- 誤答を種類別に分けます。Dell et al. (1997) に従い、意味性の誤り、形態性の誤り、混合性の誤り、無関連の誤り、非語の誤りに分類しました。このデータは、解釈を助ける補助分析に用いました。
研究チームは、誤りを引き出すために単語をこのように決めました。同じ意味カテゴリーに似た単語が多いと、意味レベルで見当違いの単語を選びやすくなります。音韻が複雑だと、検索の段階で誤りが生じやすくなります。
ステップ 2: 視線の記録と前処理
- 入力: 課題中に記録した視線座標と時刻情報
- 処理: キャリブレーション、固視とサッカードの分類、関心領域外のデータの除外
- 出力: 関心領域内の固視リストとサッカードリスト
- 機器を配置します。参加者はモニターから 55 cm、マイクから 30 cm 離れて座りました。モニターは Dell E2422HS(1,920 × 1,080 ピクセル)、カメラは毎秒 30 フレームの Pengca Webcam 1080p でした。視線追跡ソフトウェアには VisualCamp の SeeSo を使いました。実際のサンプリングレートは約 28.43 Hz でした。
- 5 点キャリブレーションを行います。画面中央と四隅の点を順に見ます。5 点すべてで、視線が 5 秒間 1.7° 以内にとどまれば課題に進みます。一点でも失敗したら、キャリブレーションを最初からやり直します。
- 固視とサッカードを分類します。70 ms 以上とどまった視線は固視、30°/s を超える移動はサッカードです。
- 固視区間の座標を整理します。一つの固視内のすべての座標を、その固視の最初の座標に置き換えます。サッカードに分類した途中の座標は分析から除きます。
- 関心領域(Area of Interest, AOI)を定めます。絵が表示される画面中央の 1,483 × 707 ピクセルの領域だけを分析しました。絵を処理する視線だけを残すため、この領域外の視線はすべて除きました。
ステップ 3: 視線指標の計算
- 入力: ステップ 2 の固視リストとサッカードリスト
- 処理: 六つの指標を項目ごとに計算
- 出力: 参加者別、反応タイプ別の指標値
研究チームが用いた指標は次の六つです。
| 指標 | 意味 | 単位 |
|---|---|---|
| 固視時間(FD) | 固視時間の合計 | ms |
| 固視回数(FC) | 固視が起きた回数 | 回 |
| サッカード回数(SC) | サッカードが起きた回数 | 回 |
| サッカード時間(SD) | サッカード時間の合計 | ms |
| サッカード経路総長(SST) | サッカードの移動距離の合計 | ピクセル |
| サッカード振幅総和(SAT) | サッカードの角度変化の合計 | 度 |
出典: Kim et al. (2025)、表 1 と表 2 を再構成(CC BY)
各指標の計算方法は次のとおりです。
- FD(Fixation Duration): 固視ごとに終了時刻から開始時刻を引いた値をすべて足します。70 ms 以上の固視だけを含みます。
- SD(Saccade Duration): サッカードごとに終了時刻から開始時刻を引いて足します。
- SST(Saccade Scanpath Total): サッカードの出発点と到着点の間の直線距離をすべて足します。
- SAT(Saccade Amplitude Total): サッカードの垂直方向の変化を水平方向の変化で割った値に逆正接を適用して角度を求め、その角度を足します。
論文は、時間と頻度の指標を認知処理と結びつけ、空間の指標を視知覚能力と結びつけています。そのため、NPH 群で時間と頻度が異なれば認知処理の異常と解釈し、空間指標が異なれば視知覚の障害と解釈します。
ステップ 4: 統計分析
- 入力: 参加者別の LRT 得点と視線指標
- 処理: 群間比較、相関分析、群 × 反応タイプの分析
- 出力: 検定統計量と p 値
- 群間比較: データが正規性の仮定を満たさなかったため、Mann–Whitney U 検定で二群の LRT 得点と視線指標を比較しました。
- 相関分析: LRT 得点と各視線指標の間の Pearson 相関を求めました。
- 反応タイプの分析: 群(NPH、HE)と反応タイプ(正答、誤答)を二つの要因として、二元配置混合分散分析(two-way mixed ANOVA)を行いました。事後比較には Bonferroni 補正を適用しました。
- 検定力の確認: G*Power 3.1 で事後検定力を計算しました。
群は人ごとに一つに定まる被験者間要因で、反応タイプは一人の中で正答と誤答の両方が現れる被験者内要因です。混合分散分析は、二つの主効果と交互作用を同時に検定します。
ステップ 5: 可視化とグリッド分析
- 入力: 正答率が高い項目 2 つと誤答率が高い項目 2 つの固視データ
- 処理: ヒートマップとスキャンパスの比較、10 × 10 グリッド指標の計算
- 出力: 項目別、群別のグリッド指標
研究チームは、正答率が 90% を超えた「オートバイ」と「ナス」を正答項目として選びました。両群で誤答率が 60% を超えた「木琴」と「エスカレーター」は、誤答項目として選びました。この四つの項目のヒートマップ(heatmap、視線が多くとどまった場所を色で表した図)とスキャンパス(scanpath、視線が通った経路)を比較しました。
質的な比較を数値で確かめるため、絵を 10 × 10 のグリッド、すなわち 100 個のセルに分けました。そして次の五つの指標を計算しました。
- グリッドエントロピー(grid entropy): 固視がセルにどれだけ均等に散らばったかを表します。値が大きいほど、視線が広く分散しています。
- 空間的分散(spatial dispersion): 連続する二つの固視の間の平均直線距離です。
- グリッド占有率(grid occupancy): 固視が一回以上あったセルの割合です(0–1)。
- 遷移密度(transition density): 可能なセル間の移動のうち、実際に現れた異なる移動の割合です。
- 最近傍指数(Nearest Neighbor Index, NNI): 1 より小さければ固視が集まっており、1 より大きければ散らばっています。
グリッド占有率の計算例を示します。木琴の項目で、NPH 群の占有率は 0.72 でした。セルが 100 個なので、0.72×100=72 個のセルに固視があったという意味です。HE 群は 0.59 で、0.59×100=59 個のセルです。
結果: NPH 群の視線の違いは誤答の瞬間により大きく現れた
語彙検索得点: NPH 群が大きく低かった
LRT の平均得点は、NPH 群が 52.14 点(SD = 16.88)、HE 群が 84.17 点(SD = 7.26)でした。差は有意でした(U = 2.500, p = 0.000)。事後検定力は 90% を超えました。著者は、この得点差を視線の結果とあわせて解釈すべきだと考えています。
全体の視線指標: 六つの指標すべてで NPH 群が大きかった
すべての反応をまとめて二群を比較したところ、六つの指標すべてで有意な差が出ました。
| 指標 | NPH 平均 | HE 平均 | p |
|---|---|---|---|
| 固視回数(FC) | 22.63 | 12.31 | 0.001 |
| 固視時間(FD, ms) | 6139.76 | 3263.67 | 0.001 |
| サッカード回数(SC) | 21.65 | 11.31 | 0.001 |
| サッカード時間(SD, ms) | 4143.48 | 2018.58 | 0.000 |
| サッカード経路(SST, ピクセル) | 6064.02 | 2617.30 | 0.000 |
| サッカード振幅(SAT, 度) | 666.74 | 311.28 | 0.000 |
出典: Kim et al. (2025)、表 2 から平均と p 値だけを抜き出して再構成(CC BY)
著者は結果を次のように解釈しています。固視時間が長いことは、注意を別の場所へ移す能力が弱い可能性を示します。固視回数が多いことは、絵を非効率的に見渡したことを示します。サッカード時間が長く回数が多いことは、視覚情報を断片的に処理した可能性を示します。
著者はその原因として、脳構造への圧迫を挙げています。前頭葉は注意の転換に、大脳基底核は眼球運動の調節に関わっています。拡大した脳室がこれらの構造を圧迫すると、視覚情報の処理が弱まり、語彙検索にも影響しうるとしています。
この結果を読む際は、二群の認知水準の違いもあわせて見る必要があります。著者は、NPH 群の認知機能は HE 群より有意に低いものの、重度ではないと見ています(考察には K-MMSE = 20.33 と記されています)。2.1 節の K-MMSE2 平均は NPH 19.93、HE 26.58 でした(p = 0.001)。そのため筆者は、視線指標の差が NPH 固有の特性なのか、全般的な認知水準の違いによるものなのかは、この設計では切り分けられないと判断します。教育年数も平均 7.00 年と 10.08 年で差がありました(有意ではありません)。
得点と視線指標: 負の相関を示した
LRT 得点は、六つの指標すべてと負の相関を示しました。
- FC: r = −0.569 (p = 0.002)
- FD: r = −0.566 (p = 0.003)
- SC: r = −0.569 (p = 0.002)
- SD: r = −0.554 (p = 0.003)
- SST: r = −0.488 (p = 0.011)
- SAT: r = −0.462 (p = 0.017)
視線指標の値が大きい参加者ほど、呼称の得点が低い傾向がありました。この結果は相関関係であり、視線の動きが得点を下げるという因果を示したものではありません。著者は考察で、係数が主に 0.40〜0.60 の範囲にあるとして、中程度の相関と解釈しました。抄録には係数がおおむね 0.50 以上と書かれており、原文の中で表現が異なります。実際の r は −0.462〜−0.569 でした。事後検定力は大部分が 80% を超えましたが、SAT は 74% 以上、SST は 68% 以上と低めでした。空間指標二つの相関は、解釈にもう少し注意が必要です。
正答と誤答: 両群とも誤答で指標が大きくなった
反応タイプ別の平均は次のとおりです。
| 指標 | 群 | 正答 | 誤答 |
|---|---|---|---|
| FC | NPH | 14.05 | 34.23 |
| FC | HE | 9.94 | 22.26 |
| FD(ms) | NPH | 3925.58 | 9216.46 |
| FD(ms) | HE | 2634.16 | 5663.05 |
| SD(ms) | NPH | 2249.65 | 6425.71 |
| SD(ms) | HE | 1658.81 | 4152.57 |
| SST(ピクセル) | NPH | 3599.13 | 9484.76 |
| SST(ピクセル) | HE | 2076.57 | 5236.22 |
出典: Kim et al. (2025)、表 3 から四つの指標の平均だけを抜き出して再構成(CC BY)
二元配置混合分散分析では、群の主効果が六つの指標すべてで有意でした。たとえば SD は F[1,24] = 13.600(p = 0.001)、FD は F[1,24] = 8.281(p = 0.008)でした。反応タイプの主効果もすべて有意でした。SD は F[1,24] = 94.014、FC は F[1,24] = 60.922 でした(どちらも p = 0.000)。両群とも誤答で視線指標が大きくなったということです。
群 × 反応タイプの交互作用は、SD でのみ有意でした(F[1,24] = 5.981, p = 0.022)。正答から誤答に移るときのサッカード時間の増え幅が、NPH 群でより大きかったという意味です。増加幅を計算すると、NPH 群は 6425.71−2249.65=4176.06 ms、HE 群は 4152.57−1658.81=2493.76 ms です。倍率で見ると、NPH 群は 6425.71÷2249.65≈2.86 倍、HE 群は 4152.57÷1658.81≈2.50 倍です。
誤答の種類を補助的に分析した結果、NPH 群では意味性の誤り(例: トラ → ライオン)が最も多くみられました。誤りの種類別の数値は本文に示されていません。著者はこの結果をもとに、物の認識から始まる視覚処理の障害が、意味レベルの単語検索を妨げうると推論しています。この推論は、数値が示されていない補助分析に基づく著者の仮説です。
可視化とグリッド分析: 正答項目では両群の値が近かった
ヒートマップでは、HE 群は正答項目でも誤答項目でも絵の中央を見ていました。NPH 群は誤答項目で視線が周辺に散らばりました。エスカレーターの絵で、この差が最も大きく表れました。
| 項目(反応) | 群 | 空間的分散 | グリッド占有率 |
|---|---|---|---|
| 木琴(誤答) | NPH | 5.20 | 0.72 |
| 木琴(誤答) | HE | 2.20 | 0.59 |
| エスカレーター(誤答) | NPH | 4.30 | 0.60 |
| エスカレーター(誤答) | HE | 1.35 | 0.38 |
| オートバイ(正答) | NPH | 1.88 | 0.40 |
| オートバイ(正答) | HE | 1.77 | 0.39 |
| ナス(正答) | NPH | 1.66 | 0.33 |
| ナス(正答) | HE | 1.51 | 0.29 |
出典: Kim et al. (2025)、表 4 から二つの指標だけを抜き出して再構成(CC BY)
誤答項目では NPH 群の空間的分散が HE 群より大きく、正答項目では両群の値が近かったです。ただし、本文の表 4 には四つの項目の群レベルの値しかなく、検定統計量は示されていません(詳細は付録 5)。グリッドエントロピーも同様の傾向を示しました。誤答項目の木琴では 5.58 と 5.45、正答項目のオートバイでは 4.95 と 4.86 でした。
スキャンパスにも違いが見られました。HE 群は誤答項目で経路が複雑になりました。NPH 群は正答項目の時点ですでに経路が多様で、誤答項目ではさらに複雑になりました。例外もありました。患者 P04 は、木琴を誤答しながらも非常に単純な経路を示しました。このような参加者は、NPH 群の中でも呼称の成績が低かったです。著者は、誤答で現れる単純な経路は、効率よりも「不活性」な処理を反映している可能性があると解釈しています。
意義と限界
何が変わるのか
- 誤答の分析: 誤答を捨てずに視線データで分析しました。群 × 反応タイプの交互作用は SD で有意で、四項目の記述的な比較でも、誤答項目で群間差がより大きくなりました。
- 厳格な採点: 最初の反応だけを採点し、自己訂正も誤答として扱いました。最終的な成否ではなく、検索過程の障害を狙ったものです。
- 定量化: ヒートマップの質的な印象を、五つのグリッド指標で数値化しました。
- 他の疾患との対比: 著者は考察で、Ungrady et al. (2019) の PD、PPA 患者は誤答での固視回数が少なかったと述べています。この論文の NPH 群は、誤答で固視がより多かったです。著者はこの違いを、PD の「固視そのもの」の困難と NPH の「固視の非効率」として区別し、鑑別診断の候補指標として提案しています。ただし、同じ研究の比較対象が、序論では PPA と AD、考察では PD と PPA と書かれており、原文の中で表記が異なります。
実務者にとっての有用性
著者が結論で提案した内容は次のとおりです。
- 評価項目: NPH 患者の語彙検索障害を評価するには、多音節の低頻度語を用います。
- 補助指標: 得点と視線指標が相関を示したため、著者は視線効率の分析がより敏感な指標になる可能性があると提案しました。ただし、感度の比較はこの研究では行われていません。補助指標として探索してみる価値がある程度に受け止めます。
- 段階的な介入: 呼称が困難で視線パターンが非典型的な患者には、正確な呼称を目標にする前に、視線パターンを単純にする中間段階を置きます。
- 探索の促進: 著者は、誤答しながらも視線経路が極端に単純な患者が、障害が最も重い場合である可能性があると考えました。このような患者には、検索訓練の前に視覚探索の方略が役立つ可能性があると提案しました。この解釈は P04 のような事例の観察から出た仮説であり、介入の効果はこの研究では検証されていません。
研究者にとっての有用性
この論文は、「結果」と「過程」を分けて見る設計を示しています。正答と誤答を被験者内要因とすれば、群間差がどの条件で大きくなるかを交互作用として検定できます。
研究チームは、専用機器ではなくウェブカメラとノートパソコン、市販のソフトウェアで視線を記録しました。この研究は、時間・頻度の指標を認知処理に、空間の指標を視知覚に結びつけて解釈しました。論文は、視線パターンを課題と文脈に照らして解釈すべきだと強調しています。この解釈の枠組みを他の疾患にも適用できるかは、課題と文脈を考慮して検討してみる価値があります(筆者の意見)。
論文が示す限界
論文自身が示している限界は三つです。
- サンプルサイズ: サンプルが小さいです。より大きな群で結果の信頼性を高める必要があります。
- 比較群: 鑑別診断が難しい PD、AD の群と NPH を比較する研究が必要です。
- 手術後の変化: NPH は手術後に改善しうるため、手術後に単語検索と視覚処理がどう変わるかを追跡する必要があります。
筆者が考える適用条件
以下は論文に書かれた内容ではなく、筆者が付け加える条件です。認知水準の違いの影響は、前の結果の節で扱いました。
- 視線記録の精度: ウェブカメラによる記録の精度は約 1.7° で、サンプリングレートは約 28.43 Hz です。短いサッカードを細かく区別する必要がある用途には、同じ条件が合わない可能性があります。
- 可視化の範囲: 可視化とグリッド分析は四項目の群レベルの値であり、検定統計量は示されていません。個人の診断基準としてそのまま使うのは難しいです。
- 解釈の根拠: 著者は SD の交互作用を、正答では二群の SD が異ならないという意味で解釈しました。しかし記述統計では、正答の SD は 2249.65 ms と 1658.81 ms であり、その事後比較の数値は本文にありません。
- 数値の確認: 本文と表の一部の値が異なります。K-MMSE2 の平均は、2.1 節で 19.93、考察で 20.33 です。SD の U 値は、本文では 20.000、表 2 では 10.000 です。引用する際は原文を直接確認してください。
すぐに試せること
- 最初の反応だけで再採点します。すでにある呼称の記録から、無反応と自己訂正を誤答として分類し直します。既存の得点と新しい得点を並べて、どの参加者の順位が変わるかを確認します。
- 正答と誤答を分けて平均を求めます。視線の記録があれば、群別に FC、FD、SC、SD の平均を反応タイプごとに別々に求めます。二つの反応タイプの間の増加幅を群別に計算すれば、交互作用の分析の前に傾向を先に確認できます。
- グリッド占有率を計算します。正答率が高い項目と低い項目を一つずつ選びます。絵を 10 × 10 のグリッドに分け、固視が一回以上入ったセルの割合を群別に求めます。