音声の音響特徴は認知状態を教えてくれるか

韓国語話者223名の短い発声の録音から抽出した音響特徴だけで、認知状態を区別できるだろうか。モデルの性能、重要な特徴、年齢・教育の違いという限界を、論文1本にまとめる。

韓国語の原文から翻訳しました。 韓国語の原文

認知機能の低下は、早く見つけるほど対応に使える時間が長くなります。ところが、現在使われている診断方法は頻繁には受けにくいものです。臨床評価は時間がかかり、脳画像検査は高価で装置が必要です。高齢の患者さんは長い検査を嫌がることもあります。

数分間「ア」「イ」「パタカ」のような音を出すだけでスクリーニングできれば、検査の負担は大きく減ります。この記事が扱う問いは次のとおりです。韓国語話者が短い発声課題で出した音の音響特徴だけで、認知状態を区別できるでしょうか。

この問いに答えた論文を1本読んでみます。

  • タイトル: Exploring Voice Acoustic Features Associated with Cognitive Status in Korean Speakers: A Preliminary Machine Learning Study
  • 学術誌: Diagnostics
  • 年: 2024
  • DOI: 10.3390/diagnostics14242837

論文の方法は3段階に要約できます。まず、患者223名が8種類の発声課題を行い、研究チームがその録音から音響特徴を抽出します。次に、4種類の機械学習モデルがこの特徴を使って認知機能低下の有無を当てるよう学習します。最後に、モデルがどの特徴に基づいて判断したかを解釈します。著者はこの研究を予備研究(preliminary study)と呼んでいます。

この記事全体で使う用語は次のとおりです。

  • 音響特徴(acoustic feature): 録音波形から計算した数値。声の震え、高さ、共鳴位置などの性質を数値で表します。
  • 基本周波数(fundamental frequency, F0): 周期的に繰り返される声の波形で最も低い周波数。声の高さに相当します。
  • ジッター(jitter): 隣り合う振動周期の間で、周期の長さがどれだけ揺らぐかを示す値。周波数の不安定さを意味します。
  • シマー(shimmer): 隣り合う振動周期の間で、振幅(音の大きさ)がどれだけ揺らぐかを示す値。
  • 韓国版簡易精神状態検査(Korean Mini-Mental State Examination, K-MMSE): 認知機能を評価する検査の韓国語版。この論文で集団を分ける基準です。
  • 適合率–再現率曲線下面積(Precision-Recall Area Under the Curve, PR-AUC): モデルの性能指標。集団の大きさが不均衡なときによく使います。
  • SHAP(Shapley Additive Explanations): モデルの予測に各特徴がどれだけ寄与したかを計算する解釈手法。

動機: 安価で負担の少ない認知スクリーニングツールが必要である

なぜ音声ベースのスクリーニングが重要か

論文は、既存の診断方法の障壁を次のように整理しています。

  • 費用が高い。
  • アクセスしにくい。
  • 患者が不快に感じ、特に高齢の患者は複数段階の検査を嫌がる。

人工知能(AI)を磁気共鳴画像(MRI)や陽電子放射断層撮影(PET)などの脳画像データに適用した研究は、診断精度が高いです。ただし、専門の装置と施設が必要なため、広く普及させるのは困難です。話すことには、注意、記憶、言語構成、運動制御が一緒に関わります。そのため著者は、音声の分析を補完的な手段と見ています。著者が描く目標は、日常生活で認知機能を定期的に確認できるスクリーニングツールです。

先行研究とこの論文の貢献

声と認知機能の関係を扱った先行研究は複数あります。ジッターやシマーなどの音声摂動(perturbation)特徴が、初期の認知機能低下を見つけるのに有用だという報告があります。シマーが進行した認知機能低下の敏感な指標だとする研究もあります。

それ以外の特徴を扱った研究もあります。

  • 調波雑音比(harmonic-to-noise ratio, HNR)が低いほど初期の認知機能低下と関連するという報告
  • 音の高低の変化や話速などの韻律特徴が、軽度と重度の区別に有用だという報告
  • 高次フォルマント(formant, 声道の共鳴周波数)の変化が調音精度の低下を反映するという報告

著者は自らの研究の貢献を3つに整理しています。

  • 先行研究が主に英語話者を扱っていたのに対し、この研究は韓国語話者の音声を分析する。
  • 8つの課題から184個の指標を抽出して一緒に分析する。
  • SHAP分析によって、認知状態の水準別に音響特徴の相対的重要度を調べる。

方法: 8種類の発声課題から184個の指標を抽出し、4つのモデルで分類する

論文は研究の過程を4段階で示しています。音声を集めて特徴を抽出し、K-MMSEスコアで集団を分け、モデルを作り、説明可能なAIで解釈します。この記事では最初の段階を録音と特徴抽出に分け、5段階として整理しました。実験・臨床研究の構成である参加者、課題、測定、モデルの順に、解釈の段階を加えたものです。

図 1. K-MMSEによる集団分け、録音、音響特徴の計算、モデル比較、SHAP解釈の5段階を、本文の小見出しと同じ番号で示す。

データと参加者

参加者は、認知機能低下が疑われて脳神経外科の外来を受診した韓国人患者223名です。組み入れ基準は次のとおりです。

  • 課題の指示を理解し、従うことができる。
  • 音声に影響を与える他の神経疾患の既往がない。
  • 研究への参加に同意した。

経験5年を超える言語聴覚士が、すべての参加者を事前に確認しました。確認項目は、指示の理解、聞き取れる発話、すべての課題の遂行です。研究は慶北大学校漆谷病院の機関生命倫理委員会の承認を受けました。

第1段階: K-MMSEスコアで集団を分ける

  • 入力: 患者223名のK-MMSEスコア
  • 処理: スコア区間に従って3つの集団に分け、3つの二値分類問題を設定する
  • 出力: 重度72名、軽度54名、正常97名
  1. すべての患者が医療スタッフの観察下でK-MMSEを受ける。
  2. 既存の指針と研究に従い、019点は重度の認知機能低下、2023点は軽度の認知機能低下、24~30点は認知機能低下なし(正常)に分ける。
  3. 3つの集団から3つの分類問題を作る。重度対正常、軽度対正常、重度+軽度対正常である。

K-MMSEは、時間・場所の見当識、記銘、注意と計算、想起、言語、空間・視覚認知を評価します。著者は、このスコア区間が韓国人を対象とした研究で検証されていると説明しています。

集団間には年齢と教育年数の差がありました。著者はこの差を統制しませんでした。スクリーニングの段階では、加齢による認知機能低下も認知症の前兆となりうるため、すべて見つけるほうがよいという判断です。集団別の平均年齢と平均教育年数は次のとおりです。

  • 重度群(72名): 平均72.44歳、教育7.10年
  • 軽度群(54名): 平均71.11歳、教育8.24年
  • 正常群(97名): 平均64.80歳、教育10.93年

第2段階: 8種類の発声課題の録音

  • 入力: 参加者223名
  • 処理: 母音課題4つと交互運動(diadochokinetic, DDK)課題4つを同じ条件で録音する
  • 出力: 参加者ごとの8課題のwav録音ファイル

課題は次のとおりです。

  1. 母音の持続発声 /α/, /i/, /u/: 各母音を2~3秒間保つ。発声の安定性を評価する。
  2. 母音の延長 /α-α-α/: /α/をできるだけ長く保つ。最長発声持続時間と呼吸の調節を評価する。
  3. 交互運動速度(alternate motion rate, AMR) /puh-puh-puh/, /tuh-tuh-tuh/, /kuh-kuh-kuh/: 1つの音節を速く繰り返す。発話運動機能と協調性を評価する。
  4. 連続運動速度(sequential motion rate, SMR) /puh-tuh-kuh/: 異なる音節を順番に発する。運動計画と順序処理の能力を評価する。

2種類の課題を併用した理由があります。母音課題は、発声器官の微細な運動制御を明らかにします。DDK課題は、運動計画、順序処理、タイミング制御を要求するため、認知–運動障害に敏感です。

録音条件は次のように固定しました。

  • 周囲の騒音は50 dB未満
  • 課題の指示画面から55 cm離れて立つ姿勢
  • 口から30 cmの距離に置いた単一指向性マイク
  • サンプリング周波数44,100 Hz、wav形式で保存
  • 経験5年を超える言語聴覚士がすべての録音を実施

第3段階: 音響特徴の抽出

  • 入力: 8課題の録音ファイル
  • 処理: 課題ごとに音響特徴を23個計算する
  • 出力: 参加者1名あたり184個の指標(23個の特徴 × 8課題)

特徴は2つのカテゴリーに分かれます。

  • 音質特徴: ジッター5種(local, absolute, RAP, PPQ5, DDP)、シマー6種(local, localdB, APQ3, APQ5, APQ11, DDA)、HNR
  • 韻律特徴: 発話持続時間、平均F0、F0の標準偏差(stdevF0)、フォルマント平均、F1~F4の平均と中央値

ジッターは、隣り合う2つの周期の長さの差の絶対値をすべて足して(周期数 − 1)で割り、さらに平均周期で割って100を掛けます。シマーは、周期の長さの代わりに振幅に同じ計算を適用します。どちらの値も、大きいほど声が不安定であることを意味します。

派生指標は、計算の範囲が異なります。APQ3、APQ5、APQ11は、それぞれ3周期、5周期、11周期の範囲で振幅の変動を平均します。DDAシマーは、隣り合う振幅の差どうしの差を平均します。後で見るように、このDDAシマーが結果の中心的な特徴として現れます。

HNRは、調波成分のエネルギーを雑音成分のエネルギーで割った比の対数をとり、10を掛けた値です。高いほど雑音が少なく澄んだ声です。調波成分はF0の整数倍の周波数です。論文の例のように、F0が100 Hzなら、第2高調波は200 Hz、第3高調波は300 Hzです。

特徴の計算にはPython 3.10.14を使いました。著者は、母音課題とDDK課題の特徴を別々に見ず、1つのモデルに一緒に入力しました。特徴間の相互作用までモデルに学習させるための設計です。

第4段階: モデルの学習と評価

  • 入力: 分類問題3つと184個の指標
  • 処理: 4種類のモデルを学習し、PR-AUCで比較する
  • 出力: 分類問題ごとに最も性能の高いモデル1つ
  1. 4種類のモデルを用意する。ロジスティック線形分類器(LM)、ランダムフォレスト(RF)、勾配ブースティング(GBM)、深層ニューラルネットワーク(DNN)である。
  2. 自動機械学習(automated machine learning, AutoML)でハイパーパラメータ(モデルの設定値)を探索する。
  3. 5分割交差検証(データを5つのまとまりに分けて交互に検証する方式)で過学習を抑える。
  4. 学習データとテストデータを8:2に分け、テストデータで性能を計算する。

トランスフォーマー(transformer)や畳み込みニューラルネットワークのような最新の構造を使わなかった理由があります。データが少なく、特徴がすでに数値の形だからです。分類問題ごとの人数は、重度対正常が72名と97名、軽度対正常が54名と97名、重度+軽度対正常が126名と97名です。

PR-AUCを主指標にした理由は、集団の大きさが不均衡で、テストデータが少ないからです。こうした条件では、特定の閾値に依存する適合率や再現率の1つだけを見ると、判断が揺らぎます。PR-AUCは、閾値を変えながら適合率と再現率を描いた曲線の下の面積です。

PR-AUCにはベースラインがあります。ベースラインは陽性サンプル数を全サンプル数で割った値で、適切に学習したモデルはこの値より高くなければなりません。重度対正常なら72÷(72+97)=0.426です。軽度対正常なら54÷(54+97)=0.358です。この2つの値は、論文が報告したベースラインと一致します。

重度+軽度対正常は、計算が合いません。方法の節の人数(126名と97名)で計算すると、126÷223=0.565です。ところが論文が報告したベースラインは0.677で、結果の節は人数を151名と72名と記しています。151÷223=0.677なので、報告されたベースラインは結果の節の人数と合います。論文内の2つの数字のどちらが正しいかは、根拠だけでは判断できません。

第5段階: SHAPによる重要特徴の解釈

  • 入力: 分類問題ごとにPR-AUCが最も高いモデル
  • 処理: 特徴ごとにSHAP値を計算する
  • 出力: 分類問題ごとの重要特徴の上位20個

SHAPは、協力ゲーム理論のシャープレイ値(Shapley value)をモデルの解釈に応用した手法です。ある特徴を入れたときと除いたときで、予測がどれだけ変わるかを計算します。この計算を、可能なすべての特徴の組み合わせで繰り返して平均をとります。

結果の図では、赤は特徴の値が高い場合、青は低い場合です。SHAP値が正なら、モデルがその特徴を対象集団の予測に使い、負なら非対象集団の予測に使うという意味です。著者は、分類問題ごとにPR-AUCが最も高いモデルから上位20個の特徴を分析しました。

結果: 音響特徴だけでベースラインより高い性能を出したが、年齢と教育の差が混在している

集団の特性の比較: 正常群のほうが若く、教育年数が長い

研究チームは、モデルの結果を見る前に集団の特性を比較しました。データが正規分布に従わず、分散が異なっていたため、クラスカル=ウォリス検定を使いました。年齢はレーヴェン検定でp = 0.017でした。

  • 年齢: 3集団の間の差が有意でした(H = 24.07, p < 0.001)。
  • 教育年数: 差が有意でした(H = 32.83, p < 0.001)。
  • 性別: 差は有意ではありませんでした(χ2 = 2.79, p = 0.248)。

ボンフェローニ補正を行った事後比較では、年齢の差は重度対正常(p < 0.001)と軽度対正常(p = 0.003)で現れました。重度対軽度はp = 0.956で差がありませんでした。教育年数も同じ形です。重度対正常と軽度対正常はp < 0.001、重度対軽度はp = 0.532でした。正常群だけが若く、教育年数が長いということです。

モデルの性能比較: 2つの問題でDNN、1つの問題でRF

3つの分類問題のPR-AUCをモデル別に整理すると、次のとおりです。

モデル重度対正常軽度対正常重度+軽度対正常
DNN0.7370.7260.659
RF0.5160.6300.715
GBM0.7160.5830.682
LM0.6320.5970.680

出典: Lee, J. ほか, “Exploring Voice Acoustic Features Associated with Cognitive Status in Korean Speakers”, Diagnostics(2024)の表5からPR-AUCの値のみを抜き出して再構成しました。原論文はCC BY 4.0(https://creativecommons.org/licenses/by/4.0/)ライセンスで公開されています。

PR-AUCを基準にすると、重度対正常と軽度対正常ではDNNが、重度+軽度対正常ではRFが最も高くなりました。他の指標で見ると順位が変わります。重度対正常では、受信者操作特性曲線下面積(AUC)はGBMが0.730で、DNNの0.716より高くなりました。軽度対正常では、正確度はRFとGBMが0.800、DNNが0.667でした。

PR-AUCが最も高いモデルの適合率と再現率も見ておく価値があります。軽度対正常のDNNは、再現率1.000、適合率0.524でした。重度+軽度対正常のRFは、適合率1.000、再現率0.521でした。論文はこの違いを別途論じていません。筆者の見方では、スクリーニングツールでは患者を見逃さない再現率が重要なので、この観点では2つのモデルの使いどころが異なります。

ベースラインに対する向上: 軽度対正常で最大

分類問題PR-AUC 1位のモデルPR-AUCベースライン
重度対正常DNN0.7370.426
軽度対正常DNN0.7260.358
重度+軽度対正常RF0.7150.677
図 2. 音響特徴のみを使ったモデルのPR-AUCは3つの問題すべてでベースラインより高く、向上幅は軽度対正常で最大だった。

出典: Lee, J. ほか, Diagnostics(2024)の表5と本文の数値を再構成しました。原論文はCC BY 4.0(https://creativecommons.org/licenses/by/4.0/)ライセンスで公開されています。

著者は、ベースラインに対する向上幅を、重度対正常73%、軽度対正常103%、重度+軽度対正常6%と報告しました。計算すると、0.737÷0.426=1.73、0.726÷0.358=2.03、0.715÷0.677=1.06です。最後の問題は、ベースラインがすでに高いため、向上幅が小さくなっています。

著者は、3つの問題の性能差は大きくないと自ら記しています。先行研究との比較にも注意が必要です。Framingham Heart Studyのデータを使った研究は、音響、言語、人口統計学的変数を一緒に入れてAUC 0.942を報告しました。別の研究は、人口統計学的変数のみを使ったAUC 0.773が、音響特徴を加えると0.812に上がったと報告しました。この論文は音響特徴のみを使い、PR-AUCを主指標にしたため、数値をそのまま比較するのは困難です。

重要な音響特徴: /i/のDDAシマーと/puh-tuh-kuh/のF0標準偏差

分類問題ごとのSHAP上位の特徴は次のとおりです。

重度対正常(DNN)

  • 1位は/i/課題のDDAシマーです。値が高いほど正常と予測しました。
  • /tuh-tuh-tuh/課題のF3平均が高いと重度と予測しました。
  • /α-α-α/課題のDDAシマーが高いと正常と予測しました。

軽度対正常(DNN)

  • 1位はやはり/i/課題のDDAシマーです。値が高いほど正常と予測しました。
  • /kuh-kuh-kuh/、/α/、/u/課題のシマー系の特徴も影響が大きいものでした。
  • /u/課題のAPQ5シマーが高いほど軽度と予測しました。

重度+軽度対正常(RF)

  • 1位は/puh-tuh-kuh/課題のstdevF0です。値が低いと認知機能低下、高いと正常と予測しました。
  • /i/課題のDDAシマーは、値が高いほど認知機能低下と予測しました。
  • /puh-tuh-kuh/課題のDDPジッターは、値が高いほど認知機能低下と予測しました。
  • /i/と/u/課題のF2中央値、/kuh-kuh-kuh/課題のF4中央値は、おおむね値が高いほど認知機能低下と予測しました。
  • /tuh-tuh-tuh/と/kuh-kuh-kuh/課題のAPQ3シマーは、値が高いほど正常と予測しました。

著者は、/i/課題のDDAシマーが複数の分類問題で重要になった点に注目しています。/i/という母音は、舌の位置を精密に制御し、声道を狭く保つ必要がある音です。/puh-tuh-kuh/は、唇音、歯茎音、軟口蓋音を素早く行き来する必要があるため、認知–運動の負担が大きくなります。著者は、stdevF0の重要度がこの負担を反映している可能性があると解釈しています。

筆者の見方では、1点指摘しておく必要があります。/i/課題のDDAシマーは3つの問題すべてで重要になりましたが、影響の方向は問題ごとに異なります。2つのDNNは値が高いほど正常と予測し、RFは値が高いほど認知機能低下と予測しました。シマーの値が高いと声が不安定であることを意味し、高齢になるほどシマーが大きくなるという先行研究もあります。そのため、この特徴を認知状態の指標として使うには、まず方向を再確認する必要があります。

意義と限界

何が変わるのか

この論文が新たに行ったことは次のとおりです。

  • 韓国語話者223名の音声で、認知状態の分類を試みた。
  • 母音課題とDDK課題の8つから184個の指標を抽出し、1つのモデルに一緒に入力した。
  • 人口統計学的変数や言語内容を使わず、音響特徴のみで、3つの問題すべてでベースラインより高いPR-AUCを得た。ただし向上幅は問題ごとに異なり、重度+軽度対正常では6%にとどまった。集団間の年齢と教育の差がこの結果に混在した可能性も、著者が明らかにしている。
  • 重度と軽度を別々に分け、分類問題ごとに重要な特徴を比較した。
  • 課題と特徴の組み合わせ単位で重要度を報告した。代表的な組み合わせは、/i/のDDAシマーと/puh-tuh-kuh/のstdevF0である。

実務家にとっての有用性

スクリーニングサービスを企画する実務家にとって、この論文は具体的な録音手順を提供します。8課題の内容、マイクの距離30 cm、周囲の騒音50 dB未満、サンプリング周波数44,100 Hzがすべて記されています。独自のデータを集めるときにこの条件にそのまま従えば、結果をこの論文と比較できます。

評価の方式も参考になります。集団の大きさが不均衡なときは、正確度だけでは判断が難しくなります。PR-AUCとベースラインを併記する方式は、他のスクリーニングモデルを評価するときにもすぐに使えます。

研究者にとっての有用性

研究者には、検証すべき仮説のリストができます。どの課題のどの特徴が認知状態と関連するのか、候補が絞られました。著者が提案する今後の研究の方向は次のとおりです。

  • 年齢を合わせた集団と、教育水準別の層別分析
  • 同じ人を複数年にわたり追跡する縦断研究
  • 人口統計学的変数を統計的に補正した分析
  • 複数の言語を比較し、音声指標が言語ごとに異なるかを確認する研究

論文が明らかにした限界

論文が自ら明らかにした限界は6つです。

  • 正常群のほうが若く、教育年数が長い。重要な特徴が認知機能低下ではなく、加齢や教育の効果を反映していた可能性がある。
  • 特徴ごとの集団差を統計的に検証していない。
  • 性能を既存のスクリーニング方法と比較していない。
  • 8課題をすべて行う時間が患者の負担になりうる。
  • 録音と分析の技術要件を標準化し、複数の臨床環境で測定の信頼性と再現性を確認する必要がある。
  • 標本が223名なので、性別による差のような詳細な分析にはより大きな研究が必要である。

著者はこうした理由から、結果を確定したバイオマーカーではなく概念実証(proof-of-concept)として読むべきだと記しています。データは進行中の研究の一部であるため、公開されていません。

筆者が考える適用条件

以下は論文に書かれた内容ではなく、筆者が実務での適用を念頭に付け加える条件です。

  • 比較群の年齢と教育年数を合わせる必要があります。合わせないと、モデルが若い声と年を取った声を区別しているのかどうかを確認できません。
  • テストデータの規模を確認する必要があります。論文は、問題ごとのテストデータの人数を別途記していません。学習データとテストデータを8:2に分けたので、テストデータは各問題の人数の一部にとどまります。この程度の規模では、性能の数値が揺れやすくなります。
  • 重要な特徴の方向が分類問題ごとに同じかどうかを、まず確認する必要があります。/i/のDDAシマーのように方向が変わる特徴は、スクリーニングのルールとして使いにくくなります。
  • 睡眠や視線のような他のデータと比較した内容は、この論文にはありません。論文は脳画像との対比のみを扱っています。音声が他のデータより安価で正確かどうかは、同じ対象者に複数のデータを一緒に集めて、費用と性能を比較しなければ判断できません。
  • 家庭で使うスクリーニングツールにするには、録音環境が変わります。この研究は騒音50 dB未満の統制された部屋で録音したので、日常の環境で同じ性能が出るかどうかは別途確認する必要があります。

すぐにやってみること

自分のデータでこの論文の手順をたどるときの最初のステップは、次の3つです。

  1. 分類問題ごとに、先にPR-AUCのベースラインを計算します。陽性の人数を全体の人数で割ればよいのです。この論文の重度対正常なら72÷(72+97)=0.426です。モデルの性能は、常にこのベースラインと並べて記載します。
  2. 集団を分けた直後に、年齢、教育年数、性別を比較します。論文のようにクラスカル=ウォリス検定とボンフェローニ補正の事後比較を使えば、正常群だけが若いかどうかをすぐに確認できます。
  3. 8課題を一度に行うのが難しければ、/i/の持続発声と/puh-tuh-kuh/の繰り返しの2課題から録音します。マイク30 cm、騒音50 dB未満、44,100 Hzの条件を守り、DDAシマーとstdevF0が集団ごとにどの方向に異なるかを確認します。

キーワード

関連記事