睡眠記録から認知障害を予測するLSTM

リング型ウェアラブルの睡眠記録だけで認知障害を見分けられるのか。5日分の記録をまとめたLSTMがAUC 0.92を記録した方法と、SHAPが示した睡眠指標を整理する。

韓国語の原文から翻訳しました。 韓国語の原文

年を重ねれば、誰でも記憶力が少しずつ落ちていきます。そのため、正常な加齢と、認知症につながりうる初期の認知障害を見分けるのは難しいことです。スクリーニング検査で分かるのは、検査当日の状態だけです。患者データに基づくアプローチでは、患者が参加を拒否すると不完全なデータを使うことになりかねません。

前回扱った音声分析には、録音という別個の課題が必要でした。今回は、指にはめるリング型デバイスが毎晩残す睡眠記録を扱います。問いは次のとおりです。ウェアラブルが毎日蓄積する睡眠記録だけで、認知障害のある人を見つけ出せるでしょうか?

この問いに答えた論文を1本読んでみます。

  • タイトル: Prediction of Cognitive Impairment Using Sleep Lifelog Data and LSTM Model
  • 学術誌: Mathematics
  • 年: 2024
  • DOI: 10.3390/math12203208

論文が提案する方法は二つの部分から成ります。前半では、1日単位の睡眠記録を3日・4日・5日の連続したまとまりに変換し、長短期記憶(Long Short-Term Memory, LSTM)モデルに入力します。このモデルは、日付順に入ってくる値を記憶しながら学習するニューラルネットワークです。後半では、シャープレイ加法的説明(SHapley Additive exPlanations, SHAP)を用いて、どの睡眠指標が予測を動かしたのかを計算します。

この記事全体で使う用語は次のとおりです。

  • ライフログ(lifelog): 日常生活の中でセンサーが自動的に記録した生活データ。この記事では睡眠記録を指します。
  • 軽度認知障害(Mild Cognitive Impairment, MCI): 日常生活に支障をきたすほどではないものの、認知症につながりうる、正常な認知と認知症の中間段階。
  • 正常認知(Normal Cognition, NC)と認知症(Dementia, DE): データの診断ラベルです。論文はMCIとDEをまとめて「認知障害群」として扱います。
  • シーケンス(sequence): 一人の連続した数日分の記録を一つにまとめた学習単位。

動機: 一時点の記録では、ゆるやかに進む認知機能の低下を見逃す

なぜ認知障害の早期発見が重要なのか

論文が挙げる理由は次のとおりです。

  • 高齢人口が急速に増え、認知障害の患者も増えました。
  • MCI患者の5–10%が毎年認知症に進行します。この割合は一般人口よりはるかに高いものです。
  • MCIのすべてが認知症に進むわけではありません。早期に薬物療法やリハビリを始めれば、低下を遅らせたり、正常に戻したりできます。
  • 論文は、早期発見が認知症を予防し、社会的・経済的コストの削減に寄与しうると考えています。しかし、正常な加齢とMCIを比較するための明確な基準はありません。

最も広く使われているスクリーニングツールは、ミニメンタルステート検査(Mini-Mental State Examination, MMSE)で、韓国では韓国版のK-MMSEが使われています。論文は、このツールは軽い症状に対する感度と特異度が低いと指摘しています。また、検査当日の状態しか診断できず、普段の行動は扱えない点も挙げています。

既存研究が扱っていない部分

データで認知障害を見つける研究は、二つの方向に分かれます。第一は、患者から直接得たデータを使う方向です。脳波(Electroencephalography, EEG)にパターン認識を適用した研究や、音声信号の音響特徴で患者と健常者を区別した研究がこれに当たります。論文は、こうしたデータは高齢者の負担になり、継続的に集めにくいと見ています。

第二は、ライフログを使う方向です。リストバンドの活動・睡眠データで人工ニューラルネットワーク(Artificial Neural Network, ANN)を学習し、MCIを分類した研究があります。介護施設のセンサーデータを多層パーセプトロン(Multilayer Perceptron, MLP)に入力し、認知症患者の異常行動を検出した研究もあります。論文が指摘する空白は次のとおりです。

  • ライフログ研究も、一時点の値だけを入力に使っていました。日々蓄積されるデータの時間変化を活用していませんでした。
  • 分類性能を高めることに集中していました。どの要因が認知障害と関連するのかという解釈は不足していました。
  • 根拠を説明できないモデルは、医療診断にそのまま使うのが難しいものです。

方法: 1日単位の睡眠記録を数日分のシーケンスにまとめてLSTMで分類し、SHAPで解釈する

論文は研究を三つの段階で進めました。睡眠ライフログを集めて時系列として再構成し、LSTMで認知障害を分類し、説明可能なAIで影響を与えた睡眠要因を探ります。この記事では最初の段階を二つに分け、四つの段階に整理しました。睡眠指標とラベルを決める作業と、シーケンスを作って学習・テストデータを分ける作業を、別々に扱います。

図 1. 日別の睡眠記録を3・4・5日のシーケンスにまとめ、LSTMなど7個のモデルを学習してSHAPで解釈する4段階の手順

データと参加者

データは、韓国知能情報社会振興院のAI-Hubが提供する「Wearable Lifelog of Dementia High Risk Group」です。このデータはAI-Hubから入手できます。55歳以上の300人がリング型ウェアラブルを着けて残した睡眠記録です。診断ラベルは、専門医の総合診断によって付けられています。

一人あたりの記録期間は35日から122日です。睡眠時間、血圧、心拍、呼吸などの情報が含まれています。欠損値と外れ値は、提供機関がすでに処理しています。そのため、研究チームは別途クレンジングを行いませんでした。

分析に使った人数は174人、睡眠記録は12,183件です。診断別の人数は次のとおりです。

  • 正常認知(NC): 111人
  • 軽度認知障害(MCI): 51人
  • 認知症(DE): 12人

認知障害群は51+12=63人です。全体の63÷174=36%で、正常認知群は111÷174=64%です。300人のうち174人を分析に使った基準は、根拠には書かれていません。

ステップ1: 睡眠指標と診断ラベルを決める

  • 入力: 1日1行の睡眠記録と診断名(NC, MCI, DE)
  • 処理: 睡眠指標32個を選定し、ラベルを二つの群に再定義
  • 出力: 32個の変数と0/1ラベルが付いた日別データ
  1. 研究チームは睡眠指標32個を定めました。認知障害が昼夜逆転、入眠困難、頻繁な夜間覚醒を伴うという先行研究を参考にしています。
  2. 指標を二つのグループに分けました。睡眠の質の指標26個と、統計指標6個です。
  3. ラベルを正常(0)と認知障害(1)に変えました。MCIとDEを一つの群にまとめています。

ラベルをまとめた理由は二つです。認知症患者が12人しかおらず、三つの群に分けると不均衡のために性能が落ちる危険が大きかったためです。また、研究の目標が段階の区別ではなく、認知障害があるかどうかだったためでもあります。

睡眠の質の指標には次のものが含まれます。

  • 覚醒時間、深い睡眠、浅い睡眠、レム(Rapid Eye Movement, REM)睡眠時間(秒)
  • 睡眠効率: 総睡眠時間 ÷ 睡眠時間 × 100
  • 入眠までにかかった時間、寝返りの割合(%)、皮膚温の偏差
  • start1–6, end1–6: 入眠時刻と起床時刻が、1日を4時間ずつに分けた六つの区間のどこに入るか(0または1)

統計指標は、1分あたりの平均呼吸数、1分あたりの心拍の平均・最小値・最大値・中央値、平均心拍変動(rmssd_average, ミリ秒)です。

元データの1行の様子は、論文の表2で確認できます。最初の行はMCI患者のある一晩です。就床開始は18:38:28、終了は05:10:28で、覚醒時間は8,700秒、総睡眠は29,220秒です。こうした日別の行が、32個の指標と診断ラベルを含む学習データになります。

ステップ2: 数日分のシーケンスに再構成し、テストデータを取り分ける

  • 入力: ステップ1の日別データ12,183件
  • 処理: 人ごとに連続3日・4日・5日ずつまとめる、最後の1週間をテスト用に分離、学習データをアンダーサンプリング
  • 出力: 長さ別の学習シーケンスとテストシーケンス
  1. 研究チームは、人ごとに連続した日付の記録を3日・4日・5日単位でまとめました。
  2. 各参加者の最後の1週間の記録を取り分けて、テストデータとしました。残りは学習に使いました。
  3. 学習データでは正常群が多くなっています。そこで、正常群の一部だけを残す単純なアンダーサンプリングで、二つの群の大きさを揃えました。

シーケンスにまとめた理由は、認知障害がゆっくりと現れるためです。1日分の値では見えない生活パターンの流れを、数日分のまとまりから見つけようとしています。

ステップ3: LSTMの学習と比較モデル

  • 入力: ステップ2の長さ別の学習シーケンス
  • 処理: グリッドサーチ(grid search)でハイパーパラメータを決定、LSTMを学習、時系列を使わない比較モデル4個を学習
  • 出力: 3日・4日・5日のLSTM 3個と比較モデル4個、計7個のモデル

LSTMは、毎日の入力を受け取るたびに、「記憶の箱」であるセル状態(cell state)を更新します。この過程を四つの段階で説明すると次のとおりです。

  1. 忘却ゲート: 前日までの記憶のうち、どれだけ消すかを0から1の間の値で決めます。
  2. 入力ゲート: 今日の入力から新しく取り込む候補を作り、どれだけ取り込むかを決めます。
  3. セル状態の更新: 残した記憶と新しく取り込む情報を足して、今日の記憶を作ります。
  4. 出力ゲート: 今日の記憶から、次の段階に渡す値を決めます。

この構造のおかげで、LSTMは通常のリカレントニューラルネットワークが遠い過去を忘れてしまう問題を軽減します。そのため、時間とともに変化する睡眠記録に合っています。

  1. 研究チームは、LSTMユニット64・128・256個、全結合層ユニット32・64・128個、学習率0.001から0.01を組み合わせてグリッドサーチを行いました。
  2. 最終モデルは、LSTM層128ユニット、全結合層64ユニット、二値分類用の出力層です。
  3. 最適化手法はAdamで、学習率は0.001です。精度と検証損失のバランスが最も良い設定でした。
  4. 比較用に、サポートベクターマシン(Support Vector Machine, SVM)、ロジスティック回帰(Logistic Regression, LR)、ランダムフォレスト(Random Forest, RF)、XGBoostを作りました。これらのモデルは時系列の特性を反映しません。設定値はH2O AutoMLライブラリ(H2O 3.46.0.1)で決めました。

データが174人と小さく、過学習(学習データにだけ合って、新しいデータで性能が落ちる現象)の危険がありました。そのため、学習中に早期終了(early stopping)を適用しました。

ステップ4: 性能評価とSHAPによる解釈

  • 入力: 学習済みの7個のモデルとテストシーケンス
  • 処理: 分類指標を計算、上位K人の適合率を計算、最も性能が良いモデルにDeep SHAPを適用
  • 出力: モデル別の性能表、precision@100、指標別の重要度と影響の方向

分類指標の意味は次のとおりです。

  • 感度: 実際に認知障害である事例のうち、モデルが認知障害と正しく判定した割合。TP ÷ (TP + FN)
  • 特異度: 実際に正常である事例のうち、モデルが正常と正しく判定した割合。TN ÷ (TN + FP)
  • 適合率: モデルが認知障害と判定した事例のうち、実際に認知障害である割合
  • F1スコア: 適合率と再現率(感度)を併せて反映した値
  • AUC(Area Under the Curve): 判定基準を変えながら描いた受信者動作特性(Receiver Operating Characteristic, ROC)曲線の下の面積。1に近いほど良い

ここで、TPは認知障害を認知障害と正しく判定した場合、FNは認知障害を正常と見逃した場合です。TNは正常を正常と正しく判定した場合、FPは正常を認知障害と誤って判定した場合です。

モデルは0と1の間の予測スコアを出力します。スコアが0.5を超えれば認知障害、下回れば正常と判定します。上位K人の適合率(precision@K)は、予測スコアを高い順に並べたとき、上からK人のうち実際に認知障害の患者である割合です。

SHAPは、協力ゲーム理論のシャープレイ値で、各指標の寄与を分配します。すべての指標が抜けた基準値から出発します。指標を一つずつ加えたときに予測がどれだけ変わるかを求め、加える順序をすべて考慮して平均します。基準値にすべての指標のSHAP値を足すと、元の予測値になります。研究チームは、ニューラルネットワーク向けのDeep SHAPを使いました。

変形とシナリオ

論文が変えた条件は、シーケンスの長さです。同じLSTM構造を3日・4日・5日のまとまりでそれぞれ学習しました。ハイパーパラメータも、長さごとにグリッドサーチで別々に探しました。長さによって性能がどう変わったかは、結果で扱います。

結果: 5日シーケンスのLSTMは感度0.89、AUC 0.92で、比較モデルより高かった

LSTMと時系列を使わないモデルの比較

研究チームは、7個のモデルをまず感度、特異度、F1スコアで比較しました。値が近い場合は、AUCで改めて比較しました。以下の二つの表は、Hong 外(2024)の表5をモバイル画面に合わせて二つに分けて再構成したものです。原論文はCC BY 4.0ライセンスで公開されています。

図 2. 各参加者の最後の1週間でテストしたとき、5日シーケンスLSTMの感度とAUCは比較モデルより高く、特異度はランダムフォレストとの差が小さかった
モデル感度特異度AUC
LSTM(3日)0.870.740.88
LSTM(4日)0.890.770.91
LSTM(5日)0.890.800.92
XGBoost0.680.760.81
ランダムフォレスト0.670.770.81
ロジスティック回帰0.590.600.63
SVM0.620.590.64

出典: Junhee Hong 外, “Prediction of Cognitive Impairment Using Sleep Lifelog Data and LSTM Model”, Mathematics (2024)の表5を再構成。CC BY 4.0

モデル正解率適合率F1
LSTM(3日)0.810.770.82
LSTM(4日)0.830.800.84
LSTM(5日)0.850.820.85
XGBoost0.720.740.71
ランダムフォレスト0.720.750.71
ロジスティック回帰0.600.600.60
SVM0.610.600.61

出典: 同論文の表5を再構成。CC BY 4.0

最も大きな差は感度に現れました。5日LSTMは0.89で、XGBoostは0.68です。このテストデータでは、LSTMの感度のほうが高くなりました。ただし、同じテストデータで1回測定した結果であり、同じ人が学習とテストの両方に入る設計です。

特異度は、5日LSTMが0.80、ランダムフォレストが0.77、XGBoostが0.76です。3日LSTMの特異度0.74は、二つのツリーモデルより低くなっています。筆者の見方では、特異度では感度ほど大きな差は出ませんでした。

シーケンスの長さによる違い

LSTM同士で比較すると、まとめる日数が長いほど指標が良くなりました。AUCは3日が0.88、4日が0.91、5日が0.92です。特異度は0.74、0.77、0.80と上がりました。感度は4日と5日が0.89で同じです。

このテストでは、長さが長いほど特異度とAUCが高くなりました。ただし、長さごとに1回ずつテストした結果であるため、長さそのものの効果と断定するのは難しいでしょう。論文は5日LSTMを最終モデルに選びました。論文は3日・4日・5日のシーケンスだけを構成しています。

上位100人の適合率

研究チームは、予測スコアが高い順に100人を選んだとき、実際の患者が何人いるかを確認しました。LSTMのprecision@100は96%です。上位100人のうち96人が、実際に認知障害でした(96÷100=96%)。

この指標は、精密検査を受ける人に優先順位を付けて絞り込む必要がある状況に合っています。比較モデルの中では、ランダムフォレストとXGBoostが、時系列なしでも比較的よく見つけました。モデル別の正確な値は、根拠に数値として示されていません。

予測スコアの例もあります。MCI患者2人のスコアは0.999999でした。論文の例示表には、スコア0.756962の正常な人が認知障害と誤って分類された事例があります。

シグナルとなった睡眠指標

研究チームは、5日LSTMにSHAPを適用しました。二つの結果を出しています。

  • サマリープロット: 指標ごとにSHAP値の分布を描き、指標の値が高ければ赤、低ければ青で表示します。右に広がるほど、認知障害の方向へ押す影響が大きいことを示します。
  • 棒グラフ: 指標ごとにSHAP値の絶対値の平均を棒で描きます。予測全体における重要度です。

重要度順の上位5指標は次のとおりです。

  1. 1分あたりの平均呼吸数
  2. 心拍変動(Heart Rate Variability, HRV)
  3. REM睡眠時間
  4. 深い睡眠の時間
  5. 寝返りの割合

影響の方向も確認されました。呼吸数が多いほど、寝返りが多いほど、モデルは認知障害のリスクを高く見ました。REM睡眠と深い睡眠が短く、浅い睡眠が長いほど、リスクが高く出ました。HRVが低いほど、予測リスクが高くなりました。

上位二つの指標に対する医学的根拠は弱いものです。1位の呼吸数について、論文は結果の議論で別の医学的根拠を挙げていません。指標選定の段階で、睡眠の質を表す生理指標として先行研究を引用しただけです。2位のHRVも、睡眠や全般的な健康と密接に関係するという文献に言及するにとどまります。

論文が引用した臨床研究は、REM睡眠に関する間接的な根拠です。REM睡眠中には、大脳皮質の毛細血管に入る赤血球が大きく増えるという研究があります。論文はこの研究を基に、REM睡眠の剥奪が認知機能の低下を加速するという見解を支持すると解釈しました。睡眠不足がアミロイドと不溶性タウタンパク質の増加に結びつくという研究もあります。

一つ注意点があります。論文の要約の段落は、影響が大きい指標として、呼吸数、REM睡眠、寝返り、浅い睡眠を挙げています。棒グラフの上位5指標とは、構成が少し異なります。読むときは、棒グラフの順序を基準にするのが安全です。

意義と限界

何が変わるのか

  • 1日単位の睡眠記録を、3日・4日・5日の連続したまとまりに変換して学習しました。単一時点の値を使っていたライフログ研究との違いです。
  • 時系列を使わないSVM、ロジスティック回帰、ランダムフォレスト、XGBoostと、同じデータで比較しました。その結果、LSTMの感度とAUCのほうが高くなりました。
  • Deep SHAPで、睡眠指標の重要度と影響の方向を併せて示しました。
  • 検査課題を別途設けていません。患者の積極的な参加なしに、デバイスが自動的に(受動的に)集めたデータだけを使いました。

実務者にとっての有用性

音声分析は、録音という課題を経なければなりませんでした。睡眠ライフログは、デバイスを着けて眠るだけで蓄積されます。論文は、ウェアラブルが患者の積極的な参加なしにデータを集めるため、負担が少なく継続性が高いと見ています。

筆者は、precision@100が96%という結果が、精密診断の対象をまず絞り込むスクリーニング用途に使われる可能性を示唆していると考えます。ただし、同じ人が学習とテストの両方に含まれているため、新しい人への一般化は確認されていません。テストデータにおける認知障害の割合も、根拠には出てきません。論文も、実際の医療現場では検証していないと明らかにしています。

SHAPの結果は、モデルがどの指標に反応したかを解きほぐして見せる参考資料になりえます。ただし、臨床的な検証はされておらず、現れているのは因果ではなく関連性です。また、論文が示したのは個人別の説明ではなく、データ全体に対する重要度の要約です。

研究者にとっての有用性

シーケンスの長さと、それに合わせたハイパーパラメータを変えたとき、AUCは0.88から0.92に変わりました。まとめる期間が実験変数になりうることを示唆しています。ただし、反復測定なしに断定するのは難しいでしょう。

分析に使ったデータはAI-Hubから入手できます。論文は、AI-Hubのデータに2023年5月1日時点でアクセスしたと明らかにしています。論文が提案する今後の課題は、ゲート付きリカレントユニット(Gated Recurrent Unit, GRU)やアテンション構造など、他のモデルの検証です。

論文が明らかにしている限界

論文自身が明らかにしている限界は三つです。

  • 標本が174人です。過学習の危険が大きく、早期終了を使いました。データを増やして不均衡を減らし、認知障害の段階を区別する必要があります。
  • 1〜2か月分の記録しか使っていません。軽度から重度へ進行する期間を考えると短いものです。数年単位のデータや、脳画像、音声、遺伝情報を併せて使えば、より正確になる可能性があります。
  • 実際の医療現場でテストしていません。臨床環境で検証する必要があります。

筆者が考える適用条件

以下は論文に書かれた内容ではなく、筆者が実務への適用を念頭に置いて付け加える条件です。

  • テストデータは、各参加者の最後の1週間です。同じ人が学習とテストの両方に入っています。初めて見る人でも同じ性能が出るかどうかは、人単位でデータを分けて、改めて確認する必要があります。
  • 欠損値と外れ値がすでに処理されたデータを使っています。実際のモニタリングでは、デバイスを外して寝る夜が生じます。連続5日のまとまりが途切れたときの処理ルールを、先に決めておく必要があります。
  • リング型ウェアラブルデバイスの指標で学習しました。他のデバイスは、REM睡眠や寝返りの割合の計算方法が異なる可能性があります。デバイスを変えたら、再学習するほうが安全です。
  • SHAPの結果は、モデルが見た関連性です。呼吸数が認知障害を引き起こすという因果の根拠として読んではいけません。
  • 判定基準の0.5は固定値です。スクリーニング用途なら、見逃す患者を減らすよう基準を下げ、そのとき特異度がどれだけ下がるかも併せて確認する必要があります。

すぐに試してみること

  1. 睡眠記録を1日1行の表に整理する。 手元のウェアラブルデータから、覚醒時間、深い睡眠、浅い睡眠、REM睡眠、寝返りの割合、平均呼吸数、平均HRVを、まず列にします。論文の32個の指標のうち、いくつを確保できるかを確認します。
  2. 単一時点のモデルと5日シーケンスのモデルを並べて比較する。 人ごとに最後の1週間をテスト用に取り分けます。1日分の値でランダムフォレストを、連続5日のまとまりでLSTMを学習したうえで、感度、特異度、AUCを同じ表に並べます。
  3. 上位5指標を確認する。 最も性能が良いモデルにSHAPを適用し、棒グラフを描きます。論文の呼吸数、HRV、REM睡眠、深い睡眠、寝返りと、順序がどれだけ重なるかを比較します。

ビジネスインテリジェンスラボのブログは、データで技術と人を読み解く論文を1本ずつ解説します。次の記事でも、方法のステップと結果の数字を併せて追っていきます。

キーワード

関連記事