用睡眠记录预测认知障碍的LSTM

仅凭戒指式可穿戴设备的睡眠记录,能否筛查出认知障碍?本文整理了将5天记录合并输入的LSTM模型取得AUC 0.92的方法,以及SHAP所指出的睡眠指标。

本文译自韩文原文。 韩文原文

人到老年,记忆力都会逐渐下降。因此,很难区分正常衰老与可能发展为痴呆的早期认知障碍。筛查测试只能诊断测试当天的状态。基于患者数据的方法,如果患者拒绝参与,就可能只能使用不完整的数据。

前面讨论过的语音分析需要另外安排录音任务。这次要讨论的是戴在手指上的戒指式设备每晚留下的睡眠记录。问题是这样的:仅凭可穿戴设备每天积累的睡眠记录,能否筛出有认知障碍的人?

我们来读一篇回答这个问题的论文。

  • 标题:Prediction of Cognitive Impairment Using Sleep Lifelog Data and LSTM Model
  • 期刊:Mathematics
  • 年份:2024
  • DOI:10.3390/math12203208

论文提出的方法由两部分组成。前一部分把按天记录的睡眠数据转换成连续3天、4天、5天的数据块,输入长短期记忆(Long Short-Term Memory, LSTM)模型。该模型是一种神经网络,按日期顺序依次读入数值并边记忆边学习。后一部分使用沙普利加性解释(SHapley Additive exPlanations, SHAP),计算哪些睡眠指标推动了预测结果。

全文使用的术语如下。

  • 生活日志(lifelog):传感器在日常生活中自动记录的生活数据。本文中指睡眠记录。
  • 轻度认知障碍(Mild Cognitive Impairment, MCI):处于正常认知与痴呆之间的中间阶段,尚不至于妨碍日常生活,但可能发展为痴呆。
  • 正常认知(Normal Cognition, NC)与痴呆(Dementia, DE):数据中的诊断标签。论文将MCI和DE合并,作为”认知障碍组”处理。
  • 序列(sequence):把一个人连续几天的记录合成一个整体的学习单位。

动机:单一时间点的记录会漏掉缓慢出现的认知衰退

为什么认知障碍的早期发现很重要

论文给出的理由如下。

  • 老年人口快速增加,认知障碍患者也随之增多。
  • 每年有5–10%的MCI患者进展为痴呆。这一比例远高于一般人群。
  • 并非所有MCI都会发展为痴呆。尽早开始药物治疗或康复训练,可以延缓衰退,甚至恢复到正常。
  • 论文认为,早期发现可以预防痴呆,从而有助于降低社会和经济成本。但目前缺乏明确的标准来比较正常衰老与MCI。

使用最广泛的筛查工具是简易精神状态检查(Mini-Mental State Examination, MMSE),在韩国使用其韩国版K-MMSE。论文指出,这一工具对轻微症状的敏感度和特异度较低。论文还指出,它只诊断测试当天的状态,无法反映平时的行为。

既有研究没有涉及的部分

用数据发现认知障碍的研究分为两个方向。第一个方向是使用直接从患者身上获得的数据。其中包括对脑电图(Electroencephalography, EEG)应用模式识别的研究,以及利用语音信号的声学特征区分患者与健康人的研究。论文认为,这类数据会给老年人造成负担,难以持续收集。

第二个方向是使用生活日志。有研究利用腕带的活动和睡眠数据训练人工神经网络(Artificial Neural Network, ANN),对MCI进行分类。也有研究把养老机构的传感器数据输入多层感知机(Multilayer Perceptron, MLP),检测痴呆患者的异常行为。论文指出的空白如下。

  • 生活日志研究也只把单一时间点的值作为输入,没有利用每天积累的数据中的时间变化。
  • 研究集中在提高分类性能上,对哪些因素与认知障碍有关,解释不足。
  • 无法说明依据的模型很难直接用于医疗诊断。

方法:把按天的睡眠记录合成数天的序列,用LSTM分类,用SHAP解释

论文分三个步骤开展研究:收集睡眠生活日志并重构为时间序列,用LSTM对认知障碍分类,再用可解释人工智能找出产生影响的睡眠因素。本文把第一步拆成两步,整理为四个步骤,分别讨论确定睡眠指标和标签,以及构建序列并划分训练和测试数据。

图 1. 将按日睡眠记录合成3·4·5天序列,训练LSTM等7个模型并用SHAP解释的四步流程

数据与参与者

数据是韩国智能信息社会振兴院(NIA)的AI-Hub提供的「Wearable Lifelog of Dementia High Risk Group」。该数据可以从AI-Hub下载。它是300名55岁以上的人佩戴戒指式可穿戴设备留下的睡眠记录。诊断标签由专科医生综合诊断后给出。

每个人的记录时长为35天到122天。数据包含睡眠时间、血压、心率、呼吸等信息。缺失值和异常值已由数据提供机构处理,因此研究人员没有另行清洗。

分析使用的有174人,睡眠记录共12,183条。各诊断类别的人数如下。

  • 正常认知(NC):111人
  • 轻度认知障碍(MCI):51人
  • 痴呆(DE):12人

认知障碍组为51+12=63人,占全部的63÷174=36%,正常认知组为111÷174=64%。从300人中选出174人用于分析的标准,在依据材料中没有记载。

第1步:确定睡眠指标和诊断标签

  • 输入:每天一行的睡眠记录和诊断名称(NC、MCI、DE)
  • 处理:选定32个睡眠指标,将标签重新定义为两个组
  • 产出:带有32个变量和0/1标签的按日数据
  1. 研究人员确定了32个睡眠指标。他们参考了先前研究:认知障碍与昼夜颠倒、入睡困难、夜间频繁觉醒同时出现。
  2. 指标分为两组:26个睡眠质量指标和6个统计指标。
  3. 标签改为正常(0)和认知障碍(1)。MCI和DE合并为一组。

合并标签有两个原因。痴呆患者只有12人,分成三组会因类别不平衡而有性能下降的较大风险。此外,研究目标不是区分阶段,而是判断是否有认知障碍。

睡眠质量指标包括以下内容。

  • 清醒、深睡、浅睡、快速眼动(Rapid Eye Movement, REM)睡眠的时长(秒)
  • 睡眠效率:总睡眠时间 ÷ 睡眠时间 × 100
  • 入睡所用时间、翻身比例(%)、皮肤温度偏差
  • start1–6、end1–6:入睡时刻和醒来时刻,落在把一天按4小时划分的六个时段中的哪一个(0或1)

统计指标是每分钟平均呼吸次数、每分钟心率的平均值、最小值、最大值和中位数,以及平均心率变异性(rmssd_average,毫秒)。

原始数据一行的样子可以在论文表2中看到。第一行是一位MCI患者的一个夜晚。上床开始时间为18:38:28,结束时间为05:10:28,清醒时间为8,700秒,总睡眠为29,220秒。这样的按日数据行,连同32个指标和诊断标签,构成了训练数据。

第2步:重构为数天的序列并留出测试数据

  • 输入:第1步的按日数据12,183条
  • 处理:按人连续取3天、4天、5天组成数据块,将最后一周分出作测试用,对训练数据做欠采样
  • 产出:各长度的训练序列和测试序列
  1. 研究人员把每个人连续日期的记录按3天、4天、5天为单位组合。
  2. 每位参与者最后一周的记录留作测试数据,其余用于训练。
  3. 训练数据中正常组较多。因此采用只保留部分正常组的简单欠采样,使两组规模一致。

合并成序列,是因为认知障碍是逐渐出现的。目的是在数天的数据块中找到单日数值看不到的生活模式变化。

第3步:LSTM训练与对比模型

  • 输入:第2步中各长度的训练序列
  • 处理:用网格搜索(grid search)确定超参数,训练LSTM,训练4个不使用时间序列的对比模型
  • 产出:3天、4天、5天LSTM共3个模型和4个对比模型,共7个模型

LSTM每接收一天的输入,就会修改作为”记忆盒”的细胞状态(cell state)。这一过程分为四步,如下。

  1. 遗忘门:用0到1之间的值决定要从之前的记忆中擦除多少。
  2. 输入门:根据今天的输入生成新的候选内容,并决定存入多少。
  3. 细胞状态更新:把保留的记忆与新存入的信息相加,形成今天的记忆。
  4. 输出门:决定从今天的记忆中向下一步传递什么值。

这种结构使LSTM减轻了普通循环神经网络遗忘久远过去的问题。因此它适合随时间变化的睡眠记录。

  1. 研究人员组合了64、128、256个LSTM单元,32、64、128个全连接层单元,以及0.001到0.01的学习率,进行网格搜索。
  2. 最终模型是LSTM层128单元、全连接层64单元,以及用于二分类的输出层。
  3. 优化方法为Adam,学习率为0.001。这是准确率与验证损失之间平衡最好的设置。
  4. 作为对比,构建了支持向量机(Support Vector Machine, SVM)、逻辑回归(Logistic Regression, LR)、随机森林(Random Forest, RF)和XGBoost。这些模型不反映时间序列特征。超参数通过H2O AutoML库(H2O 3.46.0.1)确定。

数据只有174人,规模较小,存在过拟合(只拟合训练数据,在新数据上性能下降的现象)风险。因此训练中采用了早停(early stopping)。

第4步:性能评估与SHAP解释

  • 输入:训练好的7个模型和测试序列
  • 处理:计算分类指标,计算前K名精确率,对性能最好的模型应用Deep SHAP
  • 产出:各模型的性能表、precision@100、各指标的重要性和影响方向

分类指标的含义如下。

  • 敏感度:实际有认知障碍的样本中,模型判为认知障碍的比例。TP ÷ (TP + FN)
  • 特异度:实际正常的样本中,模型判为正常的比例。TN ÷ (TN + FP)
  • 精确率:模型判为认知障碍的样本中,实际为认知障碍的比例
  • F1分数:同时反映精确率和召回率(敏感度)的值
  • AUC(Area Under the Curve):不断改变判定阈值所绘制的受试者工作特征(Receiver Operating Characteristic, ROC)曲线下的面积。越接近1越好

这里,TP是把认知障碍判为认知障碍的情形,FN是把认知障碍漏判为正常的情形。TN是把正常判为正常的情形,FP是把正常误判为认知障碍的情形。

模型输出0到1之间的预测分数。分数高于0.5判为认知障碍,低于则判为正常。前K名精确率(precision@K)是把预测分数按从高到低排序后,排在前面的K个人中实际为认知障碍患者的比例。

SHAP利用合作博弈论的沙普利值来分配各指标的贡献。它从所有指标都缺失的基准值出发,计算逐个加入指标时预测变化多少,并考虑所有加入顺序后取平均。把所有指标的SHAP值加到基准值上,就得到原来的预测值。研究人员使用了适用于神经网络的Deep SHAP。

变体与情景

论文改变的条件是序列长度。同一个LSTM结构分别以3天、4天、5天的数据块训练。超参数也针对每种长度分别通过网格搜索确定。长度不同时性能如何变化,将在结果中讨论。

结果:5天序列LSTM的敏感度为0.89、AUC为0.92,高于对比模型

LSTM与不使用时间序列的模型的比较

研究人员先用敏感度、特异度和F1分数比较了7个模型。数值接近时,再用AUC比较。下面两张表是将Hong等(2024)的表5为适应手机屏幕而拆成两张后重新整理的。原论文以CC BY 4.0许可证公开。

图 2. 以每位参与者的最后一周测试时,5天序列LSTM的敏感度和AUC高于对比模型,特异度与随机森林差距较小
模型敏感度特异度AUC
LSTM(3天)0.870.740.88
LSTM(4天)0.890.770.91
LSTM(5天)0.890.800.92
XGBoost0.680.760.81
随机森林0.670.770.81
逻辑回归0.590.600.63
SVM0.620.590.64

出处:Junhee Hong 等,“Prediction of Cognitive Impairment Using Sleep Lifelog Data and LSTM Model”,Mathematics (2024) 表5,经重新整理。CC BY 4.0

模型准确率精确率F1
LSTM(3天)0.810.770.82
LSTM(4天)0.830.800.84
LSTM(5天)0.850.820.85
XGBoost0.720.740.71
随机森林0.720.750.71
逻辑回归0.600.600.60
SVM0.610.600.61

出处:同一论文的表5,经重新整理。CC BY 4.0

最大的差距出现在敏感度上。5天LSTM为0.89,XGBoost为0.68。在这份测试数据上,LSTM的敏感度更高。不过这是在同一份测试数据上测量一次的结果,而且设计是同一个人同时出现在训练和测试中。

特异度方面,5天LSTM为0.80,随机森林为0.77,XGBoost为0.76。3天LSTM的特异度0.74低于两个树模型。在笔者看来,特异度上的差距不像敏感度那样大。

不同序列长度的差异

LSTM之间比较,合并的天数越长,指标越好。AUC为3天0.88、4天0.91、5天0.92。特异度依次升至0.74、0.77、0.80。敏感度在4天和5天都是0.89。

在这次测试中,长度越长,特异度和AUC越高。不过每种长度只测试了一次,很难断定这是长度本身的效果。论文将5天LSTM定为最终模型。论文只构建了3天、4天、5天的序列。

前100名精确率

研究人员按预测分数从高到低选出100人,确认其中实际患者有多少。LSTM的precision@100为96%。前100人中有96人实际有认知障碍(96÷100=96%)。

这一指标适合需要对接受精密检查的人排出优先顺序的情形。在对比模型中,随机森林和XGBoost即使不使用时间序列,也找得相对较好。各模型的确切数值在依据材料中没有以数字给出。

也有预测分数的示例。两名MCI患者的分数为0.999999。论文的示例表中,有一例分数为0.756962的正常人被误分类为认知障碍。

成为信号的睡眠指标

研究人员对5天LSTM应用了SHAP,给出两种结果。

  • 汇总图:为每个指标绘出SHAP值的分布,指标值高用红色,低用蓝色表示。越向右分散,将预测推向认知障碍一侧的影响越大。
  • 条形图:为每个指标把SHAP绝对值的平均值画成条形。表示其在整体预测中的重要性。

按重要性排序,前五个指标如下。

  1. 每分钟平均呼吸次数
  2. 心率变异性(Heart Rate Variability, HRV)
  3. REM睡眠时间
  4. 深睡时间
  5. 翻身比例

影响方向也得到了确认。呼吸次数越多、翻身越频繁,模型对认知障碍风险的判断越高。REM睡眠和深睡越短、浅睡越长,风险越高。HRV越低,预测风险越高。

对前两个指标的医学依据较弱。对于排名第一的呼吸次数,论文在结果讨论中没有给出另外的医学依据。只是在指标选择阶段,把它作为反映睡眠质量的生理指标引用了先前研究。排名第二的HRV,也仅提到有文献认为它与睡眠和整体健康密切相关。

论文引用的临床研究是关于REM睡眠的间接依据。有研究表明,REM睡眠期间进入大脑皮层毛细血管的红细胞大幅增加。论文以这项研究为基础,解释为支持REM睡眠剥夺会加速认知衰退的观点。也有研究表明,睡眠不足与淀粉样蛋白和不溶性tau蛋白的增加有关。

有一点需要注意。论文的摘要段落列出的影响较大的指标是呼吸次数、REM睡眠、翻身和浅睡。这与条形图的前五名构成略有不同。阅读时以条形图的顺序为准比较稳妥。

意义与局限

有什么不同

  • 把按天的睡眠记录转换为连续3天、4天、5天的数据块进行训练。这与使用单一时间点数值的生活日志研究不同。
  • 与不使用时间序列的SVM、逻辑回归、随机森林和XGBoost,在同一数据上做了比较。结果是LSTM的敏感度和AUC更高。
  • 用Deep SHAP同时给出睡眠指标的重要性和影响方向。
  • 没有另设测试任务。只使用设备在无需患者积极参与的情况下自动(被动)收集的数据。

对从业者的用处

语音分析需要经过录音这一任务。睡眠生活日志只要戴着设备睡觉就能积累。论文认为,可穿戴设备无需患者积极参与即可收集数据,因此负担小、可持续性高。

笔者认为,precision@100为96%这一结果,提示它有可能用于先筛出精密诊断对象的筛查用途。但是,同一个人同时出现在训练和测试中,因此对新人群的泛化性尚未得到确认。测试数据中认知障碍的比例,在依据材料中也没有给出。论文也说明没有在实际医疗现场验证。

SHAP结果可以作为参考材料,解释模型对哪些指标有反应。但是它没有经过临床验证,显示出的是相关性而非因果。论文给出的也不是个体层面的解释,而是针对整体数据的重要性汇总。

对研究者的用处

改变序列长度及与之匹配的超参数后,AUC从0.88变为0.92。这提示合并的时间跨度可以成为实验变量。但没有重复测量,很难断定。

分析所用数据可以从AI-Hub下载。论文说明,是以2023年5月1日为基准访问了AI-Hub的数据。论文提出的后续课题是测试门控循环单元(Gated Recurrent Unit, GRU)或注意力结构等其他模型。

论文自述的局限

论文自己说明的局限有三点。

  • 样本为174人。过拟合风险大,因此使用了早停。需要增加数据以减轻不平衡,并区分认知障碍的阶段。
  • 只使用了一两个月的记录。考虑到从轻度发展到重度的时间,这个时间偏短。若同时使用数年的数据以及脑影像、语音和基因信息,可能更准确。
  • 没有在实际医疗现场测试。需要在临床环境中验证。

笔者看到的应用条件

以下不是论文中写的内容,而是笔者着眼于实际应用而补充的条件。

  • 测试数据是每位参与者的最后一周。同一个人同时出现在训练和测试中。对于从未见过的人是否也能得到同样的性能,需要按人划分数据后重新确认。
  • 使用的是缺失值和异常值已经处理过的数据。实际监测中会出现没戴设备就睡觉的夜晚。需要先确定连续5天的数据块中断时的处理规则。
  • 使用戒指式可穿戴设备的指标进行训练。其他设备在REM睡眠或翻身比例的计算方式上可能不同。更换设备时,重新训练比较稳妥。
  • SHAP结果是模型看到的相关性。不能把它当作呼吸次数导致认知障碍的因果依据。
  • 判定阈值0.5是固定值。如果用于筛查,应降低阈值以减少漏掉的患者,同时确认此时特异度会下降多少。

马上可以做的事

  1. 把睡眠记录整理成每天一行的表。 从手头的可穿戴设备数据中,先把清醒时间、深睡、浅睡、REM睡眠、翻身比例、平均呼吸次数、平均HRV做成列。确认论文的32个指标中能获得几个。
  2. 把单一时间点模型与5天序列模型并排比较。 每个人最后一周留作测试用。用单日数值训练随机森林,用连续5天的数据块训练LSTM,然后把敏感度、特异度、AUC放在同一张表里。
  3. 确认前五个指标。 对性能最好的模型应用SHAP,绘制条形图。比较其与论文的呼吸次数、HRV、REM睡眠、深睡、翻身在顺序上有多少重合。

商业智能实验室(Business Intelligence Lab)博客每次解读一篇用数据读懂技术与人的论文。下一篇文章中,我们也会同时跟随方法的步骤和结果的数字。

关键词

相关文章