孔洁 李树铁 赵丹 赵启敏 任东静
目的:探索异质性认知轨迹,并构建可解释的机器学习模型,预测中老年人在社区层面的长期认知轨迹。
方法:回顾性收集了 2011 年至 2020 年间中国健康与退休纵向研究(CHARLS)数据。共纳入 1 954 名 5 波认
知评价资料完整的受试者(训练组:1 367 名,验证组:587 名)。采用生长混合模型(GMM)识别认知轨迹,
并基于人口学特征建立机器学习模型用于预测不同轨迹。本研究使用最小绝对值收敛和选择算子(LASSO)算法、
Boruta 算法筛选最优特征子集,并都通过 LGBM(LightGBM)这一机器学习算法建立预测模型。模型验证中,
使用受试者工作特征(ROC)曲线下面积(AUC)比较模型判别能力,最后使用沙普利加和解释(SHAP)算
法解释最佳模型决策的潜在机制。结果:确定了 2 种不同的认知轨迹,包括正常组(92.8%)和异常组(7.2%)
轨迹。Boruta + LGBM 模型作为最优模型,其训练集 AUC 值为 0.837(95%CI:0.802 ~ 0.871),验证集中
AUC 为 0.869(95%CI:0.837 ~ 0.899);在 SHAP 分类解释器中发现年龄越大,学历越低,有慢性疾病、未
婚或离异和 IADL 得分越低的研究对象容易出现异常的认知功能轨迹,其中年龄和学历为最重要的预测因素。
结论:中国老年人的认知功能呈现出 2 种异质性轨迹。机器学习模型在分析预测残疾轨迹的质量指标方面表现
出优秀的性能,并可能具有额外的价值。应关注年龄大、学历低、IADL 得分低、有慢性疾病、未婚和离异的
中老年人,加强社会交往或保持乐观积极的态度,防止认知功能下降。