本研究提出了一种基于合成生物标志物轨迹预测锂相关肾功能障碍的多模态机器学习框架。长期锂治疗仍是双相情感障碍最有效的维持疗法,但部分患者存在进行性肾功能损害的风险。早期识别易受锂相关肾毒性的个体在临床上至关重要,但由于肾生物标志物的异质性演变、非线性暴露效应以及与合并症和伴随用药的复杂相互作用,这一任务充满挑战。本研究引入了一个基于数学透明合成肾轨迹生成器的多模态机器学习框架。该模拟器参数化基线肾功能、锂负荷、水合状态和合并症负荷,以生成随时间变化的生理上一致的血清和尿液生物标志物模式。利用这些合成轨迹,我们训练了一个由经典分类器和梯度提升分类器组成的集成模型,该模型在保留数据上实现了近乎完美的肾毒性判别(AUC约1.00)。在各种模型中,生物可解释的预测因子,包括肌酐升高、eGFR下降和累积锂负荷,始终作为主导风险因素出现。亚组分析证实了在年龄、性别、BMI和血清锂水平分层上的稳定性能,而SHAP可解释性揭示了锂暴露、滤过动力学和急性肾应激之间的机制关系。总之,这些结果表明,结构化的合成数据和可解释的多模态机器学习可以形成一个高保真度的实验平台,用于研究锂的肾脏效应以及原型化临床可行的早期检测工具。
方法部分详细描述了合成肾轨迹生成器,包括基线肾功能和人口统计学参数、锂暴露和水合状态、合并症风险和药物相互作用,以及肾风险概率和标签生成。特征工程部分设计了滤过下降、肌酐增加比率、血尿素氮/肌酐比率和锂暴露指数等特征。预测模型包括逻辑回归、随机森林、梯度提升、LightGBM、XGBoost和轻量级多层感知器。训练方案采用统一的协议,包括80/20训练-测试分割和5折分层交叉验证,主要优化指标为ROC曲线下面积。
结果部分展示了所有评估模型的预测性能,各模型均达到近乎完美的判别能力(AUC约1.00)。特征重要性分析显示,年龄和肌酐增加是主导预测因子,其次是BMI、当前eGFR和基线肌酐。SHAP依赖图揭示了年龄、肌酐增加、BMI和锂水平的非线性效应。局部解释通过SHAP瀑布图展示了个体患者的决策过程。阈值优化和操作点分析表明,模型在广泛的概率阈值上保持稳定性能。模型校准分析显示预测概率与观察结果事件频率高度一致。
讨论部分总结了本研究的整体发现和方法论贡献,强调了生理学合理性和风险信号的可解释性,以及对类不平衡、阈值选择和亚组变异的稳健性。同时指出了研究的优势、局限性和未来扩展方向,包括将生成器扩展到完全随机的肾轨迹,整合遗传和分子标记,以及在真实世界锂治疗队列中进行验证。
总之,本研究展示了结构化的合成数据和可解释的多模态机器学习如何共同提供一个高保真度的实验平台,用于理解锂的肾脏影响和设计早期检测策略。
【全文结束】

