摘要
背景
预测出院功能状态在卒中康复中非常重要,但开发本地预测模型通常需要统计和编程专业知识。本研究的主要目的是开发并内部验证基于常规入院变量预测出院功能独立性评定量表(FIM)评分的模型。次要目的是描述一种仅用于模板生成和代码脚手架的本地执行ChatGPT辅助工作流。
方法
这项单中心回顾性观察研究纳入了2022年4月至2025年3月期间入住日本福冈Sakurajyuji福冈医院康复疗养病房(一种为急性治疗后需要强化康复的患者提供服务的急性期后住院康复单元)的377名脑梗死或脑出血患者。预测因子包括年龄、卒中发病至入院天数和入院FIM评分。为出院运动FIM和出院认知FIM分别开发了独立的线性回归模型,并为出院总FIM开发了直接模型。内部验证采用五折交叉验证与折外预测。模型性能使用平均绝对误差(MAE)、均方根误差(RMSE)、决定系数(R²)和校准指标进行评估。
结果
出院运动FIM模型的MAE为11.87,RMSE为14.69,R²为0.680。出院认知FIM模型的MAE为3.76,RMSE为4.98,R²为0.731。直接出院总FIM模型的MAE为14.55,RMSE为18.21,R²为0.714。所有结局的校准斜率接近1.0,重复交叉验证显示预测误差变化最小。
结论
使用少量常规可用的入院变量,可以中等程度地预测出院FIM评分,并具有良好的校准性。本地执行的ChatGPT辅助工作流在模板生成和代码脚手架方面是可行的,但临床实用性的正式评估、透明报告、人工验证和外部验证仍有必要。
介绍
预测出院时的功能状态在卒中康复中非常重要,因为它为设定目标、出院规划和预期护理需求提供了信息。功能独立性评定量表(FIM)在住院康复中被广泛用于量化残疾和恢复程度,入院FIM已与卒中后的后期护理需求和出院安排相关联。
多项研究表明,入院功能状态、年龄和其他临床变量与卒中康复后的结局相关。入院FIM已被报道为良好结局的独立预测因子,入院总FIM已被确定为住院卒中康复队列中出院总FIM的强预测因子。
同时,最近的研究表明,大型语言模型可以通过自然语言交互和代码辅助分析支持研究和数据分析工作流,而新兴的报告指南强调在健康研究中使用此类工具时需要透明披露、人工监督和隐私保护。本研究的主要目的是使用脑梗死或脑出血患者入院时常规可获得的变量,开发并内部验证用于预测康复疗养病房(日本急性期后住院康复单元)患者出院运动、认知和总FIM评分的回归模型。次要目的是描述仅用于模板生成和代码脚手架的本地执行ChatGPT辅助工作流的可行性。我们假设这些常规可用的入院变量将提供具有良好校准性的中等预测性能。
材料与方法
研究设计
本研究是一项单中心回顾性观察研究,研究对象为入住日本福冈Sakurajyuji福冈医院康复疗养病房(在日本,康复疗养病房是为急性治疗后需要强化康复的患者提供的急性期后住院康复单元)的脑梗死或脑出血患者。
数据来源
数据从医疗记录中常规收集的信息中提取。研究期间为2022年4月至2025年3月。
伦理考虑
本研究获得Sakurajyuji福冈医院伦理委员会批准(批准号:2025011402)。所有参与者均提供了书面知情同意。未与第三方共享患者级数据。
ChatGPT的使用
ChatGPT(OpenAI,美国加利福尼亚州旧金山)仅在2026年1月7日用于协助起草标准化输入/输出模板和计划分析的代码脚手架。未将患者级数据输入ChatGPT。所有生成的代码均由作者审查,根据需要进行修改,并在本地执行。模型拟合、验证和性能评估使用结构化临床数据在本地进行。本研究中使用的最终版本分析代码在GitHub发布版中公开可用。大型语言模型使用的报告符合新兴建议,包括工具规格、人工监督、内容验证和隐私考虑的透明披露。
参与者
研究人群由入住康复疗养病房的脑梗死或脑出血患者组成。符合条件的诊断从医疗记录中记录的入院诊断中识别;在源系统中,这些诊断也对应于日本住院康复计费使用的行政疾病类别。
如果年龄、卒中发病至入院天数、入院运动FIM、入院认知FIM、出院运动FIM和出院认知FIM的完整数据可用,则患者被纳入分析。排除标准为死亡、因临床恶化紧急转院和数据缺失。最终分析包括377名患者。
变量
预测因子为年龄、卒中发病至入院天数、入院运动FIM和入院认知FIM。入院总FIM计算为入院运动FIM和入院认知FIM之和。结局为出院运动FIM、出院认知FIM和出院总FIM。出院总FIM计算为出院运动FIM和出院认知FIM之和。
FIM评估
FIM由每位患者的主管治疗师在入院和出院时进行评估。所有评估者均完成了FIM评估程序培训,并使用描述评分标准的手册进行评分。
数据质量控制
分析前,检查数据集中所有所需变量是否存在缺失值或非数值值。此外,检查入院和出院运动、认知和总FIM评分是否存在超出允许范围的值。通过确认入院和出院总FIM评分等于相应运动和认知FIM评分之和,验证了内部一致性。
异常值处理
未将任何观测值排除为统计异常值。由于所有所需变量均在预设的允许范围内,且在数据质量检查中未发现不可信的值,因此在完整合格样本上进行了分析,没有基于异常值的删除或缩尾处理。
缺失数据处理
进行了完整案例分析。在分析所需的任何变量中缺失数据的患者被排除。377名患者的最终分析样本中不存在缺失值。
预测模型
对于出院运动FIM和出院认知FIM,使用年龄、卒中发病至入院天数、入院运动FIM和入院认知FIM作为预测因子,开发了独立的多变量线性回归模型。
对于出院总FIM,使用年龄、卒中发病至入院天数和入院总FIM作为预测因子,开发了独立的多变量线性回归模型。由于入院运动FIM、入院认知FIM和入院总FIM是线性相关的,因此在出院总FIM的直接预测模型中仅使用入院总FIM。
此外,出院总FIM的推导预测值计算为预测出院运动FIM和预测出院认知FIM之和。
统计分析
对于内部验证,分析数据集被随机分为五个大致相等的部分。在每次迭代中,模型在四部分上拟合并在剩余部分上评估,因此每位患者对每次重复贡献一个折外预测。由于线性回归模型和预测因子是预先指定的,因此在交叉验证内未进行超参数调整或数据驱动的变量选择。对于重复交叉验证分析,使用不同的随机种子在40次重复中重新生成折叠分配。使用平均绝对误差(MAE)、均方根误差(RMSE)和决定系数(R²)评估模型性能。
观察值 = a + b × 预测值,
其中a表示校准截距,b表示校准斜率。
使用具有2,000次重复的自助重采样估计性能和校准指标的95%置信区间。
为了评估重复交叉验证分析中预测的稳定性,计算了MAE的均值和标准差。此外,计算了每位患者的重复预测的标准差。使用ICC(2,1)评估重复预测之间的一致性,并使用具有2,000次重复的自助重采样估计其95%置信区间。
作为补充分析,进行了具有500次重复的自助乐观校正。
尽管出于未来实施的操作要求考虑了整数舍入和范围限制,但在当前性能评估中未应用这些约束,所有预测均作为连续值进行评估。
软件
所有统计分析均使用Python 3.14.3(Python软件基金会,美国)和NumPy 2.4.0在本地执行。
结果
研究队列
共377名患者被纳入最终分析。研究队列的基本特征总结在表1中。在所需变量中未发现缺失值或非数值值。此外,入院或出院运动、认知或总FIM评分未观察到超出范围的值,并且总FIM评分与运动和认知FIM评分之和之间未发现差异。
表1:研究队列的基本特征(n = 377)
| 变量 | n | 均值 ± 标准差 | 中位数 [四分位距] | 最小值–最大值 |
|---|---|---|---|---|
| 年龄,年 | 377 | 73.46 ± 14.71 | 76.00 (65.00–84.00) | 20–104 |
| 发病至入院天数 | 377 | 30.72 ± 23.92 | 24.00 (17.00–35.00) | 0–207 |
| 入院运动FIM | 377 | 42.44 ± 18.84 | 47.00 (25.00–57.00) | 13–89 |
| 入院认知FIM | 377 | 22.96 ± 9.77 | 25.00 (15.00–32.00) | 5–35 |
| 入院总FIM | 377 | 65.40 ± 26.53 | 70.00 (45.00–86.00) | 18–124 |
| 出院运动FIM | 377 | 67.19 ± 25.99 | 79.00 (50.00–89.00) | 13–91 |
| 出院认知FIM | 377 | 26.61 ± 9.61 | 31.00 (20.00–35.00) | 5–35 |
| 出院总FIM | 377 | 93.81 ± 34.11 | 109.00 (70.00–122.00) | 18–126 |
注:数值表示为均值±标准差、中位数[四分位距]和最小值–最大值。总FIM评分计算为运动和认知FIM评分之和。FIM:功能独立性评定量表
内部验证性能
预测模型的内部验证性能如表2所示。在使用折外预测的五折交叉验证中,出院运动FIM模型的平均绝对误差(MAE)为11.87,均方根误差(RMSE)为14.69,R²为0.680。校准截距为0.668,校准斜率为0.990。MAE、RMSE、R²、校准截距和校准斜率的相应95%置信区间分别为11.02-12.79、13.68-15.73、0.627-0.723、-4.65至6.07和0.919-1.062。
表2:预测模型对出院FIM结局的内部验证性能
| 模型 | 结局 | 预测因子 | MAE (95% CI) | RMSE (95% CI) | R² (95% CI) | 校准截距a (95% CI) | 校准斜率b (95% CI) | n |
|---|---|---|---|---|---|---|---|---|
| 模型A | 出院运动FIM | 年龄+发病至入院天数+入院运动FIM+入院认知FIM | 11.87 (11.02–12.79) | 14.69 (13.68–15.73) | 0.680 (0.627–0.723) | 0.668 (-4.648–6.068) | 0.990 (0.919–1.062) | 377 |
| 模型B | 出院认知FIM | 年龄+发病至入院天数+入院运动FIM+入院认知FIM | 3.76 (3.44–4.12) | 4.98 (4.50–5.48) | 0.731 (0.668–0.780) | 0.433 (-1.375–2.437) | 0.984 (0.924–1.041) | 377 |
| 模型C | 出院总FIM | 年龄+发病至入院天数+入院总FIM | 14.55 (13.46–15.65) | 18.21 (16.80–19.56) | 0.714 (0.664–0.758) | 0.639 (-6.049–7.737) | 0.993 (0.926–1.056) | 377 |
| 推导总分 | 预测总FIM = 预测运动FIM + 预测认知FIM | 模型A + B推导 | 14.47 (13.38–15.58) | 18.17 (16.77–19.56) | 0.716 (0.665–0.761) | 1.065 (-5.755–8.132) | 0.989 (0.924–1.054) | 377 |
注:性能估计基于五折交叉验证的折外预测。95%置信区间使用自助重采样(B = 2,000)估计。校准通过观察值对预测值的线性回归进行评估(观察值 = a + b × 预测值)。推导总FIM行计算为预测运动FIM + 预测认知FIM。FIM:功能独立性评定量表
对于出院认知FIM,该模型的MAE为3.76,RMSE为4.98,R²为0.731,校准截距为0.433,校准斜率为0.984。MAE、RMSE、R²、校准截距和校准斜率的95%置信区间分别为3.44-4.12、4.50-5.48、0.668-0.780、-1.37至2.44和0.924-1.041。
对于出院总FIM,直接预测模型的MAE为14.55,RMSE为18.21,R²为0.714,校准截距为0.639,校准斜率为0.993。MAE、RMSE、R²、校准截距和校准斜率的95%置信区间分别为13.46-15.65、16.80-19.56、0.664-0.758、-6.05至7.74和0.926-1.056。
作为预测出院运动FIM和预测出院认知FIM之和计算的推导总FIM评分也显示出类似的性能,MAE为14.47,RMSE为18.17,R²为0.716,校准截距为1.065,校准斜率为0.989。MAE、RMSE、R²、校准截距和校准斜率的95%置信区间分别为13.38-15.58、16.77-19.56、0.665-0.761、-5.76至8.13和0.924-1.054。
稳定性和敏感性分析
稳定性和敏感性分析总结在表3中。在40次重复的五折交叉验证中,出院运动FIM的MAE均值±标准差为11.80 ± 0.07,出院认知FIM为3.71 ± 0.02,出院总FIM为14.47 ± 0.07。
表3:预测模型的稳定性和敏感性分析
| 模型 | 结局 | 重复交叉验证MAE,均值 ± 标准差 | 每位患者预测标准差,中位数 [IQR] | ICC(2,1) (95% CI) | 乐观校正后MAE | 乐观校正后RMSE | 乐观校正后R² |
|---|---|---|---|---|---|---|---|
| 模型A | 出院运动FIM | 11.80 ± 0.07 | 0.753 [0.589–0.945] | 0.998397 (0.998181–0.998581) | 11.80 | 14.63 | 0.684 |
| 模型B | 出院认知FIM | 3.71 ± 0.02 | 0.253 [0.189–0.325] | 0.998713 (0.998512–0.998882) | 3.69 | 4.90 | 0.741 |
| 模型C | 出院总FIM | 14.47 ± 0.07 | 0.817 [0.628–1.027] | 0.998911 (0.998753–0.999038) | 14.45 | 18.13 | 0.718 |
注:重复交叉验证结果基于40次重复的五折交叉验证,使用不同的随机种子。每位患者预测标准差指每位参与者重复折外预测的标准差。ICC(2,1)的95%置信区间使用自助重采样(B = 2,000)估计。乐观校正后性能使用自助乐观校正(B = 500)获得。FIM:功能独立性评定量表
每位患者重复预测的标准差中位数为:出院运动FIM为0.753(四分位距(IQR),0.589-0.945),出院认知FIM为0.253(IQR,0.189-0.325),出院总FIM为0.817(IQR,0.628-1.027)。
组内相关系数ICC(2,1)为:出院运动FIM为0.998397(95% CI,0.998181-0.998581),出院认知FIM为0.998713(95% CI,0.998512-0.998882),出院总FIM为0.998911(95% CI,0.998753-0.999038)。
经过自助乐观校正后,校正后的性能估计如下:对于出院运动FIM,MAE为11.80,RMSE为14.63,R²为0.684;对于出院认知FIM,MAE为3.69,RMSE为4.90,R²为0.741;对于出院总FIM,MAE为14.45,RMSE为18.13,R²为0.718。
最终模型方程
在完整分析数据集上拟合的完整回归方程如下:
预测出院运动FIM = 39.241 - 0.238 × 年龄 - 0.096 × 发病至入院天数 + 0.826 × 入院运动FIM + 0.581 × 入院认知FIM。
预测出院认知FIM = 13.663 - 0.073 × 年龄 - 0.020 × 发病至入院天数 + 0.031 × 入院运动FIM + 0.767 × 入院认知FIM。
预测出院总FIM(直接模型)= 53.550 - 0.306 × 年龄 - 0.115 × 发病至入院天数 + 1.013 × 入院总FIM。
讨论
在这项单中心回顾性研究中,基于常规可用入院变量的回归模型对出院运动、认知和总FIM结局表现出中等预测性能和良好校准。ChatGPT仅用于协助模板生成和代码脚手架,未将患者级数据输入模型。所有三个结局的校准斜率接近1.0,重复交叉验证显示MAE变化最小,ICC(2,1)值超过0.998。综合来看,这些发现表明仅使用少量常规可用的入院变量就可以中等程度地预测出院功能状态。
一个临床重要发现是,仅使用四个简单的入院变量——年龄、卒中发病至入院天数、入院运动FIM和入院认知FIM——就获得了具有良好校准的中等预测性能。这些变量在常规护理早期可用,不需要额外测试,可能支持早期出院规划并与患者和家属沟通,尽管本研究未正式量化临床实用性。先前研究表明,入院FIM与卒中后后期护理需求和出院安置相关,入院功能状态是康复结局的强预测因子。我们的发现支持在康复疗养环境中使用简约预测因子集预测出院运动、认知和总FIM的可行性。
在本研究中,ChatGPT未用于直接从患者级数据推断结局。相反,它用于生成分析工作流和可执行代码,而模型拟合、验证和性能评估则使用结构化临床数据在本地进行。这种区分很重要,因为在这种背景下,大型语言模型的价值可能在于支持技术实施,同时保留统计验证和人工监督的需要。
这些发现应在先前的卒中康复预测研究背景下解释。Meyer等人的系统评价发现,入院功能水平和年龄是在卒中后住院康复后与功能结局最一致相关的预测因子。Sonoda等人的研究同样报告了年龄、卒中发病至入院天数以及入院运动和认知FIM有助于预测康复队列中的出院运动FIM。在一项住院卒中康复的机器学习研究中,Harari等人报告称,入院临床测试评分是出院结局的最重要预测因子,卒中发病至康复入院时间和年龄也对预测性能有贡献。最近,Campagnini等人开发了内部交叉验证和外部验证的机器学习模型用于卒中后住院康复,并发现基线运动和认知测量以及年龄是结局预测的主要贡献者。综合起来,这些研究和当前结果支持了 readily available admission functional data and age 的重要性,同时也强调了透明报告和外部验证对临床采用的重要性。
应承认若干局限性。首先,这是一项单中心回顾性研究,未进行外部验证。因此,模型对其他机构和其他患者人群的可推广性尚不清楚。其次,由于分析仅限于完成康复课程至出院且数据完整的患者,无法排除选择偏倚。死亡、需要紧急转院或数据缺失的患者可能在严重程度或恢复轨迹方面与分析队列存在系统性差异。第三,尽管所有评估者都完成了FIM培训并使用了评分手册,但未在本数据集中评估正式的评分者间可靠性;因此,残留的测量变异性可能影响了模型性能。第四,无法报告候选患者的数量和详细的排除情况。第五,模型有意保持简约,未包含其他可能相关的预测因子,这些因子可能在今后的研究中提高性能,但也会增加数据收集负担。最后,我们未将预先指定的回归模型与更简单的基准模型或替代机器学习方法进行比较,也未直接比较ChatGPT辅助工作流与传统的非LLM分析工作流。
尽管存在这些局限性,本研究具有实际意义。简约入院数据集的组合、无需与外部模型共享患者级数据的本地执行、有利的内部验证指标以及公开发布的版本化代码,支持了在康复环境中开发AI辅助预测模型的可行性。然而,本研究未正式量化临床效用,也未确立所选建模策略或AI辅助工作流的优越效率或性能。未来研究应在独立队列中进行外部验证,将预先指定的回归模型与更简单的基准模型和替代方法进行比较,直接比较基于预测运动和认知FIM的直接总FIM模型和推导总FIM方法,并评估添加临床有意义的预测因子是否能在不显著降低可行性的情况下提高性能。AI辅助预测模型研究的透明报告,包括工具规格、人工监督、验证程序、隐私考虑和代码可用性的披露,对评估和实施也很重要。
结论
在入住康复疗养病房的脑梗死或脑出血患者中,仅使用常规可用的入院变量,出院运动、认知和总FIM评分可以中等程度地预测,并具有良好的校准性。在本研究中,ChatGPT仅用于在人工审查和本地执行下的模板生成和代码脚手架。在实施前,需要外部验证、与基准模型的比较以及临床实用性的正式评估。
【全文结束】

