亮点
• 本研究开发并评估了ETHICS,这是一个面向临床医生的机器学习在医疗保健中使用的伦理协议。
• 该框架是使用一种新颖的人类-AI(ChatGPT)协作方法开发的。
• 经过人工检查、可读性编辑、专家评审和场景测试的完善,该协议已准备好实施。
• 生成式AI加速了伦理草案的制定,但有效性和实用性取决于结构化的人工监督和现实世界测试。
摘要
本研究开发并评估了ETHICS,这是一个简洁的、面向临床医生的日常使用机器学习(ML)的伦理协议。使用ChatGPT进行第一阶段起草,我们生成了六个可操作的原则——公平与公正、透明度与以患者为中心的护理、人工监督与临床诚信、信息隐私与数据治理、持续改进与可持续性,以及对专业人士的支持与教育——结构化为助记符,以支持在时间受限的临床环境中采用。输出被视为临时性的,并通过强制性人工来源验证、迭代可读性优化、多学科专家评审和基于场景的压力测试进行了完善。可读性分析显示从高复杂度到临床医生可访问语言的显著改善。专家评分表明强烈支持,具有出色的评分者间可靠性。在五个临床场景中确认了实施准备情况,所有场景都通过了预定义的充分性阈值。研究结果表明,生成式AI可以加速伦理协议起草,但有效性和实用性取决于结构化的人工监督和现实世界测试。
关键词
人工智能、框架、伦理、机器学习
1. 引言
人工智能(AI)的迅速崛起开启了技术进步的新时代,深刻影响着各个领域,而医疗保健则成为创新的沃土。在AI领域,机器学习(ML)因其分析海量复杂数据集的能力而获得广泛关注,能够发现传统诊断方法可能忽略的模式。机器学习算法在识别各种医疗状况方面表现出卓越的能力,包括糖尿病视网膜病变、各种癌症形式、心血管疾病以及神经退行性/神经发育障碍。这些能力有望促进更早、更准确的诊断,使临床医生能够更有效地定制治疗方案,改善患者整体预后。因此,将机器学习工具整合到临床实践中有望提高诊断精度、优化资源分配并支持决策过程。
尽管这些优势显著,但在医疗保健中部署机器学习并非没有挑战。医疗数据的敏感性、算法偏差的潜在风险以及需要保持临床医生在患者护理中的核心角色,都凸显了遵守严格伦理标准的必要性。确保机器学习应用中的公平性和公正性对于防止医疗服务中的差异至关重要,而透明度和可解释性则是维持患者和医疗服务提供者之间信任的关键。此外,强大的数据隐私保护机制和持续的人工监督对于保护患者权利和临床诚信至关重要。坚持这些伦理原则对于充分实现机器学习在医疗保健中的变革潜力至关重要,同时最大限度地降低风险并促进负责任的创新。这可以通过开发和实施一个清晰的、面向临床医生的伦理框架来支持。
最近关于值得信赖的临床AI的研究表明,当伦理框架与参与式治理相结合时最易于实施,包括让患者、护理人员和一线临床医生参与设计、部署和部署后监测,以建立合法性和信任。这一重点反映在主要治理指南中,该指南将结构化利益相关者参与和现场测试作为负责任的AI风险管理的一部分,以及将以人为本的方法作为全球健康伦理指南中AI用于健康的优先事项。
为了将这些参与式和以患者为中心的治理期望转化为可实施的临床指导,本研究开发并评估了一个简洁的AI生成协议,用于日常实践中机器学习的伦理使用。生成式AI特别适合起草伦理框架,因为它在结构化综合复杂文本语料方面表现出的能力。正如最近的健康生成式AI框架所述,大型语言模型(LLMs)在总结、提取和翻译任务方面表现出色,这正是将数十年的生物伦理文献提炼为连贯框架所需的认知操作。尽管AI辅助工具在医疗保健框架生成中引入了关键风险,包括规范性偏差、幻觉和问责制侵蚀,但本研究实施了有针对性的保障措施。具体来说,我们使用了强制性人工源验证、迭代可读性优化、多学科专家评审、基于场景的压力测试以及明确的人工作者身份和问责制。
2. 协议开发
为了支持制定临床实践中使用机器学习的伦理指南,我们使用ChatGPT 4作为第一阶段起草伦理原则和相关建议的工具。ChatGPT用于生成初始伦理框架,借鉴国际公认的伦理概念。提示是迭代和特定于上下文的;例如,我们向模型查询的指令包括:"为临床环境中基于机器学习的诊断工具的部署生成伦理原则"和"使用可操作的指南"。完整的提示在附录A中呈现。
3. 协议评估
由ChatGPT生成的输出被视为初步草稿,以促进跨学科讨论和改进。具体来说,模型被提示生成围绕缩写ETHICS组织的伦理原则,作为助记设备,用于结构化和传达与临床环境中机器学习部署相关的关键伦理维度。在内容效度方面,六项提出的伦理原则中有六项显示出与现有国际框架的明确一致性,包括世界卫生组织(WHO)关于伦理和AI的指南以及欧洲AI法案指南。例如,公平与公正原则包括在多样化数据集上训练机器学习模型以减少偏见并促进包容性和公平性,这与WHO原则5一致,该原则呼吁"确保包容性和公平性"。类似地,它也与欧洲AI法案一致,该法案指出"多样性、非歧视和公平意味着AI系统以包括多样行动者并促进平等访问、性别平等和文化多样性的方式开发和使用,同时避免歧视性影响和不公平偏见……"。这表明大型语言模型(LLMs)在得到适当提示时,可以复制或近似全球组织认可的规范结构。
指南的初稿使用R中的quanteda和quanteda.textstats包对复杂性和可读性进行了评估。原始文本的Flesch-Kincaid年级水平为16.09,Flesch阅读难易度得分为5.11,表明复杂度非常高而可读性很低。为了提高清晰度,我们使用指令让ChatGPT简化句子结构,用更简单的替代词替换复杂词汇,将长段落分解为较短的部分,并使用主动语态。目标是将Flesch-Kincaid年级水平控制在8到10之间,Flesch阅读难易度得分在40到50之间,在保持专业语气的同时兼顾临床医生的可访问性。经过多次人-AI起草和多次修订后,最终版本达到了Flesch-Kincaid年级水平10和Flesch阅读难易度得分42.82,显示出显著改善。这一过程确保了指南在语言上清晰明了,对非专业利益相关者具有可访问性,并对技术和临床考虑都敏感。
重要的是,提高可读性具有直接的临床相关性,因为这些指南旨在供临床医生在时间受限的环境中快速使用并与患者沟通。降低语言复杂性增加了正确认识和一致应用关键治理步骤的可能性,从而支持更安全的实施并减少实践中的变异性。此外,更清晰的语言通过使核心信息在同意和共享决策过程中更容易解释,支持以患者为中心的沟通。
下一轮包括专家评审,以定量评估草稿的相关性、完整性、适用性和清晰度。专家小组包括一名机器学习研究人员、一名临床医生和一名在医疗保健领域工作的伦理学家。每位专家使用5点李克特量表(1=强烈不同意到5=强烈同意)对六个原则中的每一个在四个标准——相关性、完整性、适用性和清晰度——上进行评分。专家获得了相同的评分说明和标准化评分表。评分独立匿名收集,以最小化群体影响。4.5/5的平均得分表明对所提议框架的强烈支持。专家小组之间的评分者间可靠性使用组内相关系数(ICC)进行评估;结果显示可靠性极佳:ICC(2,k)=0.90,95% CI [0.79, 0.95],F(23,46)=9.5,p<0.001。
最后,为了评估实施准备情况,每个原则都针对五个涉及机器学习工具的概念性真实临床场景进行测试:服务不足社区部署、实时紧急决策支持、初级保健筛查、机器学习辅助临床文档和面向患者的监测数字助手。每个场景使用预定义的检查表和每个ETHICS原则的0-2充分性评分标准进行评估(2=充分,1=部分,0=未解决)。如果所有六个ETHICS原则都被评为充分(得分=2),则将场景分类为通过;如果任何原则被评为部分(1)或未解决(0),则发生失败。完整的场景和评分标准在附录B中提供。表1呈现了ETHICS框架的评估。最终的ETHICS框架如表2所示。
表1. ETHICS框架评估
| 准则 | 方法 | 结果 |
|---|---|---|
| 内容效度 | 与WHO和欧盟AI原则比较 | 6项原则中有6项一致 |
| 清晰度 | 语言简化轮次 | 复杂度/可读性评分得到改善 |
| 专家一致 | 调查(1-5评分) | 平均评分:4.5/5 |
| 实施准备就绪 | 针对真实场景测试 | 5个场景中有5个通过 |
表2. ETHICS框架
E – 公平与公正
• 在多样化数据上训练机器学习工具,以减少年龄、性别、种族、语言、残疾和收入方面的偏见。
• 确保所有患者,包括服务不足的群体,都能受益。
• 在诊断中尊重文化、语言和社区价值观。
T – 透明度与以患者为中心的护理
• 告知患者何时机器学习工具是其护理的一部分。
• 清楚解释如何收集和使用他们的数据。
• 使机器学习决策对患者和临床医生都易于理解。
• 确保工具安全并有助于改善健康结果。
H – 人工监督与临床诚信
• 机器学习工具应支持而非取代临床判断。
• 临床医生必须对最终决策负责。
• 在使用前仔细测试工具并定期更新。
• 允许发现、审查和纠正错误。
I – 信息隐私与数据治理
• 使用强大的安全系统保护患者数据。
• 遵守HIPAA或GDPR等法律保护隐私。
• 仅收集诊断所需的数据。
• 不将患者数据用于营销或不相关用途。
C – 持续改进与可持续性
• 监控工具在真实护理中的表现。
• 使用来自临床医生和患者的反馈来改进它们。
• 规划退役旧模型而不损害护理质量。
• 减少能源使用并考虑环境影响。
S – 对专业人士的支持与教育
• 培训临床医生了解机器学习工具能做什么和不能做什么。
• 在设计和使用中包括患者、临床医生、伦理学家和技术人员。
这些结果共同表明,生成式AI,特别是ChatGPT,可以对伦理协议的早期起草做出有意义的贡献,但人工监督、领域知识和基于场景的压力测试对于确保实际可行性至关重要。
4. 结论
虽然现有框架(如由国际公认实体开发的框架)为AI的开发和治理提供了基础伦理原则,但本研究提出的ETHICS框架提供了几个专门针对机器学习临床应用的独特贡献。首先,ETHICS将一般AI伦理置于医疗保健的日常现实中,不仅关注公平和透明等广泛价值观,还关注与临床工作流程、患者参与和健康数据治理相关的可操作指南。其次,该框架是通过一种新颖的人-AI协作方法开发和评估的,使用ChatGPT进行结构化起草,随后进行人工简化、专家评审和基于场景的压力测试。这种迭代和跨学科的过程确保了与全球标准的概念一致性以及实际可用性。第三,ETHICS框架引入了助记结构,增强了临床医生之间的记忆性和沟通性,使其更有可能在实践中被采用。
因此,ETHICS不是现有框架的替代品,而是连接高级原则和现实临床需求的补充性、实施就绪工具。ETHICS框架有可能既全面又实用,解决医疗保健中机器学习应用固有的关键伦理挑战。重要的是,这一过程强调,虽然AI可以生成有价值的初步内容,但人类专业知识和多学科合作对于确保框架的有效性、清晰度和现实世界适用性仍然至关重要。
随着机器学习技术的不断进步并整合到临床工作流程中,遵守严格的伦理标准对于保护患者权利、促进公平护理以及在利益相关者之间保持信任至关重要。未来的研究应侧重于对已部署系统的持续监测、开发适应新兴挑战的动态协议,以及扩大培训计划,为临床医生和患者做好负责任的AI支持医疗保健的准备。
资金声明
未收到资金。
利益冲突声明
作者声明,他们没有已知的可能被认为影响本论文报告工作的竞争性财务利益或个人关系。
致谢
本研究得到了尼科西亚大学语音实验室的支持。
附录A. 使用的确切提示序列
提示0 – 会话约束
您正在协助起草用于临床使用机器学习的伦理指南。不要使用或请求任何患者可识别信息。不要编造事实、法规或引用。如果某些内容不确定,请标记出来。提供面向临床医生和医疗保健管理者的可操作指导。
提示1 – 草案生成
为临床环境中基于机器学习的诊断工具的部署生成伦理原则。提供6-8项原则。在每项原则下,提供3-5项可操作指南。保持语言实用且以实施为重点。
提示2 – ETHICS助记重构
重新组织原则,使其符合ETHICS缩写。保持含义不变。对于每个字母,提供3-5个适合临床医生的简洁项目符号指南。
提示3 – 源对齐支持
对于每个ETHICS原则,列出它对应的高级国际AI伦理主题(例如,公平、透明、人工监督、隐私、问责制)。不要引用文档;仅提供主题级映射。
提示4 – 简化可读性
您正在编辑临床伦理指南的可读性,同时保留含义。
目标:Flesch-Kincaid年级水平8-10;Flesch阅读难易度40-50。
受众:临床医生和医疗保健管理者。
不要更改:ETHICS标题;伦理意图;问责声明。
要做的:缩短句子;使用主动语态;简化词汇而不改变含义;拆分长项目符号;消除冗余。
输出:以相同结构返回修订的ETHICS文本。之后,列出5个编辑示例(之前→之后)。
提示5 – 场景压力测试
创建五个涉及机器学习工具的真实临床场景(服务不足环境;实时决策支持;筛查;自动化文档;面向患者的助手)。
附录B. ETHICS场景和评估标准
B1 – 完整的ETHICS场景
场景1:在服务不足社区环境中的机器学习部署
一个区域医疗网络计划在为服务不足和多语言人群服务的社区诊所中实施基于机器学习的诊断支持工具。早期试点数据显示,对于说少数语言的患者以及历史上获得专科护理机会有限的群体,模型性能不太稳定,引发了对不平等错误率和降低临床效益的担忧。因此,该网络在全面推出前启动了子组性能审计,比较不同语言、年龄、性别、残疾状况和社会经济代理的假阳性率和假阴性率,并推迟在未达到最低性能阈值的站点部署。为了支持透明度和以患者为中心的护理,诊所在解释何时使用机器学习工具、它依赖的数据以及其输出可以和不能确定的内容时,引入了标准化的翻译患者信息表和同意脚本,并使用口译员和复述程序来确认理解。临床诚信通过要求临床医生对所有受工具影响的决策进行签字确认、记录当临床判断与模型建议冲突时的覆盖情况,以及建立针对低置信度输出的升级途径来保护。实施团队还应用数据最小化和基于角色的访问控制,将数据使用限制为临床和治理目的,并正式化数据共享协议以确保遵守隐私法规。推出后,该网络在真实世界使用中监控性能,跟踪不同诊所和子组的性能漂移和错误模式,并建立具有预定义触发器的快速事件审查流程,用于重新校准、临时暂停或在安全阈值被突破时退役模型。最后,该网络为临床医生和管理人员提供有针对性的培训,了解偏见、限制和沟通,同时让社区代表和语言访问工作人员参与治理决策,以确保该工具在本地环境中保持适当和受信任。
场景2:快速环境中的实时临床决策支持
一家医院急诊科部署了一个实时机器学习决策支持系统,旨在通过在拥挤期间标记高风险患者并建议优先级来协助分诊团队。尽管该系统显示了强大的总体准确性,但临床医生表示担心时间压力可能会鼓励自动化偏见,工作人员在没有充分审查的情况下依赖建议,早期审计显示关于机器学习输出是否以及如何影响决策的记录不一致。为了保护公平性,医院定期监测不同人口统计和临床子组的分诊结果和错误率,确保假阴性和延误升级不会不成比例地影响特定人群。为了支持透明度和可用性,界面显示置信信息和关键贡献因素的简明解释,并记录何时查看或使用模型输出。通过要求临床医生确认或覆盖模型建议并记录覆盖的简要理由,同时定义明确的"不使用"条件(当数据缺失或临床表现超出工具预期范围时),保留了人工监督。隐私和治理通过安全日志记录、限制访问审计跟踪以及将数据使用限制为患者护理和质量保证的保留政策来解决。为了实现持续改进,该部门实施了一个快速反馈机制,允许临床医生在轮班期间标记可疑建议,辅以定期校准检查和漂移监测,以及性能下降时的回滚程序。医院还提供了简短的、轮班兼容的培训模块,介绍安全使用和常见故障模式,并任命临床和技术负责人以确保问责和及时响应安全问题。
场景3:初级保健中的早期检测和筛查
一个初级保健网络采用了一种基于机器学习的筛查工具,该工具生成风险评分以支持早期检测慢性病和神经发育状况,并指导进一步测试和转诊的决策。临床医生报告了对如何解释概率评分、如何避免不必要的焦虑或过度转诊以及如何向患者解释结果以保持以患者为中心和可理解的不确定性。因此,该网络制定了一个操作协议,规定该工具提供支持性信息而非确定性,要求临床医生在做出转诊决定前将风险评分与临床病史、症状表现和背景因素结合起来。为了减少不公平,该网络评估了不同人口群体和诊所站点的下游转诊模式和诊断产量,检查是否存在历史上服务不足或诊断不足的人群识别不足,并在检测到差异时调整阈值或重新训练模型。为了加强透明度,引入了标准化的患者解释,澄清评分代表什么、可能采取的行动以及工具无法得出的结论,以及关于机器学习在筛查路径中作用的明确披露。隐私和数据治理通过仅限于筛查所需的特征、实施加密和访问控制、记录适用的同意和退出选项以及确保遵守相关法律框架来解决。持续改进通过跟踪关键结果(如确诊诊断、错过的病例、假阳性、患者满意度和临床医生使用信心)得到支持,并安排重新校准以及记录的模型更新和退役计划。最后,该网络为临床医生提供关于风险沟通和适当转诊路径的培训和快速参考材料,并将患者反馈纳入信息材料和工作流程整合的设计中。
场景4:机器学习辅助的自动化临床文档
一家医院引入了一个机器学习系统,该系统从记录的咨询和结构化EHR数据生成临床笔记草稿,旨在减少行政负担并提高效率。虽然临床医生报告节省了时间,但质量检查发现了偶尔但具有临床意义的错误,包括不正确的药物剂量、省略的否定以及可能影响护理连续性的缺失背景细节(如果未经仔细审查就接受)。因此,该医院正式制定了一个文档政策,要求临床医生审查并最终批准所有生成的笔记,对药物、过敏、诊断和随访说明等高风险内容进行强制性验证步骤,并明确将责任分配给签名临床医生。为了解决公平性,该医院评估了不同语言、口音和沟通概况(包括有语言障碍的患者)的文档质量,以确保自动生成的草稿不会系统性地降低特定群体的记录质量。通过通知患者何时使用AI辅助文档、澄清记录的内容、存储时间、保护方式以及在临床医生界面中明确标记AI生成的部分,提高了透明度。隐私和治理保障措施包括加密音频和文本、通过基于角色的权限限制访问、应用保留和删除计划,以及禁止营销或不相关分析等二次使用。该医院还建立了文档错误的事件报告工作流程,对笔记样本进行定期审计,并维护版本控制,在更新后错误率增加时制定回滚计划,支持持续改进和安全模型生命周期管理。为临床医生提供关于常见故障模式和高效审查实践的持续培训,并在临床领导、信息学和合规团队之间共享治理责任,以确保持续监督。
场景5:用于筛查和监测的面向患者的数字助手
一家医疗保健提供商推出了一款面向患者的聊天机器人和移动应用程序,旨在通过收集患者报告的信息并生成关于下一步的自动化建议来支持症状筛查和持续监测。部署后不久,提供商识别出伦理和临床风险,包括跨语言和识字水平的响应中可能存在的偏见、不安全保证或延迟升级的可能性,以及由于患者输入数据的敏感性而增加的隐私泄露风险。为了促进公平,提供商测试了系统在不同用户群体中的性能,并确保为残疾人和低数字素养设计可访问,同时保持替代的非数字护理路径,以便该工具不会成为没有可靠访问的患者的障碍。通过明确声明助手不是临床医生、解释其建议的范围和限制、披露如何收集和使用数据以及提供何时寻求紧急护理的明确指导,加强了透明度。通过路由高风险症状模式到临床医生或紧急服务的升级规则来实现人工监督,辅以对高风险输出的定期临床审查和临床内容的问责分配。隐私和数据治理措施包括知情同意、数据最小化、强大的安全控制、对第三方共享的限制以及遵守适用的法律和机构政策。为了支持持续改进,提供商监控安全信号(如投诉、不良事件和性能漂移),根据修订的临床指南更新内容,并维护记录的更新和回滚流程。最后,提供商培训工作人员处理升级和患者问题,并让临床医生、伦理学家和患者代表参与治理,以确保持续符合患者需求和安全标准。
B2 – ETHICS场景评估标准
| 原则 | 场景1 | 场景2 | 场景3 | 场景4 | 场景5 |
|---|---|---|---|---|---|
| E | 2 | 2 | 2 | 2 | 2 |
| T | 2 | 2 | 2 | 2 | 2 |
| H | 2 | 2 | 2 | 2 | 2 |
| I | 2 | 2 | 2 | 2 | 2 |
| C | 2 | 2 | 2 | 2 | 2 |
| S | 2 | 2 | 2 | 2 | 2 |
| 2=充分,1=部分,0=未解决 |
【全文结束】

