美国国立卫生研究院拥有全球最大的生物医学研究数据集之一。数十年来,由联邦政府资助的关于心脏病、肺部疾病、睡眠障碍和基因组学等健康问题的研究已经产生了数拍字节的信息。但在大部分历史时期,这些数据是由不同的研究所按照不同的标准收集的。历史上,这些不同的格式并不容易整合。
这种不协调在目标是训练能够加速医学研究的人工智能模型时成为一个问题。美国国立卫生研究院的三个办公室——美国国家心肺血液研究所(NHLBI)、美国国家医学图书馆(NLM)和数据科学战略办公室(ODSS)——现在正共同努力解决这个问题。在AFCEA贝塞斯达健康IT峰会的一个关于在联邦医疗中大规模实现数据操作化的小组讨论中,这三个办公室的领导描述了他们正在构建的互操作性基础设施及其对人工智能的重要性。
12拍字节与转换器盒
这一努力的核心是BioData Catalyst,这是一个由NHLBI与NLM和ODSS合作开发的基于云的生态系统。
NHLBI信息技术与应用中心(ITAC)科学解决方案交付部门主管Sweta Ladwa表示:"美国国立卫生研究院拥有超过12拍字节的数据,这些数据都是多模态的——从基因组学、临床影像、睡眠到传感器数据,各种不同的模态。"这些数据涵盖了长期运行的研究项目,例如精准医学跨组学计划(TOPMed),该计划跟踪了约18万名个体。
但仅访问数据并不能使数据适合人工智能使用。更困难的问题是互操作性——确保来自1990年代弗雷明汉心脏研究队列的心血管变量与来自最近的肺纤维化研究的变量含义相同。NHLBI建立了一个链接数据建模语言(LinkML)管道来解决这个问题——Ladwa称之为"转换器盒方法,你可以将源数据插入其中,它会将其放入该格式供你分析。"该管道将数据映射到多个标准,包括LOINC(逻辑观察标识符名称和代码)、FHIR(快速医疗互操作资源)和HPO(人类表型本体)。
NHLBI将自动映射与临床验证相结合。Ladwa说:"我们与肺科医生合作,真正从临床上确定这些概念,因为我们希望确保这种复杂的高血压药物与另一种药物相同。它们都属于同一类别,都是相同的本体概念。"她补充说,人工智能辅助映射使用的是"公开可用的元数据",而不是患者数据。
从研究标准到电子病历
虽然NHLBI专注于使现有研究数据互操作,但ODSS正在处理一个互补的问题:将研究级别的标准纳入每天生成新数据的临床系统中。
美国国立卫生研究院数据科学副主管兼ODSS主任Susan Gregurick描述了一项努力,即将美国国立卫生研究院的研究标准映射到互操作性美国核心数据集(USCDI)中——这是电子病历系统用于认证的互操作性标准。作为这一过程的一部分,Gregurick提到了从肿瘤学开始并扩展到其他疾病领域的工作,包括与NHLBI的心血管合作。
这意味着:当心血管表型出现在患者就诊中——即使在正式研究之外——电子病历系统可以以研究人员可以使用的格式捕获它们。
Gregurick表示:"这种跨机构合作的影响确实巨大。我认为这几乎与人工智能无关,但它将成为未来推动人工智能发展的因素。"
使用通用数据元素为机器整理数据
支撑这项工作的大部分内容是美国国家医学图书馆,这是世界上最大的生物医学研究图书馆。NLM战略举措办公室代理主任Lisa Federer将该图书馆描述为通过诸如医学主题词表(MeSH)和通用数据元素等资源提供"未来人工智能工作的基质",这些资源标准化了美国国立卫生研究院如何描述和收集研究数据。
但Federer表示,正在变化的是谁在消费数据。
Federer说:"我们不仅考虑人类,还考虑机器如何消费数据。你不仅要考虑人类消费这些数据,还要考虑代理式人工智能将如何消费这些信息?"
NLM为机器消费整理数据的方式"与我们为人类消费整理数据的方式不同",Federer表示——这表明查询美国国立卫生研究院资源的AI代理不会像研究人员那样阅读上下文线索。
这种区别使标准化通用数据元素变得更加重要,特别是因为NLM已经注意到爬取其数字存储库的机器人和其他AI代理数量有所增加。
美国国立卫生研究院和健康研究未来的关键所在
据Gregurick称,美国国立卫生研究院去年在与人工智能相关的研究资助上投入了近4亿美元。但不太明显的投资——使数据能够在机构边界之间使用的管道、本体和标准——可能更为重要。
Ladwa表示:"当你能够将这些数据与真实世界数据、研究空间中存在的其他数据或全国甚至国际上的健康数据网络连接起来时,你就增加了这些数据的能力,使其能够做更多事情",并且"最终帮助那些受疾病和障碍影响的人。"
如果没有互操作性标准,70年的健康数据将被锁定在其原始格式中。有了这些标准,它就成为新一代人工智能驱动医学研究的基础。
照片由贝塞斯达AFCEA提供
【全文结束】

