你的AI战略将在数据访问队列中消亡
AI需求随你部署的每个AI系统而增长。委员会无法扩展。解决方案是默认安全可用的健康数据。
更新时间:2026年7月11日
第一章:医疗健康领域最有价值的数据是最难获取的
简述:美国医疗健康系统拥有数十年的临床数据,这些数据可以显示哪些治疗真正有效——但几乎未被使用,因为数据访问基础设施早于AI时代。
美国医疗健康系统拥有有史以来规模最大、结构最完善的临床数据集合。数百万人数十年的诊断、实验室检查、处方、治疗程序和治疗结果记录——这是一份纵向记录,显示了人们生病、接受治疗以及最终康复或未康复的情况。如果认真对待这些数据,它们可以告诉我们哪些治疗方法对哪些患者有效,哪些每年花费数十亿美元的治疗没有产生可衡量的效益,以及哪些人群正在死于我们已知治疗方法的疾病。
但几乎没有任何数据被使用,因为数据访问的基础设施是为一个已不存在的世界构建的。
第二章:AI不提交项目,它发送提示
简述:AI代理将一个研究问题转化为对临床数据的数百次查询。访问单位不再是耗时数月的项目——而是一个提示,且查询量随着计算能力增长,而非人员数量增长。
几十年来,医疗健康领域的数据访问单位一直是项目。研究人员起草协议,机构审查委员会(IRB)进行审核,隐私官员评估数据请求,协商数据使用协议,工程师准备数据表。这一过程需要6到18个月。许多请求在研究人员放弃后不了了之,问题也得不到解答。只有那些成功完成这一过程的研究人员才能开始工作。
如果你的机构就是以这种方式与研究人员共享数据,AI将把你淹没。
当一个AI代理被要求分析再入院模式时,它会编写查询,检查结果,完善查询,再编写新的查询——在回答一个问题的过程中,可能会这样重复上百次。数据访问的单位不再是耗时数月的项目,而是一个提示。而且查询量将呈指数级增长,因为需求将不再与分析师的人数成正比,而是与可用计算能力成正比。
吞吐量
三种不同制度下的数据请求队列
无论有多少请求到达,每周只有四次获得批准。委员会和审查流程是瓶颈,它们的吞吐量不会随着需求量增长。
- 研究员时代 · 每周4次:四次请求能顺利通过人工审查瓶颈
- 分析时代 · 每周20次:请求在瓶颈前堆积,部分在等待中被放弃
- 代理时代 · 每分钟100次:瓶颈被淹没,放弃成为常态
第三章:没有人审查过程能够适应AI的需求
简述:治理委员会每周批准固定数量的数据请求,而AI需求呈指数增长。审查能力呈线性增长;不存在更快的委员会未来。
本能反应是寻求操作性解决方案:更快的委员会、更好的分诊、更多的审查人员。这些都不足以解决问题,因为这种不匹配是数学问题:能力呈线性增长,而需求呈指数增长。你可以将审查人员数量翻倍——每次请求的机构开销在1万到3万美元之间——这样可以为自己争取几个月的缓冲时间。但需求曲线将在一个季度内消耗掉这些增加的能力。
不存在更快的委员会未来。委员会模式有固定上限,而需求曲线没有,且上限已经被触及。
第四章:这不是关于训练数据的问题
简述:医疗健康的AI数据危机不是关于训练模型——而是关于推理:每个已部署代理对临床数据发送的查询都需要在机器速度下获得批准,针对的问题无人能预测。
关于AI和健康数据的讨论不幸地集中在临床记录是否应该用于训练基础模型上。医疗健康领域的数据访问危机几乎与训练无关。
训练是一个离散事件:模型只构建一次,批准一次。推理是连续的——已部署的代理在每次提示、每次完善、每次跟进时查询结构化数据,针对的问题无法提前预测。结构化临床数据是训练大型语言模型的薄弱基础。但在推理时,它具有极高的价值。拟议的支付方合同对去年的病例量收入意味着什么?哪些服务线在风险调整后的再入院率上是异常值?过去三年中,有多少符合十二项纳入标准的患者在这里就诊?这些查询中的每一个都会在推理时击中数据仓库,而当前的合规基础设施对每个查询都给出相同的答案:排队等候。
合规负担
训练与推理的合规比较
训练只需一次数据访问批准。推理则需要对每次查询在机器速度下进行批准,针对的问题无人能预测。两个合规问题,伪装成一个。
- 训练 · 一次性事件:数据访问批准一次,模型即构建完成
- 推理 · 连续过程:已部署代理持续查询数据,无限期进行
第五章:在有人询问之前确保数据安全
简述:默认安全可用的健康数据——在源头即去标识化——使合规成为每个输出的属性,而非其前面的关卡。
如果需求呈指数增长而审查能力呈线性增长,答案的形状在任何人编写一行代码之前就已经确定。你不能在指数流量前设置更快的关卡。你需要将安全性从使用点转移到源头——这是一百年来解决关键基础设施问题的方式。
在水处理厂出现之前,城市接受了数千居民会因不安全的水而死亡的事实。他们用源头的基础设施取代了水龙头处的检查员:水处理厂使每一滴水在进入管道前都变得安全。检查从消费点转移到生产点,然后消失了。
健康数据已准备好进行同样的转变:合规是每个输出的属性,而非其前面的关卡。
解决方案
已解决的数据请求队列
相同的需求。没有瓶颈。每个请求都带有自己的合规工件,在到达任何人之前已通过验证。关卡已消失,因为数据不再需要它。
- 每个请求在源头即验证:请求以代理时代相同速率进入,无堆积
常见问题:关于AI和健康数据访问
研究人员获取临床数据需要多长时间?
通常需要6到18个月。数据请求需经过IRB审查、隐私评估、数据使用协议协商和工程准备——许多请求在问题未得到解答前就被搁置。Subsalt通过提供已经去标识化且安全可用的数据,将这一过程缩短至几分钟。
为什么数据治理委员会跟不上AI的发展?
委员会的能力呈线性增长——更多的审查人员、更快的分诊——而AI驱动的需求随可用计算能力增长。一个AI代理可能发送数百次查询来回答一个问题,因此没有人审查流程能匹配这一数量。
健康数据问题与AI训练还是AI推理有关?
主要是推理。训练是一个离散事件,只需批准一次;已部署的AI代理会随着每次提示和后续操作持续查询临床数据。每次查询都需要数据已经是安全的——这就是为什么合规必须从审查关卡转移到数据本身。
"默认安全可用"对健康数据意味着什么?
每个输出都带有自己的合规工件:数据在源头即被去标识化——作为软件执行的专家判定——在任何人(无论是人类还是AI)接触它之前,而不是逐请求审查。这是健康数据基础设施应有的形态。
这是合成数据吗?
是的——从它不是原始受保护健康信息(PHI)的意义上来说。生成的数据在统计上忠实,并根据HIPAA的专家判定标准进行去标识化。已正确去标识化的健康信息不再属于PHI,因此HIPAA隐私规则不限制其使用或披露。
HIPAA下的专家判定是什么?
专家判定是HIPAA认可的去标识化健康数据的两种方法之一:合格专家应用统计和科学方法确定数据中任何人被重新识别的风险非常小,并记录该判定。专家判定应作为软件执行——对每个输出连续执行——而非一次性咨询服务。
这是Safe Harbor去标识化吗?
不是。HIPAA提供两种去标识化途径:Safe Harbor剥离18类标识符;专家判定则统计确定重新识别风险非常小。专家判定在满足相同监管标准的同时保留了比Safe Harbor更多的分析效用。
【全文结束】

