药物安全评估,特别是在上市后阶段,特别容易受到分析误判的影响,因为它依赖于异质性证据流、不完整数据、罕见事件以及在重大不确定性下做出的决策。反复出现的错误来源包括对条件概率的误解、将相关性与因果关系混淆、不适当的分母和对照组选择、对背景发病率和混杂因素考虑不足、聚合伪影(如辛普森悖论)、以及对由多重性或重复测试产生的探索性发现的过度解读。误判可能进一步被缺乏明确暴露分母的自发报告数据所放大,这些数据容易受到报告偏差的影响,也可能被脆弱或不完整的元分析以及对微弱或背景不完整的信号过早的监管或公众反应所放大。使用选定的真实世界案例研究和概念示例,本叙述性综述说明了这些错误如何在临床、监管和公共领域产生和传播,以及它们如何实质性地影响因果关系评估和决策。本文还讨论了人工智能(AI)如果在没有透明度、偏差评估和临床监督的情况下实施,可能会放大而非减少这些漏洞。需要更强的分析纪律、更清晰的不确定性沟通、证据流之间的三角验证以及对新兴AI工具的谨慎治理,以支持更可靠的药物安全评估。
关键要点:当早期证据被误读、脱离背景或被视为比实际更强有力时,药物安全决策可能会被扭曲。本文展示了如何解释概率、研究比较、自发报告和聚合证据中的错误可能导致错误结论、不必要的担忧或真实风险的延迟识别。它认为,更强的分析纪律、更清晰的不确定性沟通以及对人工智能等新兴工具的谨慎使用,对于更可靠的因果关系评估和更好的药物安全决策至关重要。
1 引言
Isaacs和Fitzgerald在他们的论文《循证医学的七种替代方法》中讽刺性地描述了由权威、热情或自信驱动的方法,表明在缺乏严格的评估方法时,临床决策可能由权威、修辞、恐惧或过度自信而非证据的系统整合所驱动。尽管是幽默的,但他们的框架强调了一个严肃的观点:如果没有明确的方法学保障,证据的解释可能会被认知、社会和制度压力所扭曲。
在高风险环境中,分析推理和证据解释中的错误可能会产生深远的后果。荷兰护士Lucia de Berk因基于严重分析推理错误的检察官谬误而被错误定罪。检察官辩称她出现在多名患者死亡事件中的概率是3.42亿分之一,并将这一数字视为几乎确定的罪证。这种推理错误忽略了重症监护病房中的基础死亡率、高风险临床环境中事件的聚集、选择性将事件分类为可疑、报告和确认偏差以及工作相似班次的护士数量。De Berk被判处终身监禁,并于2010年完全平反,突显了分析误判可能带来的灾难性后果。
药物安全决策,特别是在上市后信号评估中,同样处于高风险环境中,依赖于跨多个证据流的数据的系统生成和解释。因此,数据和分析在药物警戒(PV)中至关重要,支撑信号检测、因果关系评估和监管决策。同时,这一环境特别容易受到分析误判的影响,因为它严重依赖不完整数据、异质性证据来源以及在不确定性下进行的方法学复杂评估。监管紧迫性、公共卫生危机和媒体放大可能进一步增加错误的易感性,压缩彻底评估可用的时间。与在其他高风险环境中一样,误判因果推断可能导致具有现实世界后果的错误结论,特别是当分析输出被视为确定性而非仍需要临床和科学判断的输入时。
本文是一篇选择性的叙述性综述,而非对药物安全相关所有分析陷阱的系统综述。案例和示例被选择用来说明与药物安全决策特别相关的反复出现的分析误判形式。目标不是提供全面的目录,而是突出代表性机制,说明分析误判如何扭曲因果关系评估和后续决策。以下部分说明了这些漏洞如何产生,以及为什么严格的背景化对良好的药物安全决策至关重要。
2 药物安全中分析误判的关键来源和表现形式
我们将分析误判定义为在评估药物风险时,由于对概率、统计发现、方法学假设或用于评估药物风险的数据的误解或误用而导致的推理错误,导致错误结论。这些错误可能导致过早行动、对药物风险的误解、不必要的产品撤市、不当的公众担忧、扭曲的真实世界使用模式或医疗资源的误配。在本文中,我们区分了三个相关但不完全相同的难题:(A)形式概率谬误,(B)由有缺陷的设计或解释引起的更广泛的分析推理错误,以及(C)放大对不确定证据误解释的沟通失败。下面讨论的一些示例直接说明了形式概率错误,而其他示例则作为概念类比呈现,阐明了药物安全中类似机制的误解释。
2.1 检察官谬误:条件概率的误读
检察官谬误通常出现在法律环境中,当给定罪行的证据概率P(证据|有罪)被错误地等同于给定证据的有罪概率P(有罪|证据)。在药物安全中,类似的误解可能发生,当给定药物暴露的不良事件(AE)概率P(AE|药物暴露)被混淆为给定AE的药物暴露概率P(药物暴露|AE)。在这种情况下,倒置错误包括将AE病例中暴露于药物的比例解释为风险证据,而不是估计暴露患者中AE的发病率。
图1说明了在一个100人的人群中检察官谬误的理论示例,其中25人暴露于药物,9人经历了AE,4人同时接受药物治疗并经历了AE。在这个例子中,P(药物暴露|AE)是4/9,或44%,而P(AE|药物暴露)是4/25,或16%。将44%视为暴露患者中AE的风险因此会错误表述安全问题,并可能导致错误的因果解释。如果AE在未暴露患者中更不容易被检测、归因或报告,这种错误可能会因差异可观察性而进一步加剧,从而夸大表观关联。
一个类似的倒置错误可能在药物警戒(PV)中出现,当监管结果被用作条件事件。在经常被引用的例子中,美国食品药品监督管理局(FDA)作者对2008年批准的22个新分子实体进行了回顾性审查,在随后的10年中记录了189个新识别的安全问题。他们报告说,FDA不良事件报告系统(FAERS)是第一年审批后最频繁的触发源,在第1年占69%,总体约占15%。
这一结果有时被解释为自发报告价值的证据。然而,报告的百分比对应于条件概率P(FAERS参与|标签变更),即在标签变更中FAERS作为触发源的比例。感兴趣的安全问题是不同的:它涉及P(标签变更|FAERS信号),即FAERS中识别的信号最终反映需要监管行动的真实安全问题的概率。用前者代替后者构成了类似于检察官谬误的倒置错误,并可能导致高估自发报告的证据价值。要估计P(标签变更|FAERS信号),需要FAERS中检测到的完整信号分母,以及它们后续被归类为证实、驳回或不确定的情况,并在考虑报告偏差、知名度偏差和差异随访的情况下与其他信号源进行比较。没有这些信息,引用涉及FAERS的标签变更比例会夸大这些结果对预测性能或因果可靠性的支持程度。正确的解释更窄:在本特定队列中最终导致标签更新的安全问题子集中,FAERS是促成其识别或优先排序的多个数据流之一。
另外值得注意的是,一些标签行动是在不确定性下的预防性措施,而非确定性因果证明的终点,反映了即使在证据不完整或发展中的情况下也优先考虑患者保护的监管立场,而延迟行动直到完全确定本身可能也带有风险。因此,关于标签变更的许多决定代表了不确定性下的风险管理判断,而非因果关系的确认,并可能随着新证据的积累而修订。同时,标签变更通常反映多个证据流的汇聚,而非单一来源的确认。因此,在标签决策中特定数据源的存在不应被解释为确立其独立的预测价值或因果可靠性,而是作为更广泛的、综合的证据过程的一部分。
2.1.1 案例研究
一个真实世界的例子涉及早期对COVID-19 mRNA疫苗和心肌炎的安全担忧。疫苗接种后心肌炎的初始报告引发了广泛担忧,特别是在年轻人群中。由于疫苗接种率和媒体报道都很高,相当大比例的报告心肌炎病例发生在接种疫苗的个体中,这可能夸大了感知的疫苗相关风险,即使有些病例可能在接种疫苗的人中偶然发生。Barda及其同事的更严格研究表明,尽管疫苗接种后心肌炎风险确实略有增加,估计每10万人中有2.7例额外病例,但实际SARS-CoV-2感染后的风险更高,每10万人中关联11.0例额外病例。轮状病毒疫苗和肠套叠的情况也类似。早期聚集暗示可能存在因果关系。后来,Patel及其同事的大型跨国研究证实了小的增加风险,大约每51,000至68,000名接种疫苗的婴儿中有1例额外病例,但也证明疫苗每年预防了80,000多例住院和1,300例死亡。
尽管这些案例都不是检察官谬误的教科书示例,但它们都说明了概念上相关的推理错误。在每种情况下,特别是在公众讨论和早期反应中,时间或统计关联被隐含地视为因果关系的证据,而没有充分考虑在没有因果效应的情况下观察到报告模式的可能性。至少,这反映了将零假设下观察到模式的概率与药物导致该事件的概率混淆的倾向。
2.2 自发报告和不均衡性:当分子伪装成风险
提交给监管机构的自发AE报告,如通过FAERS提交给美国FDA或世界卫生组织的VigiBase,是上市后药物警戒的基石,并在早期检测潜在安全信号方面发挥关键作用。这些报告通常用于识别不成比例报告(SDRs)信号,这是通过比较特定药物-AE对在报告系统中相对于所有其他药物-事件组合的出现频率而生成的统计信号。然而,这些系统的数据经常被误解,特别是当原始AE计数被直接采纳并随后传播到下游分析中时,一些专家认为这是对循证医学原则的威胁。
使用广泛的产品可能会产生大量AE报告,仅仅因为它们被广泛使用,而开处方较少的产品可能显得相对更安全,因为它们产生较少的报告,尽管在暴露个体中发病率较高。
报告也可能因监管行动、媒体报道或诉讼而被放大,导致差异性刺激或知名度驱动的报告,反映对AE认识的提高而非真正的风险增加。在这种情况下,升高的原始报告计数可能会放大SDRs并强化虚假信号。监管机构和制药公司因此依赖更广泛的信号评估框架,将生物合理性、临床前数据、临床试验和流行病学研究纳入结构化的因果关系评估过程中。
这些解释挑战因自发报告系统的固有限制而加剧。除了报告偏差外,AE数据集通常包含重复报告和临床信息不完整的报告。常见的不成比例指标,如报告比值比(ROR)、比例报告比(PRR)和信息分量(IC),对稀疏数据、罕见事件和小单元校正也很敏感,尽管IC在稀疏数据环境中通常被认为相对更稳定,因为贝叶斯收缩部分稳定了估计值。尽管有这些限制,许多已发表的不成比例分析夸大了结论,甚至声称风险的亚组差异,例如按年龄和性别。已发表的不成比例分析频繁存在报告质量和方法透明度方面的缺陷,证据的扭曲和过度解读也在不成比例研究报告中得到记录。
2.2.1 案例研究
一个明显的虚假安全信号示例涉及他汀类药物和肌萎缩侧索硬化症(ALS)。FAERS的不成比例分析识别出与他汀类药物使用相关的ALS样状况报告明显增加。然而,随后的流行病学和荟萃分析研究未发现他汀类药物使用与ALS发病率之间存在一致的因果关联证据。在这种情况下,刺激性报告、诊断不确定性以及高背景暴露可能促成了不成比例的报告,而没有确立因果关系。
同样,早期的不成比例分析暗示了钠-葡萄糖共转运蛋白2(SGLT2)抑制剂与急性肾损伤(AKI)之间的关联。然而,当应用主动对照组限制的不成比例分析时,未检测到AKI信号。其他研究和临床试验证据表明,SGLT2抑制剂与AKI风险增加无关,事实上与其他降糖疗法相比可能提供保护作用。在这种情况下,早期发现可能受到混杂因素、并发疾病、治疗人群中基础肾脏脆弱性以及使用非限制性背景对照而非主动对照的影响。
另一个例子涉及用于戒烟的伐伦克林相关的神经精神事件的自发报告,导致添加黑框警告。后来,一项大型随机临床试验证明严重神经精神AE没有显著增加,黑框警告随后被移除。在这种情况下,吸烟者戒烟人群中显著的基础神经精神脆弱性,加上强烈的监管和媒体关注,可能放大了报告。
最终,误读不成比例信号最好被理解为更广泛的推理错误,可能对监管决策产生下游影响。核心错误是将报告模式或甚至不成比例信号视为因果风险的证据,而没有充分考虑报告偏差、背景报告模式、缺乏暴露分母、对照组结构、患者组合以及其他替代解释。上述示例说明了这可能因不同原因而发生。总体而言,这些案例表明不成比例发现可能源于报告行为、患者特征和分析设计的相互作用,而非真实的药物特异性毒性。
2.3 辛普森悖论和药物安全中的聚合诱导分析误判
辛普森悖论指的是在聚合数据中观察到的暴露与结果之间关联的方向或幅度在按相关混杂变量分层后发生改变甚至逆转的现象。这揭示了表观粗略关联是由不适当的聚合而非真实因果效应驱动的。
2.3.1 案例研究
一个由不适当的异质性风险群体聚合引起的分析误判的著名例子是激素替代疗法(HRT)与心血管风险的争议。多年来,观察性研究表明,绝经后妇女使用HRT与冠心病(CHD)风险大幅降低相关。这些发现强烈影响了临床实践和处方行为。然而,妇女健康倡议(WHI)后来报告HRT增加了CHD风险,特别是在治疗早期。
这种明显的矛盾最初削弱了对观察性研究的信心,并引发了关于HRT真实心血管效应的不确定性。后续方法学分析阐明,观察性和随机发现之间的分歧主要是由于风险分层和聚合的差异,而非观察性研究固有的缺陷。具体而言,WHI比较了治疗开始时的妇女与未使用者,因此能够捕捉HRT早期阶段出现的CHD风险升高。相比之下,许多观察性研究比较了HRT的现时使用者(已经启动并继续治疗的妇女)与从未使用者。按设计,这些分析排除了可能经历了早期AE并停止治疗的妇女,因此不成比例地反映了已在早期高风险期"幸存"的个体的后期使用阶段。当观察性分析被重构以模拟随机实验并在组间对齐治疗开始后的时间时,它们的发现与WHI一致。
这种模式代表了药物安全中辛普森悖论式的逆转,由治疗开始后的时间和现时使用者人群中选择的不适当聚合驱动。在聚合层面,HRT似乎具有心脏保护作用。然而,在按年龄和治疗开始后时间适当分层后,关联的方向发生了逆转,揭示了早期超额风险,而这种风险因将早期启动者(经历较高短期风险)与长期使用者(代表经过选择和更稳定的群体)不当地合并而被掩盖。表观保护作用因此不是因果的,而是不适当跨具有根本不同基础风险的分层聚合产生的伪影。在药物安全中,这种聚合诱导的逆转可能具有重大的监管和公共卫生影响,特别是当早期观察性发现被解释为因果而没有适当的分层时。
HRT和乳腺癌风险也观察到类似现象。观察性研究报告的风险估计值高于WHI最初观察到的风险,主要是因为观察性队列包括在更接近绝经期时开始HRT的妇女,而WHI主要招募了绝经后几年的妇女。当WHI结果按绝经后时间分层时,乳腺癌风险估计值与先前发现更接近。尽管这种模式不构成辛普森悖论的教科书示例,因为它反映的是趋同而非关联方向的逆转,但它仍然说明了不适当跨生物上不同的患者分层聚合如何产生误导性比较和证据源之间的表观矛盾。
2.4 不适当的对照组选择:COX-2抑制剂的教训
药物安全中的分析误判也可能源于不适当的对照组选择。一个突出的例子是早期对环氧化酶-2(COX-2)选择性抑制剂,特别是罗非昔布的心血管风险评估。
早期对COX-2选择性抑制剂心血管风险的评估说明了对照选择如何最初掩盖了真实的药物相关危害。罗非昔布心血管安全信号首次出现在VIGOR随机对照试验中,该试验将罗非昔布与萘普生比较,报告罗非昔布组心肌梗死(MI)发生率较高。当时,这种超额风险主要归因于萘普生的假定心脏保护作用,而非罗非昔布的促血栓形成作用,延迟了认识到COX-2抑制与心血管危害的内在关联。随后使用更广泛对照框架和基于人群设计的观察性研究对这一解释提出了挑战。Graham及其同事的研究证明,与非使用者和其他非甾体抗炎药(NSAIDs)相比,罗非昔布使用者发生急性MI和猝死的风险显著增加,具有明确的剂量-反应和持续时间-反应关系。重要的是,即使排除萘普生使用者,也观察到这种超额风险,削弱了VIGOR发现仅由萘普生心脏保护作用驱动的假设。随机证据随后与观察性研究发现趋同。APPROVe试验将罗非昔布与安慰剂比较,证明长期暴露后血栓性心血管事件明显增加,明确确认风险是罗非昔布固有的,而非对照选择的人为产物。同样,Solomon及其同事展示了与塞来昔布相关的心血管风险升高,确认信号在该类药物的其他药物中持续存在。Hammad及其同事使用电子病历数据的综合监管分析进一步支持了与COX-2抑制相关的真正心血管风险。
累积证据最终导致罗非昔布自愿从市场撤回,并说明了药物安全分析中的一个关键教训:对照选择是因果推断的基础决定因素,而非技术性附带问题。即使使用主动对照,如果对照本身具有或被认为对感兴趣的结果具有独立影响,分析误判也可能发生。此外,从安全角度看,主要作为"比较安全性"框架的分析可能会产生误导,如果它掩盖了绝对风险负担,因为相对于主动对照的相对差异本身并不能确定所观察到的事件率对暴露人群是否在临床上可接受。
2.5 识别风险人群子群体的挑战
药物安全中精炼的风险特征通常需要基于年龄、性别、合并症、遗传易感性或治疗背景识别具有差异易感性的子群体。当无法适当定义子群体特异性分母时,通常因为事件计数稀疏,风险可能被错误地假定为在所有用户中均匀分布,导致真实安全信号的稀释或风险的过度概括。
2.5.1 案例研究
早期对氯氮平相关粒细胞缺乏症的评估最初表明在治疗患者中风险大致均匀。随后的研究表明,易感性由基因如HLA-DQB1、HLA-B和SLCO1B3/SLCO1B7介导,使更精确地识别高风险患者成为可能。同样,HRT研究表明,如前所述,心血管和癌症风险在很大程度上随年龄和绝经后时间而变化,强化了需要分层分析。一个更近的例子是接种COVID-19疫苗后的心肌炎。最初的群体水平分析低估了青少年和年轻人的风险。随后的年龄分层分析揭示了该亚组中更高的基础发病率,使对疫苗相关风险的理解更加准确和平衡。
在基于自发报告系统的不成比例分析(DA)中,识别风险子群体(例如按年龄和性别)的错误尤其明显,增加了这些系统已经提到的挑战。一方面,非子群体特定的结论可能错误地表示真实风险并损害有效决策。另一方面,DA中的子群体分层极易受到差异报告偏差的影响。缺乏结构化的子群体特异性暴露数据进一步限制了可解释性。
2.6 研究设计细节的影响:口服双膦酸盐和食管癌
一个说明分析框架和研究设计如何影响药物安全结论的启发性例子是研究口服双膦酸盐使用和食管癌风险的示例。尽管使用相似的数据源和重叠的时间段解决相同的研究问题,三项主要研究得出了实质不同的结论。
第一个病例对照研究发表在《英国医学杂志》(BMJ)上,报告了长期双膦酸盐使用者食管癌风险显著增加,特别是暴露超过三年的使用者(比值比[OR] 2.24;95%置信区间[CI] 1.47–3.43)。该研究使用了1995年至2005年的英国临床实践研究数据链(CPRD)数据。相比之下,发表在《美国医学会杂志》(JAMA)上的一项回顾性队列研究使用了1996年至2006年相似时期的CPRD数据,未发现食管癌风险增加的证据(风险比[HR] 1.07;95% CI 0.77–1.49)。第三项病例队列研究将相同的CPRD数据随访延长至2009年,报告了微弱的、边际显著的关联(风险比[RR] 1.3;95% CI 1.0–1.7),并注意到对暴露滞后和审查假设的敏感性。作者明确警告不要将小效应估计解释为因果关系的确凿证据。
发现的分歧可能反映了可能实质性影响观察性安全结果的研究设计和分析假设的差异。潜在的变异来源包括如何定义暴露、如何处理持续时间和潜伏期、如何指定随访和审查,以及如何操作化风险窗口。这些研究使用相同数据库在重叠时间段内却得出不同结论的事实,突显了观察性发现对设计细节和分析选择的脆弱性。它也提醒我们,与研究设计和解释相关的某些操作细节可能因出版空间限制而对读者不可见。总体而言,这些案例表明分析误判有时反映方法学选择而非数据质量,而忽视分析背景解释风险估计可能导致不一致的监管或临床反应。
2.7 监管紧迫性、公共沟通和过早结论的风险
监管机构和公共卫生当局经常面临在证据不完整或发展中的情况下对新兴安全担忧迅速采取行动的压力。这种压力可能导致在早期安全信号的证据特征尚未足够成熟时就采取过早行动。在感知到潜在公共卫生危机或涉及广泛暴露的情况下,对快速决策的需求尤其明显,监管机构必须在预防性行动与削弱公众信心的风险之间取得平衡。以下示例说明了早期监管沟通如何在重塑现实世界处方行为的方式中可能复杂化随后的安全评估。
2.7.1 案例研究
这一动态在暂停阿斯利康COVID-19疫苗使用后关于血栓形成伴血小板减少综合征(TTS)的担忧中得到说明。与疫苗接种时间相关的罕见事件最初被解释为因果关系的证据,而非与背景发病率和基础风险因素进行评估。尽管后续分析显示疫苗相关TTS发病率极低,且益处超过风险,但最初的预防性措施在某些地区导致了公众担忧和接种率下降。
选择性血清素再摄取抑制剂(SSRI)之一的帕罗西汀的经验提供了另一个例子,说明对不完整表征的安全担忧的过早公开,被监管行动和媒体报道放大,可能导致不当的处方转移。在2003年6月FDA帕罗西汀公共卫生咨询(PPHA)关于自杀意念风险后,观察到显著的抗抑郁药处方变化。Pamer及其同事证明,在PPHA后,各年龄组的帕罗西汀使用立即下降,而非帕罗西汀SSRI的使用在同一时期增加,特别是在儿童和青少年中。这种模式与向感知为更安全的同类其他产品的通道转移一致。重要的是,这些变化发生在当时没有证据表明SSRI之间存在差异风险的情况下。后续分析表明,自杀意念风险普遍适用于抗抑郁药,而非特定于帕罗西汀。因此,协调时间、不确定性表述和证据强度对于最小化不当通道转移和保持药物安全数据的可解释性至关重要。
主流和社交媒体放大也可能扭曲风险。异维A酸(Accutane)与抑郁症和自杀意念的争议说明了病例报告和耸人听闻的叙述如何可能超过更严格的证据。当孤立报告被呈现为危害的确凿证据而没有适当背景时,公众感知和决策可能被误导。大规模研究未能建立明确的因果关系,证据表明痤疮本身可能对心理健康风险有贡献。
2.8 多重比较和重复测试的作用
多重比较和重复测试增加了遇到虚假安全信号的可能性,是分析误判的另一个驱动因素。当同时评估大量潜在的药物-AE关联时,这一风险尤为突出。重复的中期分析、多个亚组评估和敏感性分析——临床试验和观察性研究中的常见特征——进一步增加了偶然发现的机会。如果没有仔细的解释纪律,如果未明确承认其概率性质,这些发现可能被误认为是危害证据。
这一问题在临床试验方法学中早已被认识,并在自适应设计研究中特别相关,在这些研究中,累积数据被反复检查以通知早期停止或方案修改的决策。因此,监管指南和方法学框架强调在这些环境中预指定和错误控制的重要性,以防止误导性结论。
从统计角度看,调整的理由很简单。随着测试数量的增加,纯粹由于偶然观察到统计显著结果的概率也会增加,即使没有任何真实的因果效应。然而,尽管存在这种方法学风险,严格的多重比较调整在药物安全中并不普遍应用,且有合理的理由。过度校正可能增加假阴性发现的可能性,从而掩盖严重的药物不良反应。在探索性药物安全分析中,早期信号检测通常优先考虑敏感性而非特异性,理解初始发现需要后续验证而非即时因果解释。因此,只要明确承认其探索性性质,许多亚组和敏感性分析有意保留未调整。
总体而言,这些考虑表明药物安全研究中多重比较和重复测试的主要风险不在于统计程序本身,而在于结果如何被解释、强调和采取行动。正如Boulesteix和Hoffmann所强调的,分析误判通常是由选择性报告和孤立统计显著发现的夸大解释而非多重性本身驱动的,这一问题在药物警戒中特别突出,因为探索性分析经常被误认为是确证性证据。Greenland同样警告说,过度关注统计显著性可能掩盖更关键的考虑,包括研究设计、数据质量和生物合理性,而Hooper则警告在灵活性、透明度和背景解释更为适当保障的情况下机械应用校正方法的风险。
2.9 药物安全中元分析的脆弱性
元分析通常被视为证据合成的有力工具,特别是在药物安全领域,个体研究可能缺乏检测罕见AE的统计能力。当适当设计和透明进行时,元分析可以提供有价值的见解并指导监管和临床决策。因此,关注安全的元分析已经影响了高风险决策,包括涉及罗格列酮的心血管风险、噻托溴铵的死亡风险、头孢吡肟的死亡风险以及抗抑郁药的自杀意念风险。
尽管有吸引力,但元分析在药物安全中的有效性高度依赖于基础证据库的完整性和质量。一个前提是全面识别评估感兴趣安全结果的所有相关研究。然而,一些试验可能对AE保持沉默,不是因为事件未发生,而是因为安全结果未被系统收集或报告,或因出版空间限制限制了所呈现的内容。因此,汇总估计可能反映报告实践和数据可用性,以及真实药物相关风险。
元分析内的分析决策进一步塑造了解释。关于异质性处理、固定效应与随机效应模型的使用以及风险指标的选择体现了不同的假设,可能导致实质不同的结论,特别是对于罕见事件和可变随访持续时间。当元分析方法应用于观察性研究时,额外的挑战会出现。这些研究在设计、终点和暴露定义、混杂因素调整和分析策略方面通常差异很大。汇集它们可能产生异质偏差的平均值,而非更准确的因果风险估计。发表偏倚和选择性结果报告进一步使解释复杂化,可能无法仅通过统计诊断可靠检测。
总体而言,这些考虑强调元分析,尽管对证据合成很重要,但不一定总是对药物安全评估具有决定性。认识到这一差距,Zorzela及其同事引入了PRISMA危害扩展,而CIOMS X强调在元分析用于指导药物安全决策时对证据合成和不确定性的结构化评估。因此,当已发表的安全发现元分析出现在有影响力的期刊上,产生重大担忧和不必要负面后果,但最终未能反映所研究药物的真实安全状况时,存在几个高调的分析误判例子。
2.9.1 案例研究
2007年,发表在《柳叶刀传染病》上的一项元分析报告称,与包括发热性中性粒细胞减少症患者在内的其他β-内酰胺抗生素相比,接受头孢吡肟治疗的患者全因死亡率更高。这些发现促使FDA发布早期沟通,承认担忧。然而,在进行包含已发表和未发表试验数据的广泛重新评估后,FDA得出结论,总体证据不支持死亡率风险增加,头孢吡肟对其批准适应症仍然适用。FDA审查员的扩展试验级分析显示,与对照抗生素相比,没有有意义的死亡率差异。后续批评指出了原始元分析的局限性,包括患者人群和适应症的异质性、结果归因不一致、所有试验的不完全捕获以及亚组发现对分析假设的敏感性。尽管如此,初始信号导致了持续的监管审查和机构谨慎。
2008年也出现了类似模式,当时发表在《美国医学会杂志》上的一项元分析报告称,与慢性阻塞性肺疾病(COPD)的吸入抗胆碱能药物相关的重大不良心血管事件风险增加。该分析受限于不完整的AE捕获、缺乏系统的生命状态随访、试验的不完全纳入以及未能使用人时方法考虑差异暴露持续时间。不久之后,纳入6000多名患者并随访长达四年的大型UPLIFT随机试验未确认这些担忧,甚至表明心血管事件和死亡率可能降低。随后,FDA得出结论,可用数据未显示超额风险。尽管如此,初始元分析信号促使监管沟通,导致处方行为的可测量变化。
罗格列酮(Avandia)的案例代表了元分析对监管决策影响的另一个重要例子。2007年,发表在《新英格兰医学杂志》上的一项元分析表明,使用罗格列酮与MI风险增加以及心血管死亡的数值更高风险相关。这些发现引发了快速监管行动,包括FDA安全沟通、咨询委员会审议、黑框警告和处方限制,随后是该药物使用的急剧下降。随后包含更全面证据的重新评估,包括对RECORD试验的重新分析,未确认原始元分析所暗示的心血管风险程度。基于此,FDA最终移除了处方限制和REMS计划。然而,临床上有意义的处方反弹并未发生。
总体而言,这些案例表明,当早期元分析发现被解释为因果关系的确证证据时,分析误判可能发生。在每种情况下,有影响力的出版物促成了监管行动和临床实践的变化,这些变化在更明确的证据出现后进行了修订。这些例子突显了药物安全决策特别容易受到过早结论的影响,特别是当结果如死亡率或心血管事件提高感知紧迫性时。
2.10 人工智能作为分析误判的潜在放大器
在本节中,我们使用"警报"指代尚未经过专家审查的初始模型生成模式,"信号"指代值得进一步调查的信息,"验证信号"指代已经过初步临床和科学评估的担忧。人工智能(AI)支持的系统可能生成比简单警报更丰富的输出,因为它们可以在检测阶段整合多个数据源。即便如此,这些输出在经过结构化人工审查和正式信号验证之前仍保持假设生成性质。这种区分在当前高维数据环境中变得越来越重要。现代药物警戒系统在涵盖数百万电子病历和同样大规模自发报告AE的规模上运行。在这种环境中,基于相关的AI模型几乎肯定会识别大量统计可检测模式,其中大多数可能缺乏临床意义或因果合理性。如果没有AI建模过程中的嵌入式因果视角,信号检测工具有风险识别大量假阳性发现,超出可用专家能力,并降低下游安全决策的质量、效率和及时性。更重要的是,自动化改变了生成这些模式的规模和速度,增加了弱或虚假关联不仅被检测到,而且被迅速传播并以不当信心采取行动的风险。这一挑战不仅仅是理论上的。它反映了早期实施经验,例如FDA Sentinel系统内最初决定不立即部署信号检测,尽管有法定授权,反映了对大规模、基于关联的分析缺乏充分因果框架相关风险的认识。
出于这些原因,智能AI支持的信号检测工具应在核心设计中至少纳入初步的因果知情优先级排序的定性层。这并不意味着在检测点做出明确的因果结论。相反,它意味着编码结构化推理,以支持以更符合经验丰富的安全评估员判断合理性的方法进行分诊、过滤和优先级排序,考虑合理性、替代解释以及病例级和聚合证据之间的一致性。嵌入这种因果知情优先级排序促进信号管理生命周期中从检测到验证和确认的连续性和一致性。早期因果过滤可以减少不必要的下游返工,支持更适度的升级决策,并改善自动化输出与后续人类科学评估之间的一致性。以这种方式,因果知情AI模型不仅增强信号检测前端的效率。它们还可能加强药物警戒中的科学完整性和决策质量。目标不是自动化因果关系评估,而是定义系统所需的科学保障,这些系统以符合核心药物警戒原则的方式优先、过滤和升级信号。同时,这些系统的开发和实施也可能揭示当前药物警戒实践可以改进、标准化或改进的领域。关于贝叶斯证据评估、结构化证据聚合和精准药物警戒的已发表方法学工作与此相关,因为它使关于证据权重、不确定性和背景相关性的假设更加明确。这些方法可能帮助AI支持的系统支持更严格的优先级排序和证据评估,而非对脆弱关联的不透明升级。然而,其价值最终取决于透明的假设、特定于来源的偏差评估、可追溯的推理和持续的专家监督。
这里讨论的考虑主要旨在作为前瞻性设计问题和可能的故障模式,而非声称此类故障已在常规监管实践中得到广泛证明。尽管AI在药物安全中可能创造重要的证据整合机会,但如果在没有适当保障的情况下部署,它也可能引入分析误判的新途径。核心担忧是AI方法不会超越其基础数据的限制,并可能继承、复制或放大来自缺失、不完整或结构性不平衡数据源的偏差。分析误判的风险可能在信号管理生命周期的多个阶段出现。在检测阶段,在自发报告、电子健康记录或索赔数据上训练的AI模型可能优先识别在记录良好的人群中信号,同时未能检测到在代表性不足的亚群中的真实风险。此类不平衡可能产生假性保证和虚假警报。如果设计不当,AI驱动的证据合成可能掩盖混杂、误表示背景发病率,或过度强调统计显著但临床脆弱的模式。当叠加在已经复杂的概率推理上时,未经透明度、偏差审计和专家临床判断解释的AI输出可能强化本文概述的分析误判形式。值得注意的是,最近对在可疑数据集上训练的AI疾病预测模型的审查强化了AI可能无法克服基础数据弱点,反而可能传播或放大的观点。AI在药物安全中的采用可能进一步受到模型稳健性、可解释性和可靠性方面未解决问题的限制,当输出用于GxP监管决策环境时,这些限制尤其重要。
3 讨论和对药物安全决策的启示
在药物安全中,通常没有单一数据源足以确立药物相关风险。更可靠的推理来自对机制合理性、临床试验、观察性研究和结构化因果关系评估的严格整合。当孤立发现(如统计显著关联、不成比例信号或汇总估计)脱离更广泛的证据背景并被视为决定性时,就会发生分析误判。关于风险沟通和统计推理的既定工作表明,即使是训练有素的临床医生和研究人员也会误解概率信息,特别是当风险以相对术语或不透明格式呈现时,导致对大小和临床相关性的扭曲感知。后果超出了方法论辩论。它们可能包括不成比例的监管行动、公众信任的削弱、调查能力的误配以及次优的患者结果。在本文讨论的示例中,核心主题是错误不仅源于不确定性的存在,还源于在不确定性下如何框架、综合和沟通证据。通过识别反复出现的陷阱并说明其后果,本文旨在支持药物安全中更稳健、基于证据的因果关系评估和决策。
高调安全信号,特别是涉及严重AE的信号,创造了将早期发现视为决定性的强烈激励。然而,药物安全在一个早期证据通常是假设生成而非确证的环境中运作。自发报告缺乏暴露分母,一些观察性研究易受混杂和设计选择影响,甚至已发表的临床试验证据可能受限于不完整的报告、异质设计和分析脆弱性。当关联或筛选输出被解释为因果确认而非需要进一步评估的初步发现时,就会发生误判。
重要的是,这些漏洞不会随着单个分析而结束。当这些发现随后通过元分析框架综合时,它们经常被传播和放大,其中选择性纳入、结果聚合和隐含的可比性假设可能进一步放大不准确的安全信号。这种脆弱分析信号的升级,从探索性测试到被视为确证性证据,如图2所示。
实际困难在于,早期沟通,无论是监管、媒体驱动还是诉讼放大的,可以将临时信号转化为持久信念,使后来的基于证据的更正看似逆转而非更新。这是分析误判变得具有操作后果的一种机制,因为它可能潜在地影响处方、通道转移、依从性和后续安全数据的可解释性。因此,最小化分析误判需要明确匹配故障发生位置的保障措施。安全评估应保持正确的概率框架,并清楚区分假设生成、信号验证和因果推断。分母和对照组纪律应被视为跨证据流的基础质量标准,必要时通过暴露调整发病率、绝对风险估计和与相关背景率的基准测试支持。在观察性分析中,混杂和通道偏差应通过适合目的的设计选择来解决,包括主动对照组设计、倾向评分方法和残余或未测量混杂的敏感性分析。多重性、重复测试和数据驱动的信号生成需要在可行时进行预指定、透明报告、临床背景化、跨独立数据源的复制以及防止对偶然发现的选择性强调的解释规则,包括对中期和自适应决策规则的仔细关注。安全沟通应通过校准语言、明确限制和清楚区分正在调查的信号与最终结论来保留不确定性,以便迭代学习被视为预期而非可疑。最后,药物安全评估也受益于整合流行病学、生物统计学、临床前科学、毒理学、临床医学、药理学和许多其他相关学科专业知识的多学科审查。咨询委员会、独立监测委员会和监管审查机构可以提供结构化论坛,以挑战假设、识别统计谬误,并确保与证据强度相称的安全相关行动。
4 结论
药物安全评估特别容易受到分析误判的影响,因为它依赖于异质性证据、稀疏结果、发展中的数据以及经常必须在因果确定性可达到之前做出的决策。在本文讨论的示例中,反复出现的漏洞不仅是统计或方法论的。它们还通过证据如何被沟通、操作化和日益自动化而被放大。因此,减少分析误判需要严格的分析方法、证据流之间的三角验证以及对新兴AI支持工具的谨慎监督。加强这些保障措施可以改善因果关系评估,并支持更适度的监管反应,从而在必要时实现预防性行动,同时避免可能最终损害患者获取有效疗法的不必要限制。
【全文结束】

