人工智能正迅速扩展至医疗保健领域,各大科技公司纷纷推出工具,允许用户通过聊天机器人寻求医疗建议。然而,据《麻省理工科技评论》报道,人们对这些系统的可靠性和安全性日益担忧。近期的产品发布凸显了这一势头:微软推出了Copilot Health,用户可连接医疗记录并提出个性化健康问题;亚马逊将其Health AI工具的使用范围扩展至One Medical服务之外;OpenAI和Anthropic也已将类似功能集成到各自平台中。
这些工具的兴起既反映了技术进步,也体现了强劲的用户需求。各公司表示,大语言模型的进步使得生成更准确、更有用的健康回复成为可能。与此同时,数百万用户因传统医疗系统获取受限,转而向AI寻求医疗咨询。
专家承认,AI工具有助于减轻医疗基础设施的压力,特别是在分诊方面——帮助用户判断是否需要就医。理论上,这可以让轻微症状患者在家管理病情,同时将重症病例更快地导向医院。例如,OpenAI推出了HealthBench,这是一个用于评估模型如何应对真实健康对话的基准测试。其最新模型(包括GPT-5系列)相比早期版本性能有所提升,但结果仍远非完美。
独立评估则提供了更多细节。斯坦福大学的MedHELM等框架测试了模型在广泛临床任务上的表现,也将OpenAI的最新模型评为高分。然而,专家指出,这些基准测试通常评估的是孤立的回答,而非完整的、来回的患者互动。但近期研究已对性能提出质疑。一些研究表明,AI系统可能对轻症过度推荐护理,或未能准确识别紧急情况。这些不一致性凸显了依赖未经广泛独立评估的工具的风险。
研究人员认为,大多数AI健康工具仍主要由开发公司自身评估,这引发了关于透明度和潜在盲点的问题。虽然企业已引入内部基准测试来检验性能,但专家表示,这些测试可能无法完全反映真实用户与技术的交互方式。另一个挑战在于用户如何与AI系统互动。非专业人士可能难以提供准确信息或正确理解回复,从而影响所获建议的质量。这种模型能力与现实使用之间的差距可能限制其有效性,尤其是在复杂的医疗场景中。
据该报告称,业界普遍认为AI健康工具前景广阔,尤其是在改善信息获取方面。但专家强调,在广泛依赖这些系统进行诊断或治疗之前,需要进行严格的第三方测试并建立更清晰的安全保障措施。
【全文结束】

