AI健康工具激增,安全性和可靠性引发担忧:来自《麻省理工科技评论》的见解Surge of AI in Healthcare Sparks Concerns Over Safety and Reliability: Insights from MIT Technology Review, ETEnterpriseai

环球医讯 / AI与医疗健康来源:enterpriseai.economictimes.indiatimes.com美国 - 英语2026-08-27 03:04:09 - 阅读时长2分钟 - 948字
人工智能正迅速渗透医疗领域,微软、亚马逊、OpenAI等科技巨头纷纷推出医疗聊天工具,用户可借此获取健康建议。然而,据《麻省理工科技评论》报道,这些系统的可靠性及安全性正引发广泛担忧。尽管大语言模型进步显著,但独立评估显示,AI在分诊、诊断等方面仍存在偏差,可能过度推荐轻症护理或漏判紧急情况。专家强调,目前多数AI健康工具仍由开发公司自行评估,缺乏透明度和第三方测试,用户与系统的交互方式也可能影响建议质量。业界一致认为,AI在改善医疗信息获取方面潜力巨大,但需建立更严格的测试与保障机制,才能广泛用于诊断和治疗。
AI健康工具安全可靠医疗保健聊天机器人分诊健康咨询基准测试评估透明度担忧
AI健康工具激增,安全性和可靠性引发担忧:来自《麻省理工科技评论》的见解

人工智能正迅速扩展至医疗保健领域,各大科技公司纷纷推出工具,允许用户通过聊天机器人寻求医疗建议。然而,据《麻省理工科技评论》报道,人们对这些系统的可靠性和安全性日益担忧。近期的产品发布凸显了这一势头:微软推出了Copilot Health,用户可连接医疗记录并提出个性化健康问题;亚马逊将其Health AI工具的使用范围扩展至One Medical服务之外;OpenAI和Anthropic也已将类似功能集成到各自平台中。

这些工具的兴起既反映了技术进步,也体现了强劲的用户需求。各公司表示,大语言模型的进步使得生成更准确、更有用的健康回复成为可能。与此同时,数百万用户因传统医疗系统获取受限,转而向AI寻求医疗咨询。

专家承认,AI工具有助于减轻医疗基础设施的压力,特别是在分诊方面——帮助用户判断是否需要就医。理论上,这可以让轻微症状患者在家管理病情,同时将重症病例更快地导向医院。例如,OpenAI推出了HealthBench,这是一个用于评估模型如何应对真实健康对话的基准测试。其最新模型(包括GPT-5系列)相比早期版本性能有所提升,但结果仍远非完美。

独立评估则提供了更多细节。斯坦福大学的MedHELM等框架测试了模型在广泛临床任务上的表现,也将OpenAI的最新模型评为高分。然而,专家指出,这些基准测试通常评估的是孤立的回答,而非完整的、来回的患者互动。但近期研究已对性能提出质疑。一些研究表明,AI系统可能对轻症过度推荐护理,或未能准确识别紧急情况。这些不一致性凸显了依赖未经广泛独立评估的工具的风险。

研究人员认为,大多数AI健康工具仍主要由开发公司自身评估,这引发了关于透明度和潜在盲点的问题。虽然企业已引入内部基准测试来检验性能,但专家表示,这些测试可能无法完全反映真实用户与技术的交互方式。另一个挑战在于用户如何与AI系统互动。非专业人士可能难以提供准确信息或正确理解回复,从而影响所获建议的质量。这种模型能力与现实使用之间的差距可能限制其有效性,尤其是在复杂的医疗场景中。

据该报告称,业界普遍认为AI健康工具前景广阔,尤其是在改善信息获取方面。但专家强调,在广泛依赖这些系统进行诊断或治疗之前,需要进行严格的第三方测试并建立更清晰的安全保障措施。

【全文结束】