人类专家揭示AI'医生'出错频率Here's how often AI ‘doctors’ get things wrong, according to human experts | FOX 13 Tampa Bay

环球医讯 / AI与医疗健康来源:www.fox13news.com美国 - 英语2026-07-20 00:04:33 - 阅读时长4分钟 - 1577字
宾夕法尼亚州立大学最新研究显示,以ChatGPT为首的AI医疗聊天机器人能准确回答约76%的健康相关问题,在常规健康咨询和一般医学问题上表现较好,但在心理健康和皮肤科领域表现较差。研究发现AI系统在回答健康问题时的表现优于传统搜索引擎,但研究人员警告公众不要依赖AI进行自我诊断,强调其准确性仍无法与人类医生媲美。该研究将于2026年计算机械协会公平性、问责制和透明度会议上公布,同时盖洛普调查显示近半数美国人已将AI纳入医疗决策过程。
AI医生健康问题医疗指导准确率自我诊断医疗保健皮肤科心理健康内科常见疾病医疗决策
人类专家揭示AI'医生'出错频率

人工智能驱动的聊天机器人(如ChatGPT)能够准确回答约四分之三的健康相关问题,这是宾夕法尼亚州立大学的一项新研究结果,该发现既展示了AI用于医疗指导的潜力,也揭示了其局限性。

由宾夕法尼亚州立大学副教授兼研究员阿穆拉·亚达夫(Amulya Yadav)领导的研究团队招募参与者向ChatGPT等各类AI系统提交200多个健康相关症状描述和医学问题。随后,九位董事会认证的医生对这些回复的准确性和可靠性进行了评估。

AI"医生"的准确率为76%

研究表明,大型语言模型(LLMs)在回答用户提交的健康问题时,平均准确率约为76%。在分析中包含的其他大型语言模型中,ChatGPT表现最佳。

总体而言,AI系统在回答健康相关问题时的表现明显优于Google和Bing等传统搜索引擎。

亚达夫在接受美联社采访时说:"我惊讶于它们[LLMs]表现得如此好。但当然,我认为我们都应该对语言模型输出的任何内容保持高度警惕,因为它基本上是一个随机标记生成器。"

这些发现将于本周在蒙特利尔举行的2026年计算机械协会公平性、问责制和透明度会议(FAccT)上公布。

AI表现最佳与最差的领域

研究还确定了AI表现较差的几个领域。与皮肤科、心理健康和内科相关的问题通常获得较低的准确率评分。

皮肤科问题通常需要图像分析,而AI系统在这方面的能力仍不如处理文本信息的能力。心理健康问题也带来挑战,因为它们需要细致的判断。

相比之下,AI在更常规的健康咨询上表现最佳,包括常见疾病和一般医学问题。

AI成为无医生人群的资源

根据世界卫生组织的数据,全球超过50%的人口无法获得适当的医疗保健和全面覆盖。

亚达夫表示,虽然有医生可以就诊的普通人不应放弃面对面的诊疗而选择AI医生,但AI可以成为全球无法接触医生的人群的重要资源。

"这对那半数无法获得医生服务的人口来说似乎是一件好事,对吧?特别是对那半数无法获得医生服务的人口来说。"亚达夫说,但他警告称:"目前,大型语言模型的准确性不如人类医生,因此我们不应该,或者说我们应该非常谨慎。这是我们向公众传递的信息:在使用大型语言模型进行自我诊断时应非常谨慎。"

越来越多的人转向AI

这些发现出现在越来越多的人转向AI工具获取传统上从医疗保健提供者或在线搜索中寻求的信息之际。

事实上,盖洛普最近的一项民意调查显示,近一半的美国人,AI在他们的医疗决策中扮演着某种角色。

在大多数情况下,AI的作用是补充其他医疗建议,或提供快速答案。然而,在某些情况下,AI正被用作完全替代前往医生诊所的手段。

超过70%的受访者表示,他们在过去30天内以某种方式使用了AI;然而,原因各不相同。对大多数人来说,原因归结为更快地获得答案,或者他们想要了解更多关于自己的健康信息。超过一半的人还表示,他们想在去看医生之前或之后进行研究。

14%接受调查的人声称,由于AI提供的信息,他们跳过了前往医生诊所的行程。盖洛普指出,这相当于估计有1400万人因为AI的建议或信息而放弃了与医疗专业人员的会面。

在前30天内使用AI的超过40%的人声称,他们不想支付或无法支付医生的就诊费用。其他人表示,他们需要在营业时间之外获得帮助,或者没有时间预约,而21%的人表示他们过去曾被医疗服务提供者忽视或忽视。

亚达夫补充道:"我更担心的是那些能够并且确实能够获得医疗服务的人。我们真的想走这条路吗——仅仅因为LLMs能够回答问题,就消除对人类医生的需求?我们应该让他们在那里回答问题吗?这句老话——既然你有一把锤子,并不意味着所有东西都必须是钉子。"

资料来源:本报道来自洛杉矶。美联社校园洞察、此前FOX Local报道对此有贡献。

【全文结束】