患者本能地向医生提供比向应用程序更多的细节。头痛会变成一个更完整的故事,包括疼痛的具体位置、持续时间以及是否伴随恶心或畏光等症状。
相比之下,数字工具通常只能获得压缩版信息。研究人员表示,这种习惯也延伸到了医疗聊天机器人身上。
一项新研究精确测量了当人们认为人工智能正在阅读他们的症状时,会省略多少信息,以及这些省略是否会影响报告的临床实用性。
人们向AI输入的信息更少
由维尔茨堡大学(JMU)心理学研究所研究助理Moritz Reis领导的团队在英国招募了500名成年人进行简单测试。
每位参与者编写了两份症状报告,一份关于异常头痛,另一份关于流感样疾病。
一半人被告知医生会阅读他们的描述,另一半人则被告知AI聊天机器人会阅读。
页面文字虽有变化,但说明保持一致。为人类医生撰写的报告平均为256个字符,而为聊天机器人撰写的报告平均为229个字符,约少一个句子。
盲法评估报告
为验证报告长度与质量的关联,研究团队将每份报告通过专业评分系统进行评估。
评估标准是描述对判断谁需要紧急医疗干预的实用价值。
得分越高,意味着医生能根据描述内容自信地提供诊疗建议。
发送给聊天机器人的报告平均得分低8%。四名持证医师(两名神经科医生和两名肺科医生)参与了数据审查。
他们在不知情的情况下随机评估报告,无法区分是为医生还是聊天机器人撰写的。其专业判断与AI评分结果高度一致。
小遗漏快速累积
被省略的内容正是医生构建完整诊断的关键背景信息。例如头痛持续时间,或凌晨3点的咳嗽特征。
这些细节并不难描述,但当人们认为机器在阅读时,输入量明显减少。
研究人员确认质量下降直接源于内容长度缩减。更短的描述导致自我分诊——即决定是否需要立即就医的初级筛选——效果显著降低。
聊天机器人准确性可能崩溃
AI工具通常在标准化测试场景中验证,而非针对真实用户输入的杂乱段落。
这往往掩盖了实际问题。聊天机器人可能通过基准测试,但若患者仅提供部分信息,仍可能导致真实患者被错误分流。
即使在当时确实出现相关症状的参与者中,这种质量差距仍然存在,而不仅限于想象症状的群体。
另一篇关于在线症状检查器准确性的研究也报告了类似现象:实验室级别的高准确率在接触日常用户输入时大幅下降。
被机器误解
为什么人们对聊天机器人更加吝啬信息?研究团队描述了"独特性忽视"现象——即认为AI将人视为类别而非个体。
如果工具仅匹配模式,患者会质疑描述具体细节的必要性。
"许多人认为AI无法理解其个人情况的个别细微差别,而只会匹配标准化模式,"Wilfried Kunde教授解释道。
隐私担忧和对算法诊断能力的普遍怀疑也可能影响信息分享意愿。
该团队先前研究发现,一旦被告知是AI生成的,人们会认为相同医疗建议的可信度和可执行性显著降低。
设计更好的问题
解决方案不是开发更智能的模型,而是设计更智能的问询流程。研究团队主张医疗聊天机器人应主动提示用户输入医生会关注的细节。
包括症状持续时间、严重程度以及加重或缓解因素——而非等待用户自行判断哪些内容重要。
展示优质描述的具体示例可增强医疗建议质量。
向用户解释系统如何处理信息同样重要。当理解工具逻辑时,人们可能更愿意提供完整信息。
"如果我们不信任机器理解我们的独特性,可能会无意识地保留它提供精确帮助所需的关键信息,"Reis表示。
实际疾病可能改变行为
参与者描述的是被要求想象的状况,而非真实生病且急需护理的情境。
研究团队指出,在现实场景中,情绪压力更高的真实报告可能与本实验结果存在差异。
这种信息缺失现象在实际临床应用中是否持续存在,仍需进一步研究验证。
AI分诊的人性一面
此前研究从未量化在AI看到患者问题前被省略的信息量。医疗聊天机器人评估几乎完全聚焦于模型端性能。
本研究首次量化了人性因素:健康成年人与机器对话时,报告质量因27个字符的缺失而降低8%。
对个人而言8%的差距看似微小,但当乘以数百万次症状检查器查询,缺失细节将导致大量基于不完整信息的分诊决策。
开发者现面临具体改进方向。患者也应意识到:即使无人阅读,提供完整信息对获得准确医疗建议至关重要。
该研究发表在《Nature Health》期刊。
【全文结束】

