英国一项实验研究显示,当前主流人工智能聊天机器人在协助公众判断和应对疾病方面,并未优于传统搜索引擎;在信息不完整或表述略有变化的情况下,还可能给出差异较大的建议。研究人员认为,这类模型尚未准备好用于直接患者护理场景。
据《纽约时报》报道,随着人工智能聊天机器人日益普及,医疗健康已成为用户最常咨询的话题之一。部分医生表示,已接触到一些先通过人工智能获取“初步意见”的患者。调查显示,约六分之一的成年人每月至少使用一次聊天机器人查询健康信息。
不过,英国牛津互联网研究所教授亚当·马赫迪(Adam Mahdi)等学者开展的一项实验指出,现实医疗情境远比考试题目复杂。研究团队邀请1200多名英国成年人,围绕包含症状、生活习惯和病史的虚构案例,与多款商用聊天机器人(包括ChatGPT和Llama)互动,并判断是否需要就医或采取何种措施。研究结果已发表于《自然·医学》杂志。
疾病识别准确率不足四成
结果显示,在聊天机器人辅助下,参与者选择正确处置方式的比例不足一半;对具体疾病的识别准确率约为34%,与仅使用谷歌等传统搜索方式的对照组相比,并无显著差异。研究据此指出,现阶段相关模型并不适合直接用于患者护理决策。
研究还发现,约一半错误与用户输入信息不充分有关。当研究人员一次性提供完整病例信息时,模型的诊断准确率可达94%。专家指出,医生经过专业训练,能够判断哪些症状更为关键,而普通用户未必具备这种能力。因此,研究团队建议,模型应更主动提出追问,而非完全依赖用户的精准表述。
此外,模型在判断病情紧急程度方面表现不够稳定。对于症状相近的案例,仅因措辞略有不同,系统可能分别给出“居家休息”或“立即就医”的建议。个别情况下,还出现虚构热线号码等错误信息。
研究人员表示,尽管企业持续更新模型、改进追问能力,但聊天机器人在真实医疗决策中的可靠性仍有待进一步验证。专家建议,公众在使用相关工具获取健康信息时应保持谨慎;如出现疑似紧急或严重症状,应及时寻求专业医疗帮助。



