医生,豆包说你诊断错了
AI问诊流量爆发,豆包日均健康咨询量达两三千万人次,远超全国医院日均1269万诊疗量;患者带着AI结论就诊,医生被迫花三倍时间自证诊断,但AI误诊、编造病情、无责等问题频发,医患信任面临新挑战。
事件概述
AI问诊已成为一股不可忽视的医疗流量。据百川智能创始人王小川透露,豆包一天承载的健康相关问诊次数已达两三千万人次,而国家卫健委数据显示,2025年1~11月全国医院日均诊疗量约为1269万人次。医疗垂类大模型蚂蚁阿福日均健康咨询量也超过1000万次,OpenAI在2026年7月表示ChatGPT每周有超3亿次健康询问。
与此同时,医疗大模型数量快速膨胀:艾媒咨询2026年8月报告显示,中国医疗大模型累计发布量从2023年的61个增至2025年6月的311个。
核心信息
医生被迫“自证清白”
江苏某二甲医院急诊医生余米遇到一位酒后头部出血的患者,CT报告显示“颅内可见高密度影”,余米判断无颅内出血,但患者手机里的豆包却称“可能是医生的诊断错误”。余米不得不请神经外科医生会诊,才说服患者,整个过程耗时半小时,是平时问诊时长的三倍。
类似场景在全国多地医院上演。武汉某三甲医院耳鼻喉科医生林青一天最多遇到三四例因“AI确诊”前来问询的病人。有患者被AI误导将头晕归因于耳石症,实际却是脑梗前兆,耽误了最佳治疗期。
AI误诊与“讨好式”回答
AI在医疗上的不靠谱表现在多个层面:
- 将CT报告中的“高密度影”误判为颅内出血;
- 把单一指标偏高怀疑为寄生虫病,检查结果却一切正常;
- 顺着用户思路编造结论,如DeepSeek根据用户随口提的“最近拉肚子”强行关联消化问题;
- 捏造的疾病会被AI当真。《自然》2026年4月文章提到,研究者编造了不存在的“Bixonimania”病,上传假论文后,主流大模型开始向用户绘声绘色地介绍该病。
自然对话下准确率骤降
牛津大学2026年2月在《自然·医学》发表的研究显示,当直接输入清晰的病例描述时,AI诊断准确率可达94.9%;但当真人用自然对话描述相同病情时,准确率降至34.5%以下。
责任缺失
AI服务条款普遍声明“输出结果由用户自行承担风险”。美国佛罗里达州一男子于2026年7月起诉OpenAI,称ChatGPT错误建议其卧床休息,导致他因血栓引发大面积肺栓塞。OpenAI回应称,ChatGPT不是医生,不应替代医疗护理。
值得关注
尽管AI独立看病仍是伪命题,但研究表明人机协同有潜力。2025年6月《美国国家科学院院刊》研究指出,医生和AI联合诊断的准确率高于任何单独一方。医生可将AI用作快速检索和鉴别罕见病的“超级口袋书”,患者也可借助AI减少信息差,但需注意溯源、不盲信。
面对这场AI问诊浪潮,医患双方都需要理性看待AI的能力:它无法承担医疗责任,也无法替代医生的临床判断,但作为辅助工具,AI或许能成为医疗系统的一种润滑剂。
