首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线

摘要

AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线 克雷西 2026-09-18 14:11:06 来源: 量子位 克雷西 发自 凹非寺 量子位 | 公众号 QbitAI AI正在横扫一切,但有块硬骨头,迟迟攻不下来,让无数人希望落空。 2016年,Hinton老爷子就预言:“人们现在就应该停止培养放射科医生。”他甚至认为,五年内,AI就会在医疗影像识别上超过放射科医生。...

克雷西 量子位 DAMO RADAR AGI最难一战 竟在医院 中国AI登上Science 医生不怕失业还催着上线 2026 凹非寺
2026-09-18 1 阅读 约9分钟阅读 克雷西
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线 克雷西 2026-09-18 14:11:06 来源: 量子位 克雷西 发自 凹非寺 量子位 | 公众号 QbitAI AI正在横扫一切,但有块硬骨头,迟迟攻不下来,让无数人希望落空。 2016年,Hinton老爷子就预言:“人们现在就应该停止培养放射科医生。”他甚至认为,五年内,AI就会在医疗影像识别上超过放射科医生。 老爷子一生谨慎,但历史和他开了个玩笑。十年过去了,人们离AGI已经越来越近,但 在医疗场景里, 即使图像识别这样的AI新手村任务,依然是hard模式。 如果从IBM的Watson算起,在医疗上遭遇滑铁卢的AI专家数不胜数。 为什么医疗成了AI的阿喀琉斯之踵? ——对模型精度的极高要求,在别的领域,模型幻觉可以一笑了之,但在这里却是人命关天。 这也导致了医疗影像AI长期困在专用模型里。 直到今天,学术期刊的“王者”Science正式刊发一项来自中国的重磅研究: DAMO RADAR,据介绍是全球首个专家级的通用影像AI模型。 这个模型,能看腹部18种解剖结构的146种病,比很多影像科医生看得还准。 而且模型、代码、框架,全开源了。 一个模型,看146种病 DAMO RADAR,全称Rapid Abdominal Diagnosis with AI and Radiology,面向腹部快速诊断的AI模型。 这个AI“雷达”,研发团队就是阿里达摩院,过去几年他们用AI识别CT中肉眼难见的早期癌症病灶,在胰腺癌、胃癌、肠癌等专病上取得重大突破,发表5篇Nature Medicine。 但做着做着,达摩院有些人觉得不对劲了。达摩院高级算法专家张建鹏说,一个病种啃下来至少两三年,人类疾病成千上万种,那他们搞一辈子都搞不完…… 更棘手的是,真实世界里,病人不会只带着一种病来医院,对着专病模型问他是不是有这种病。事实上,一份CT影像里,很可能同时存在多种器官,多种病变。 达摩院联合浙大一院等全球众多医院向腹部CT发起冲击,希望AI能一次性识别出腹部各种疾病。 选腹部,是因为这是临床公认最难的影像场景。 浙大一院放射科主任肖文波介绍,年轻医生通常最害怕被分到腹部组。 因为腹部涉及消化系统、泌尿系统、生殖系统,肝胆胰脾肠道全挤在一起,肠道还盘绕整个腹腔,所有器官几乎都是软组织,密度接近,全靠肉眼对密度差的敏感度把病灶揪出来。 之前,已经有了针对肺结节之类的AI辅助工具,但腹部太复杂了,一直是个禁区,没人敢碰。 RADAR要做的,就是用一个模型覆盖整个腹部。 最终它覆盖了18种解剖结构、146种病,涵盖肝脏、胰腺、胆囊、肾脏、脾脏、肠道等主要器官,基本覆盖了临床常见病变。 对其效果,团队做了非常严格的多层验证。 在内部近3.9万例真实世界连续队列中,RADAR的平均AUC达到0.913。 AUC是衡量诊断模型区分患者和正常人能力的指标,1是完美区分,0.5等于瞎猜,超过0.9就算优异。 之后,团队又在来自8家外部医院的超过2.4万例CT上验证,这些案例覆盖不同地区、不同扫描设备,RADAR的AUC仍然达到0.895。 而且RADAR还泛化到了急诊场景。 急诊场景与一般门诊的区别是,由于时间紧急,来不及等造影剂发挥最佳效果,患者也不一定有能力配合,CT成像效果偏差。 RADAR的训练目标并未包括急诊,但测试时团队拿2.7万例急诊数据一测,结果AUC依然有0.904。 而且达摩院在肝癌、胰腺癌、胃癌、肠癌四种癌症的诊断上,还提高了对RADAR的要求。 在这四种癌症上,他们用来考验RADAR的依据,是“病理金标准”,也就是以病理活检结果作为Ground truth,确认影像判断准不准。 这个拔高测试当中,RADAR的AUC仍达到了0.891-0.984。 达摩院还做了一波人机对比。 这波对比共有来自14家医院的26名放射科医生参与,RADAR和TA们在同一批病例上各自独立诊断,结果RADAR的准确率超过了其中23名医生,只稍弱于3名资深医生。 与此同时,达摩院还测试了人机协同场景,发现医生在有AI帮助的情况下读片,整体敏感度提升了大约10%,平均阅片时间减少了30%以上。 “初级医生+AI”的配置,敏感性甚至超过了资深医生独自阅片。 那RADAR到底是怎么做到的? 过去的医疗影像AI用的是监督学习,简单说就是让医生一张一张地标注CT图像,然后AI照着标注学。 这种方法标注成本巨大,而且模型只能识别被标注过的那几种病,换一种就不认识了。 RADAR走了一条不同的路,叫视觉-语言对比学习。 医院里天然存在大量CT影像和对应的诊断报告,RADAR直接从影像和报告文本的对应关系中学习,不需要医生额外逐片标注。 这有点像医学生跟着主任查房,主任看片子的时候会说“肝脏有一个低密度灶,考虑血管瘤”,学生听多了,自然就知道什么影像特征对应什么诊断。 但直接把整张CT和整份报告对齐,效果很差。 团队一开始就试过这条路,结果发现模型只能学到一些粗糙的统计特征,建立不起来“哪个器官对应哪段描述”的关联。 因为一套腹部CT有几百张切片,包含好多个器官,真正有问题的可能只是某个器官上一个很小的病灶,如果让模型拿整张图去理解,关键信号就被大量正常组织淹没了。 这就涉及到了RADAR的核心突破——“器官级细粒度对齐”。 它先从CT中定位出肝脏、胰腺、胆囊、肾脏等各个器官,把一整套CT拆解成一个个器官单元,再把每个器官单元和报告中对应的描述精确对齐。 这一设计的灵感,来自放射科医生的真实工作方式。 医生看腹部CT时,也不会把整个腹部当一个整体扫一眼,TA们会依次看肝脏、胰腺、胆道、肾脏、肠道,一个器官一个器官地过。RADAR让AI也按这种方式去学习。 另一个创新叫自适应对比建模。 标准的对比学习默认把不同病人的特征严格区分,但在医疗场景里,如果两个人的肝脏都是健康的,就不应该被割裂看待。 同理,得了同一种病的两个患者,影像特征也应该被放在一起学习。 RADAR会根据这些医学知识,动态调整样本之间的距离。 而且论文里展示的Scaling Law曲线显示,随着数据增长,模型性能还在持续上升,曲线没有饱和的迹象。 帮医生“少漏一个病灶” Scaling Law曲线还在涨,但眼下RADAR够到的能力,已经开始改变一线医生的工作节奏了。 “第一次看到RADAR的验证数据,我都不敢相信。”浙大一院放射科主任肖文波说,AI能在腹部这么多相似结构里一下子检出146种病,AUC还有0.9上下,完全超乎医生们的想象。 科室里开始沸腾,很多医生说:赶紧部署起来!很多外面医院的医生也闻讯前来,希望AI能帮助他们解决腹部CT这个头疼的问题。 肖文波干了三十多年影像,带着300多人的科室,科室每天处理几千份片子。 写一份腹部CT报告,哪怕中高年资的医生,没有20分钟下不来,一例CT包括数百张图像,挨个过。 这活儿她太清楚有多难了。 直到她发现RADAR接
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱