铭鸿体育资讯网

才半年就被中国反超!美国吹上天的医疗AI,瞬间不香了。 今年3月,斯坦福的模型

才半年就被中国反超!美国吹上天的医疗AI,瞬间不香了。

今年3月,斯坦福的模型 Merlin 登上《自然》,美国媒体一片兴奋,直接给它安了个 "CT 界的 ChatGPT" 的名号。

当时它能在腹部 CT 上识别 30 种影像发现,虽然准确率还没摸到医生平均水平,但在那个时间点,确实算领先。

谁能想到,才半年刚过,9 月 18 日,阿里达摩院联合浙大一院的成果就登上了《科学》,一个叫 DAMO RADAR 的模型,直接把比赛终点线往前挪了一大截。

先说说 Merlin 到底是个什么来头。它是个 3D 视觉语言大模型,训练用了 15331 个腹部 CT、六百多万张图像,配上电子病历里的 183 万条诊断码和放射科报告。

说白了,斯坦福把医院里那些已经沉淀好的片子和文字报告喂给模型,让它自己学。

它能做的事挺杂:30 种零样本影像分类、692 种临床表型预测、6 种慢病的 5 年发病预测、20 个器官的三维分割,凑一块儿 752 个子任务。底子打得不错,但论文自己也承认,在直接诊断这件事上,离资深医生还有距离。

再说 RADAR。它一上来就没跟你客气,瞄准的是腹部增强 CT—— 这行里公认最难啃的骨头。腹部那地方器官挤成一团,软组织密度又差不多,年轻医生最怕进的就是这个组。

RADAR 一口气覆盖 18 个解剖结构,识别 146 种病症,连恶性肿瘤都包在里面。近四万次真实世界检查测下来,AUC 到了 0.913,这个数字在放射科语境里,就是 "专家级" 的意思。更关键的是,这是全球第一个把通用影像 AI 做到专家水平的。

技术上它赢在哪?达摩院的说法叫 "器官级细粒度对齐"。以前模型看 CT,是把整团三维数据囫囵吞下去,再去对报告文字,信号稀稀拉拉学不准。

RADAR 反过来,先把 CT 在肝、胆、胰、脾、胃肠这些器官上拆开,再用 Qwen 语言模型把放射报告也按器官拆成一段一段,让影像区域和文字描述一对一扣上。这么一拆,原来百万级的个体图文对,变成了千万级的解剖级图文对。

模型学的时候,知道自己在看哪个器官、对的是哪句话,还能画出注意力图,标出它觉得可疑的位置,医生回去一核对就行。这事儿不花额外人工标注,全靠医院现成数据。

论文发表第二天,代码和权重就按 Apache 2.0 协议开源了。这一点很多人没意识到分量。Apache 2.0 是最宽松的开源协议之一,商业医院拿去用、改、二次开发,都不用付授权费。等于把一个专家级 AI 的底座,直接扔给了全世界。

这就看出来,医疗 AI 的赛场规则变了。前几年大家比的是 "模型大不大、论文发在哪、刷榜分数高不高"。Merlin 其实就是典型的 "基座模型" 思路,铺任务、铺数据,证明这条路走得通。

RADAR 不一样,它一落地就直奔临床诊断,而且是最难的腹部增强 CT,直接对专家水平。这说明竞争从 "能不能学会" 变成了 "能不能真看病",门槛一下子拉高了。

中国团队这次赢的不是算法玄学,是产学研贴得紧。达摩院出算法和工程能力,浙大一院出临床场景、真实病例和专家标注经验。

这种 "大厂研究院加顶级三甲" 的组合,其实美国也有,斯坦福自己就绑着医院。差别在于,RADAR 没有停在发论文这一步,而是把开源、可解释、真实世界验证这套闭环一次做完了。

对基层医院来说,一个能出报告、能圈可疑区域、专家复核就能用的模型,比一个发在 Nature 上的基座有意义得多。

别把这事儿简单读成 "机器要抢医生饭碗"。放射科医生看完片子平均要十几分钟,基层医院缺的恰恰是能一眼看出问题的人。

RADAR 这种模型,更像是给县医院、社区医院配了一个不知疲倦的初筛助手,把最可疑的片子先挑出来,让上级医生远程复核。

之前院士在浙大一院看类似系统时就说过,希望这套东西能推广到山区海岛。这才是开源真正的价值 —— 不是让 AI 取代谁,是把专家的眼睛复制一万份。

最后补一句,从 3 月到 9 月,半年刚出头,顶刊从 Nature 换到 Science,识别数从 30 种影像发现跳到 146 种病症,准确率从 "还没到医生水平" 跳到 "专家级"。

这种迭代速度,放在任何一个行业都够吓人的。医疗 AI 这盘棋,接下来怎么下,值得盯着看。