2026年7月,一篇来自香港中文大学联合中国科学院自动化研究所、微软研究院、里海大学等机构的论文悄悄挂上了arXiv,编号2607.10522。这篇技术报告讲的是一个叫AMID的系统——一个能让医学影像AI开发走向自动化的框架。想了解详情的朋友,直接搜这个编号就能找到全文。

医学影像AI开发究竟有多难?这么说吧,一位资深放射科工程师,光是调整模型训练策略、验证方式、评估指标,就得耗费大量时间。而且每个任务——CT、MRI、病理切片——还得单独处理。现在问题来了:能不能让AI自己干完这一整套活儿,还要干得有理有据、经得起检验?
研究团队给出的答案,是一个叫AMID的系统——全称是Autonomous Multi-agent Framework for Medical Imaging model Development。在20项涵盖不同成像模式和任务类型的医学影像挑战中,AMID的表现碾压了现有的通用机器学习自动化系统,甚至在部分任务上逼近甚至达到了人类专家团队的水平。
一、为什么医学影像AI的"自动化"这么难
医学影像可不是一个统一的领域。CT图像是三维体素构成的密度分布,MRI图像反映的是不同组织的电磁响应,病理切片是通过显微镜看到的染色细胞,超声图像则充满了斑点噪声和伪影。同样是"分割病变区域"这个任务,面对肺部CT和面对脑部MRI,所需要的预处理方式、模型架构、后处理逻辑、评估指标,可能完全不同。
这就好比同一道题目——"请做一道主菜"——对一个只会中餐的厨师和一个只会法餐的厨师来说,理解和执行的方式可能天差地别。通用型的AI工程自动化系统,就像个什么菜都能"凑合做"的帮厨,它懂得通用的烹饪流程,但不懂为什么宫保鸡丁要先炸花椒,也不懂为什么法式酱汁要小火慢熬。
从实际数据来看,当前通用机器学习自动化系统在医学影像任务上暴露出两个根本性的缺陷。第一个缺陷是搜索空间太粗。这些系统看到一个任务,只会把它归类为"分类"或"分割",然后从通用工具箱里随便拿一个方案去试。但医学影像任务需要根据成像模态、解剖部位、标注语义、患者分组方式等具体条件,挑选真正适合当前数据的方法。用一把通用钥匙去试图打开所有锁,既费时又徒劳。
第二个缺陷是验证反馈不可靠。医学影像实验往往需要耗费大量GPU资源和训练时间,一次实验的结果可能因为数据切分方式、指标计算方向、预测文件格式等细节问题而严重失真。一个系统如果只是追求"得到一个分数",却不核验这个分数是否真实可信,就可能被一个"虚假的好成绩"误导,最终交付一个根本无法实际使用的模型。
正是针对这两个痛点,AMID被设计出来。
二、AMID的第一把钥匙:数据条件驱动的方法规划
AMID解决第一个缺陷的方式,可以用"侦察兵先行"来理解。在派出任何一支"施工队"去训练模型之前,AMID首先会派出一支专门负责侦察的队伍,仔细研究手头的任务和数据,把能知道的信息全部摸清楚,然后根据这份情报,制定一份有针对性的作战方案。
这个过程被研究团队称为"数据条件驱动的方法规划"(Data-Conditioned Method Planning,DCMP)。它的工作分为两个阶段。
第一个阶段是数据侦察。系统会仔细检查任务说明文件、样本提交格式、标注文件、元数据,以及所有可见的训练数据。侦察的内容非常具体:文件的组织结构、训练集和测试集的样本数量、患者编号的规律、图像的维度和数据类型、像素强度的范围、体素的间距和朝向、标注的稀疏程度、类别的分布是否失衡,等等。对于不同的任务类型,侦察的重点也不同——分割任务要看前景像素的比例和连通区域的数量,检测任务要看目标框的数量和尺寸分布,配对增强任务要核查图像对之间的对齐情况。
这些侦察结果不只是描述性的报告,而是具体的规划依据。比如,如果发现3D血管标注非常稀疏,侦察报告就会提示:这个任务需要补丁采样策略、间距归一化、感知拓扑结构的后处理,以及内存受限的推理方式。如果发现数据是病理切片,报告就会提示:需要图块切割、染色变化处理,以及基于切片或患者级别的聚合策略。
第二个阶段是方法资源搜索。在拿到侦察报告之后,AMID会根据数据的具体特征,在两个资源库中寻找匹配的工具。第一个是预置的本地资源库,其中包含nnU-Net(一个在医学图像分割领域广受认可的自配置框架)和MONAI(一个专为医疗健康深度学习设计的开源工具集)等经过验证的工具。第二个是一个精心维护的医学影像基础模型注册表,其中收录了MedSAM、MedSAM2(可提示的通用医学图像分割模型)、TotalSegmentator(面向CT解剖结构的分割工具)、VISTA3D,以及面向病理学、胸部X光、CT、MRI和眼底成像等特定领域的基础模型。
关键在于,AMID不会不加筛选地把所有热门模型都推荐给后续的执行队伍。它会检查每个候选资源是否与当前任务的数据特征匹配,是否可以获取和验证其可用的模型文件。只有真正适合当前任务、在当前环境中可以实际运行的资源,才会被纳入方案。
经过这两个阶段,AMID会生成一个由多条"方法车道"(method lanes)组成的方案组合。每条方法车道相当于一条独立的解题路线,包含具体的建模假设、支撑这个假设的数据证据、所需资源、实现要求、预处理假设、验证义务、大致计算预算、预期产出以及可能遇到的失败模式。这些方法车道通常包含一条稳健的基线车道(如nnU-Net风格)、一条基础模型适配车道、一条特定任务架构车道、一条侧重预处理或后处理的车道,以及专门用于验证数据加载和指标计算机制的"校准车道"。
这样的安排,确保后续的执行队伍从一开始就站在有据可依的起点上,而不是在一片空白中盲目摸索。
三、AMID的第二把钥匙:带审核员的两阶段优化
解决了"搜索空间太粗"的问题之后,AMID还需要解决"验证反馈不可靠"的问题。这里用来解决问题的核心机制,是研究团队所设计的"验证引导的两阶段优化"(Verification-Guided Two-Stage Optimization)。
理解这个机制的关键,在于理解一个角色:审核员。在AMID的工作流程中,每个执行队员(工作智能体)负责实现一条方法车道,跑完训练和推理,生成预测文件,并提交一个包含代码、验证分数、日志和预测产物的记录。但是,这个工作智能体不能自己给自己的结果盖章认证。它提交的记录会被标记为"待审核"状态,由一个独立于工作智能体的审核员来评估。
审核员会检查一系列问题:验证切分是否合法?指标的计算方向是否正确(有些指标越高越好,有些越低越好)?预测文件是否完整?提交的内容是否与上一次重复?代码与产物之间是否可以追溯?对于医学影像任务来说,审核员还会特别检查是否存在患者级别的数据泄漏、折交叉验证是否被正确执行、平均分数的计算方式是否符合规范。只有通过了这些检查,一次实验记录才成为"真实的、可归因的、可比较的"证据。
在这个审核机制的保障下,优化过程被分为两个阶段展开。
第一阶段叫做"行为门控探索"(Behavior-gated Exploration)。在这个阶段,多个工作智能体被分配到不同的方法车道上并行工作,目的是快速覆盖方案组合中主要车道的实际表现。每个工作智能体提交的记录都会经过审核员的评估,只有通过审核的记录才算作该车道的有效覆盖。当各条车道都积累了足够数量的有效记录,并且表现趋于稳定时,系统管理员会根据各条车道的最佳有效成绩,遴选出最具潜力的候选方案,进入第二阶段。
第二阶段叫做"选择性精耕"(Selective Exploitation)。这个阶段不再做宽泛的方法探索,而是把计算资源集中在第一阶段遴选出的候选方案上,进行深度优化。优化的方向包括改进模型结构、调整训练策略、优化推理过程、引入测试时增强、改进后处理,或者对多个模型进行集成。与此同时,审核员的核查标准进一步提升:第二阶段的候选方案不仅要验证分数过关,还需要在完整的交叉验证折上跑完全部结果,确保折与折之间的流程保持一致,并且能够从最终提交包追溯回某个经审核认可的实验记录。
这两个阶段相互配合,既避免了过早押注单一方向的风险,又保证了最终交付的模型包是基于可信证据选出来的,而不是基于某个碰巧看起来不错、却站不住脚的虚假成绩。
四、AMID的第三把钥匙:自组织的多智能体执行引擎
把上述规划和优化逻辑落地运行,需要一套能够让多个AI编码智能体协同工作的执行基础设施。研究团队称之为"自组织智能体循环"(Self-Organizing Agent Loop)。
这套基础设施的核心,是一个生命周期管理器(Lifecycle Manager)。它扮演的角色类似于一个工程项目的总调度,负责掌管每个工作智能体的状态变迁:从初始化、代码编写、等待评估、反馈反思、任务重新分配,直到退休和产物准备。当一个工作智能体陷入停滞、耗尽了当前方向的潜力、或者快要触碰上下文长度限制时,管理器不会坐视不管,而是主动介入——用一个定向提示打断并恢复这个智能体的工作,而不是简单地把它整个重启。
多个工作智能体各自在独立的代码工作区中运行,但它们都共享同一个文件系统级别的记忆空间。这个共享记忆存储了实验记录、方法车道文件、资源清单、验证状态、审核报告、最终产物记录,以及可以在不同工作智能体之间复用的"技能"(Skills)。每个实验记录都把分数绑定到具体的代码提交哈希值、智能体身份、验证协议、方法车道归属和预测文件路径上。这样一来,后续的工作智能体可以查看前面的智能体已经尝试过什么、失败在哪里、哪些代码路径是成功的,而不需要每次重新发现同样的约束条件。
系统还设计了"心跳干预"(Heartbeat Interventions)机制,专门用来防止长时间运行的工作智能体偏离轨道。管理器会监控实验流的整体情况,当发现某个智能体长时间没有进展、出现原地打转的迹象时,会触发不同类型的心跳提示。"反思心跳"让智能体把近期的结果整理成有具体原因和下一步行动的实验笔记;"整合心跳"让智能体综合所有已记录的笔记,找出矛盾之处,梳理整体状态,识别哪些方向还没有被充分探索;"停滞心跳"强制智能体在停止改进时做出明确的转向决策,要求它写出当前专注方向、现有证据、剩余预算和放弃条件。
在AMID中,这些心跳干预还被特别附加了医学影像领域的提醒:智能体需要保持任务原生的数据处理方式,避免陷入本地调优的陷阱,在放弃某个有文献支撑的方向之前先检查参考资料,并且始终维护最终产物证据的完整性。
五、在20个医学影像挑战上,AMID表现如何
研究团队选用了ReX-MLE这个专门为医学影像自动化开发设计的挑战基准,对AMID进行了系统评测。这个基准包含20个任务,覆盖了全景X光、CT、MRI、CTA(CT血管成像)、MRA(MR血管成像)、病理切片、超声和显微镜等多种成像模式,任务类型则涵盖图像分割、目标检测、分类、图像质量评估和图像增强。
作为对比对象,研究团队选取了ReX-MLE基准中已报告的三个通用机器学习自动化系统:AIDE、ML-Master和R&D-Agent。为了让比较尽可能公平,所有对比系统都使用了GPT系列模型作为后端,AMID的主要测试版本使用的是搭配GPT-5.5的Codex后端。每个挑战任务给予AMID 24小时的挂钟时间预算和一张48GB显存的NVIDIA RTX A6000 GPU。
在这20个任务中,AMID对全部任务都产生了通过审核的有效结果,并在其中19个任务上超越了对比系统中的最佳成绩,仅在TopCoW-CTA-Cls这一个分类任务上与最强基线持平。
在图像分割任务上,差距最为显著。以ISLES'22脑卒中病灶分割为例,AMID获得的Dice系数(一种衡量分割准确度的指标,满分为1)达到0.71,而对比系统中最好的也只有0.04,差距近17倍。在NeurIPS-CellSeg细胞分割挑战中,AMID达到了0.90的F1分数,而对比系统的最高成绩是0.36。在PUMA病理组织分割任务中,对比系统全部失败或得零分,而AMID获得了超过0.56的Dice系数。在SEG.A主动脉分割中,AMID以0.91的Dice接近人类专家水平(0.92),而对比系统全部在0.02分以下徘徊。
在目标检测任务上,DENTEX全景X光牙齿检测是一个典型案例。AMID达到了0.49的平均精度(AP),相比对比系统最高的0.09,提升了约4倍。值得一提的是,DENTEX任务的人类专家参考成绩也是0.40,也就是说AMID在这个任务上超过了人类专家团队。在PUMA病理核检测中,AMID在Track1获得0.54的F1分数,在Track2获得0.28,而在Track2的官方榜单上,这个成绩实际上排在第一名——尽管绝对数值看起来并不高,但这是因为任务中包含大量稀有细胞类型,所有参赛者的成绩都普遍偏低。
在图像质量评估任务LDCT-IQA(低剂量CT感知质量评估)中,AMID获得了2.74的评分,与人类参考成绩完全持平。
当然,并非所有任务上的表现都令人满意。超声图像增强任务USenhance是研究团队专门分析的一个失败案例。AMID提交的是一个基于pix2pix风格U-Net的五折集成模型,产物是完整有效的,但最终结果的LNCC(局部归一化互相关系数,越高越好)只有0.18658。更强的CycleGAN风格生成对抗网络方案在探索阶段被尝试过,但由于生成器和判别器之间的训练不稳定,早期损失曲线收敛缓慢,在固定预算内积累的有效证据太弱,反而被审核机制拒于门外,最终让位给了更稳定但不够强力的配对U-Net方案。这说明对于需要漫长、精细监控训练过程的图像生成类任务,当前的固定预算机制还存在明显的短板。
两个TopCoW血管拓扑分类任务也暴露了一种特殊的难题:当目标任务在本质上要求多个子任务(血管分割、拓扑后处理、图分类)同时做好、相互配合时,在固定预算内只靠提升分割质量是不够的。CTA版本的分类直接退化成了固定拓扑先验,MRA版本虽然使用了SegResNet血管掩码和接触规则,但前段血管和后段血管的分类精度分别只有0.46和0.17,远低于人类专家水平。
六、让AMID成功的,是哪些具体的技术选择
仔细观察AMID在不同任务上取得成功的内部逻辑,可以发现一个反复出现的模式:找到与任务结构真正匹配的方法,而不是用一个通用方法硬套所有任务。
DENTEX牙齿检测任务的最终提交方案,是一个非常有意思的混合设计。它以一个针对全景牙科X光适配的YOLOv8检测器为基础,然后叠加了一个解剖校准层:根据牙弓模板,把无序的检测框映射到FDI象限编号和牙位编号,并结合保守的诊断回退统计和学习到的替代牙位规则。这种设计的出发点非常直接——牙位枚举这个任务,从本质上既是视觉检测问题,也是解剖排序问题,所以正确的解法应该把学习到的检测器和结构化的领域先验结合起来,而不是把所有标签都当成独立的检测类别来处理。
PUMA病理任务的成功则依赖于对病理学基础模型的有效利用。组织分割的Track1方案,在冻结的UNI病理基础编码器之上叠加轻量级MLP分类头,把局部组织token与RGB特征和坐标线索结合;Track2则对Phikon-v2基础模型的最后一个Transformer块进行微调,并融合全图、固定裁剪和滑动裁剪三种推理方式的结果。核检测的方案选择了不同的分解逻辑:Track1用CellViT-256先提出核候选和token嵌入,再用梯度提升分类器结合局部和邻域上下文做分类;Track2用PathoSAM提议加上Midnight病理嵌入,配合一个小型经典分类器集成。这些选择的共同点,是把基础模型作为稳定的特征提取骨干,而不是从零开始训练通用CNN。
在NeurIPS-CellSeg细胞分割任务上,AMID选择微调Cellpose-SAM,一个专门针对细胞分割设计的结合了Cellpose和SAM能力的模型,最终获得约0.90的F1成绩。在SEG.A和ISLES'22这两个3D医学图像分割任务上,AMID回归到经过充分验证的nnU-Net风格方案,辅以后期检查点选择和保守的解剖清理或召回导向的掩码合并策略。在TopCoW血管检测任务上,AMID没有强行使用同一个通用检测器处理CTA和MRA两种模态,而是分别使用了几何先验、热图中心预测、分割推导框和轻量级直接检测器的组合。
说到底,这些案例都在说明同一件事:两阶段优化的真正价值,不只在于"探索阶段找到了很多方案,精耕阶段挑了最好的那个",而在于探索阶段产生了真实可比的多车道证据,让系统在精耕阶段能够基于可信的事实做出有依据的选择,而不是被某个虚假的高分牵着鼻子走。
七、这项研究意味着什么,又有哪些坦率的局限
研究团队在讨论部分开诚布公地指出了当前版本最明显的局限,这种坦诚值得记录。
代价高昂是最主要的限制。长时间运行的医学影像AI开发流程,既消耗大量GPU计算时间,也消耗大量编码智能体所需的语言模型token。正因如此,当前的实验没有穷举所有挑战任务在所有最新模型-运行时组合下的结果,而是主要依赖一个主要后端进行全套测试,把其他后端的测试限制在代表性任务上。Claude Code版本的AMID在PUMA-T1-Seg(Dice 0.64)和TopCoW-MRA-Cls(准确率0.50)上取得了比Codex版本更好的成绩,但在DENTEX(AP 0.25 vs 0.49)上则不如Codex版本。这说明不同运行时后端在不同任务上各有优势,混合后端的策略可能是更好的方向,但目前还无法系统地研究这一点。
AMID还依赖资源注册表的质量和数据侦察的准确性。如果注册表中某个基础模型的信息不准确,或者侦察阶段漏掉了某个关键的数据特性,后续的规划和执行都会受到影响。
研究团队明确强调:挑战基准上的表现,反映的是系统在定义明确的任务协议下产出预测文件的能力,不等于临床安全性、前瞻性泛化能力、部署环境下的校准表现,更不等于适合直接用于患者诊疗。AMID的"可审核性"设计,是为了让模型包保留足够清晰的构建历史,方便人类后续进行更深入的验证和审查。这是朝着更负责任的医学AI开发迈出的一步,但绝不是终点。
归根结底,AMID讲述的是一个关于"如何让AI开发AI"这件事变得更严谨、更可靠的故事。它不是要证明AI已经可以完全取代医学影像领域的工程师,而是在展示:如果能把领域知识、结构化搜索和严格的验证机制三者结合在一起,一个自动化系统可以在复杂的医学影像开发任务上走得比我们预期的更远,同时留下一条清晰的、可供人类检查的轨迹。
如果你对这项研究感兴趣,可以通过arXiv编号2607.10522找到完整的技术报告,项目代码和各挑战任务的解决方案也已开放在GitHub上。未来系列论文将进一步补充后端对比实验、各模块的消融分析,以及针对更长时间预算和更多任务类型的验证。
Q&A
Q1:AMID系统能直接用于临床医疗诊断吗?
A:不能直接用于临床诊断。AMID的设计目标是自动化完成医学影像模型的开发流程,包括训练代码、模型权重、预测文件等,并留下可审核的构建记录。研究团队明确指出,挑战基准上的表现不等于临床安全性,不代表模型在真实部署环境下能可靠泛化,也不适合直接用于患者诊疗。AMID的价值在于让模型构建过程更规范、更有据可查,方便人类专家后续进行临床验证。
Q2:AMID和普通的机器学习自动化系统有什么本质区别?
A:最核心的区别有两点。第一,AMID在开始训练之前会先做详细的数据侦察,根据成像模态、标注类型、数据规模等具体特征,规划多条有针对性的方法路线,而不是直接套用通用流程。第二,AMID设有独立于工作智能体的审核员角色,每次实验的验证分数必须通过一系列合法性检查才能被承认为有效证据,防止系统被虚假的高分误导。
Q3:AMID在哪些医学影像任务上表现最差?
A:超声图像增强(USenhance)和TopCoW血管拓扑分类是表现最弱的两类任务。超声增强任务的难点在于生成对抗网络训练不稳定,在固定预算内无法积累足够的有效训练时间。TopCoW分类任务的难点在于它本质上要求血管分割、拓扑后处理和图分类三个子任务同时做好、相互配合,仅靠提升分割质量不足以解决问题,这类多阶段耦合任务对当前系统来说仍然极具挑战。
