先来看几个关键判断。一个模型既要读懂DNA的序列密码,又要洞察气象场的时空演变,还得在医学影像上精准圈出病灶——过去,这需要拆分成多个各自为政的专用模型。7月20日,上海科学智能研究院将这一复杂问题的系统性解决方案公之于众:开放科学多模态基础模型神珍(Monkey King Bang, MKB),凭借约110亿参数,在同一个统一模型中同时处理DNA、RNA、蛋白质、小分子、地球系统和医学影像这六类科学数据,既能完成理解任务,也能直接输出结果。
在科学智能这条赛道上,蛋白质、分子、气象以及医学影像等方向,此前已各自涌现出性能出色的专用模型。然而,这些模型背后的规律并不相通:序列数据讲究前后依赖关系,分子数据强调原子之间的连接结构,气象场数据关注时空演化过程,医学影像数据则看重局部细节特征。如何既保留这些差异,又让一个模型学到它们之间可共享的通用规律,始终是科学基础模型领域必须面对的核心命题。神珍正是针对这一挑战而生的解决方案。

其架构以Qwen3-VL-8B模型作为共享主干,同时为六类科学数据各自开辟了专门的数据处理通路。关键在于,它并未简单地将所有数据压缩成同一格式,而是在数据进入共享模型之前,分别保留了序列的先后顺序、分子的连接结构、气象场的空间分布以及医学影像的局部细节。蛋白质与核酸仍按序列形式处理,小分子仍按结构形式处理,气象数据保留其空间分布特征,医学影像则保留图像细节——这些能力被集成在同一个模型之中,使用时可根据任务需求调用相应功能。除了文本回复,神珍还能直接生成RNA序列、机器可读的SMILES分子表示、全球气象场以及医学影像分割结果。
在约110亿参数的规模下,神珍在生物序列、小分子、气象以及医学影像等多项任务中均展现出具备竞争力的性能。在涵盖DNA、RNA、蛋白质及生物序列关系判断的20项基准任务中,神珍模型在9项上取得了三款参评模型中的最优成绩,在17项任务中位列前两名;逐一比较来看,它在16项任务上的得分高于同参数规模的Biology-Instructions模型,而面对总参数约1万亿的Intern-S1-Pro模型,两款模型各有10项任务表现更优。这组对比数据说明了一个问题:参数规模并非衡量科学模型能力的唯一标准,针对不同科学对象设计有效的建模方式,才是更值得持续深耕的方向。
跳出生物序列领域,神珍在小分子、气象以及医学影像方面同样经过了验证。在小分子方面,针对公开基准SMolInstruct中的6项属性理解任务,神珍在4项上取得了最优或并列最优的成绩。在气象方面,离线评测中,给定一帧初始大气场,模型每6小时进行一次滚动预报,持续推演至第10天;在第10天的预报中,500hPa位势高度、2米温度、海平面气压等多项指标达到了或优于业务级数值预报的水平。在医学影像分割方面,针对覆盖CT、MRI、病理等九种影像模态、超过十万个图文样本的评测,神珍模型预测区域与人工标注重合程度的平均Dice得分达到91.20,在7种参评方法中排名第一;按9类影像逐一分析,有5类影像排名第一,其余4类排名第二。
神珍将四类代表性能力汇集于同一个统一模型之中:理解生物序列、预测小分子性质或生成SMILES、滚动生成最长10天的全球气象场、以及根据文字提示完成医学影像分割。不同的任务会调用各自对应的处理组件,但共享同一模型主干和联合训练的权重,研究者无需再在多个彼此独立的领域模型之间来回切换。
对于科学模型而言,开放权重只是第一步。能否同时提供可运行的代码、示例以及清晰的输入输出说明,直接决定了模型能否被有效验证和复用。本次发布同步放出了模型权重、推理代码、示例脚本、输入说明以及使用文档,并补齐了气象预报与医学影像分割所需的配置,支持研究者在本地部署或接入已有的科研流程。研究者可以通过星河启智科学智能开放平台下载模型或调用API,与平台汇聚的1500余个科学模型和工具组合进行再创造,也可以在Hugging Face下载权重、在GitHub获取推理代码与示例。
作为今年3月初面世的系统级科研智能体“大圣”的超级大脑,神珍这个名字取自《西游记》中的天河定底神珍铁。团队希望这套开放模型能以相对精炼的形态承载多样化的科学任务,也让更多研究者参与进来进行检验、使用与共建。
