一项由上海交通大学主导,联合卡内基梅隆大学、中国科学院大学、上海人工智能实验室、中国科学技术大学、华东师范大学及微软公司共同完成的研究,以预印本形式于2026年7月9日发布在arXiv平台,编号为arXiv:2607.08758v1。感兴趣的研究者可通过该编号查阅完整论文。
科学研究存在一个鲜为人知的“秘密”:几乎没有哪篇论文真正从零开始构思。每一项新想法,都在悄然“继承”前人的核心方法,修补已知缺陷,并重新组合更早期研究的碎片。这正如人类的DNA——你身上有来自祖父的鼻梁轮廓,有来自祖母的眼睛色泽,有来自远古祖先的某段基因片段。知识的演化与生命的演化,遵循着惊人相似的逻辑。
然而,当前最先进的AI研究系统,真的能理解这种“传承脉络”吗?当一篇AI生成的论文宣称“在前人工作基础上改进”时,它是真正领会了前人的核心机制,还是仅仅表面引用了相关论文、说出了听起来合理的说辞?
为解答这一疑问,研究团队构建了一套名为IdeaGeneBench(IG-Bench)的评测体系,以“基因组”视角重新审视科学思想的传承与变异,并在14个主流AI系统上开展了大规模测试。结果令人警醒:即便是当前最强的系统,在理解科学思想“血脉”方面,正确率也不足30%。
一、为何“相关性”不等于“传承性”
在正式介绍这一框架前,我们先理解一个易被忽视的关键区别,这也是整个研究的出发点。
以目标检测领域为例。YOLO是开创性的实时目标检测算法,而YOLOv2是它的直接后继——YOLOv2继承了YOLO的“单次扫描”核心机制,并引入锚框、批归一化和多尺度训练来修补已知局限。这便是真正的传承:核心DNA延续下来,部分特征发生变异。
再看另一例子:DETR同样做目标检测,与YOLO研究相同任务。但DETR完全抛弃了YOLO的传承链,转而从Faster R-CNN的区域提议框架出发,用Transformer集合预测取而代之。DETR与YOLO处在同一“生态位”,却毫无“血缘关系”。
这一区别在日常文献检索中几乎不可见。若仅看论文标题、摘要、引用关系或语义相似度,会发现YOLO与DETR“很相关”,但无法分辨谁传承了谁的核心机制。现有AI评测体系大多停留在“相关性”层面,对“传承性”视而不见,这正是本文要攻克的核心问题。
二、“思想基因组”:为每个核心想法绘制DNA卡片
为使“传承关系”可衡量,研究团队发明了名为IdeaGene的框架。其核心概念是“Idea Genome”,可理解为“思想基因组”——它是从论文中提取出的、最小的、可传承的思想单元。
将每篇论文视为生命体,思想基因组便是其基因序列。每个基因组对象都有明确的“功能标签”,指示其在传承关系中的角色。研究团队定义了六种功能标签:niche(生态位)标记研究试图解决的问题环境;mechanism(机制)标记可被继承或变异的核心方法设计;observation(观察)标记驱动研究的经验规律;limitation(局限)标记先前工作的缺陷或瓶颈;delta(增量)标记相对于前人工作的修补或设计变化;claim(声明)标记论文断言的结论。
这六种标签构成一套完整的“遗传密码”体系。判断论文B是否真正传承论文A时,并非看B是否引用A,而是看B的mechanism基因组与A的mechanism基因组是否有血缘关系,B的delta基因组是否真正针对A的limitation基因组,而非仅口头提及。
为确保每个基因组对象可靠、可验证,研究团队设定了四条约束。第一,每个基因组必须有明确的功能类型标签。第二,每个基因组必须有来自原论文的文字证据支撑,如段落、公式、图表,不可凭空断言。第三,每个基因组必须“小而完整”——足够小以独立被继承、变异或消失;又足够完整以表达一个功能性想法。若两部分可独立传递则拆开,若彼此依存则合并。第四,每个基因组必须对传承判断“有用”——若继承或丢失它不改变后继论文是否为“合理后代”的判断,则它只是背景注释,而非基因组。
三、GenomeDiff:为两篇论文做“亲子鉴定”
有了思想基因组,下一步是比较两篇论文的基因组以判断关系。研究团队将这一比较工具称为GenomeDiff,其名称源自生物信息学中比较基因组差异的工具。
GenomeDiff的工作方式如下:给定前驱论文A和后继论文B,将A的每个基因组对象与B的基因组对象按类型和语义角色一一配对。比对完成后,A中的每个基因组对象会被标记为三种之一:Inherited(继承)表示B完整保留此基因组;Mutated(变异)表示B保留核心但有所修改;Lost(消失)表示B完全抛弃此基因组。而B中那些在A里找不到对应关系的基因组对象,则被标记为Novel(新生)(B原创)或External(外来)(从第三方谱系导入)。
除为每个基因组对象打标签外,GenomeDiff还记录传承的“主要驱动力”——是哪个机制基因组的延续(或替换)主导了演化?以及这场演化与周围研究环境(数据集惯例、社区评测标准)的关系。后者至关重要,因为两篇论文共享同一评测基准并不能说明有传承关系,那只是“同处一个生态位”。
四、六种演化模式:科学思想如何传代
基于比较工具,研究团队进一步将不同的GenomeDiff模式归纳为六种“演化动态”,如同生物学中区分物种演化类型。
第一种叫变异(Mutation):驱动机制被继承或局部修改,研究生态位基本不变。YOLO到YOLOv2即是典型——单次检测核心机制延续,锚框和批归一化仅为局部改良。
第二种叫适应性辐射(Adaptive Radiation):驱动机制被继承,但迁移至全新任务、领域或评测生态。Transformer架构从自然语言处理迁移至图像识别(ViT)即为此模式——自注意力机制完整继承,但处理对象从文字序列变为图像块。
第三种叫杂交(Hybridization):后继论文的驱动基因组从两条或多条不同谱系引入。LLaVA多模态大模型是典型案例——它融合了CLIP视觉编码器的视觉对齐能力与指令微调语言模型的对话能力两条谱系。
第四种叫成种(Speciation):处于相同或相近生态位,但前驱的驱动机制被全新的、能开创新谱系的机制取代。Faster R-CNN到DETR即属此类——检测生态位相同,但区域提议机制被Transformer集合预测完全替换,开创了新谱系。
第五种叫生态位竞争(Niche Competition):处于相同生态环境,但无驱动机制传承关系,仅在竞争同一问题。Faster R-CNN与YOLO均做目标检测,但区域提议与单次回归是两套完全不同的方法论,彼此无血缘。
第六种叫隔离(Isolation):既不共享生态位,也无机制传承。BERT(语言理解)与YOLO(目标检测)之间即为隔离——任务不同,机制也毫无关联。
这六种模式的关键分水岭在于“是否有驱动机制的传承”。无机制传承则不算谱系关系,仅是同一研究环境中的邻居。遇到模棱两可情况,研究团队设定了明确优先级规则:杂交优先于成种,成种(有谱系证据时)优先于生态位竞争,适应性辐射(当环境迁移为主要驱动时)优先于变异。
五、IG-Bench:覆盖10个科学领域的大型测试场
基于上述框架,研究团队构建了完整评测数据集IG-Bench。数据集包含来自10个科学领域的1961条黄金谱系轨迹、1085个经过审校的思想基因组对象以及920条成对的GenomeDiff记录。这10个领域涵盖自然语言处理、计算机视觉、多模态学习、生物学、化学、物理学、材料科学、医学和数学。
数据构建经过四个阶段。首先,各领域专家提名各自领域的标志性论文和前沿论文作为种子。其次,通过引用关系、语义检索和领域策划,将候选前驱与后继论文扩展为长度3至7篇论文的谱系链条。接着,通过多轮LLM辅助提取将每篇论文转化为思想基因组对象,由专家审校后,逐对完成GenomeDiff记录,打上基因组命运标记和驱动标签。最后,通过程序化检查和独立注释员验证,确保架构有效性、答案契约、时间一致性和谱系连贯性。
质量控制方面,研究团队招募了50位研究生注释员(涵盖计算机科学、生物学、物理学、材料科学等多学科的硕士和博士生),分三个环节介入验证。进化动态标签的注释员间一致率在裁决前达84.7%,人类裁判在IG-Arena的成对偏好判断中与模型评判小组达到80%的一致率。
六、IG-Exam:42种题型,测试AI对“思想传承”的理解深度
评测体系分为两部分,第一部分为IG-Exam,是一套闭卷考试,包含42种任务类型共1029道题,考察四个层层递进的能力维度。
第一个维度是T1基因组抽象,共5种任务类型125道题。这是最基础能力:给你一个从论文中提取的思想基因组,能否判断其贡献角色(方法、数据集、分析、系统、理论),识别驱动基因组和辅助基因组,以及判断它在谱系中的位置?如同给你一段DNA,看能否认出它控制什么性状。
第二个维度是T2继承追踪,共12种任务类型313道题。任务难度升级:给你多个混排的思想基因组对象,能否正确划分为不同演化谱系,并按时间顺序排列?能否将一篇论文指出的局限性与另一篇论文的改进措施正确配对?这就像给你一堆家族成员照片,让你理清谁是谁的祖先。
第三个维度是T3演化推理,共17种任务类型409道题。这里需要解释演化发生的原因:给定前后两篇论文的生态位和机制,判断主要演化动态是变异、适应性辐射、杂交还是成种?推断驱动基因组的具体命运?理解跨多篇论文的多跳变化?
第四个维度是T4谱系验证,共8种任务类型182道题。这是最接近“AI做科研”的能力:给你一条声称的谱系关系,判断其是否真实合理?找出谱系链条中的“入侵者”(不属于此谱系的论文)、错误步骤、缺失的中间环节或引用矛盾?
所有题目采用严格的精确匹配评分:每个必填字段必须同时全部正确才算得分。若识别出正确父论文但给出错误动态标签,或推断对驱动基因组但弄错其命运,均不得分。这一设计有意为之——谱系判断的价值在于整体一致性,而非部分信息正确。
七、IG-Arena:看AI能否生成真正“传承有序”的研究想法
评测体系第二部分为IG-Arena,考察生成能力:AI能否产出一个真正可插入既有谱系的后继研究提案?
每个任务包含一个前沿研究问题、一个研究领域、可选的文献库和可选的结构化谱系。参与AI系统在三种信息条件下分别生成提案,形成受控对比。Question-only(仅问题)条件下,AI仅知领域和前沿问题,只能依靠自身参数中储存的知识回答,测试纯粹的参数化创意。Library(文献库)条件下,AI额外获得一批无序论文摘要,测试基于文献的创意生成。Lineage(谱系)条件下,AI获得按时间顺序排列的谱系链条,包含思想基因组对象和GenomeDiff证据,测试AI能否真正利用结构化传承信息。
评分使用专为此设计的指标,名为Population-Evolution Score(PES,种群演化得分)。其核心思想源自达尔文自然选择理论:一个好的后代,必须同时满足遗传、变异和选择压力三个条件。
PES将评分分解为三个维度,每个维度0至100分,最终取算术平均值作为总分。遗传性(Heredity)考察相对于给定谱系,提案是否继承并延续了正确的父辈思想基因组?评测来源连续性、机制保存度以及局限性与改进措施的对应关系。变异性(Variation)考察相对于周围已有工作,提案是否引入了有意义的新颖性?表面重组会被扣分,实质性变异、迁移或全新基因组对象会得到奖励。选择价值(Selection)考察在既定谱系种群内,提案是否具有竞争力?评测可行性、与研究环境的契合度,以及提案能否为未来研究打开有价值方向。
评分由三个模型裁判组成的小组完成,采用位置随机化处理。除PES外,研究团队还计算了基于Bradley-Terry模型的成对ELO分数作为补充诊断。
八、实验结果:AI在“理解科学传承”方面有多难?
研究团队对14个基于大语言模型的科学研究系统进行了测试,包括8个直接使用的大语言模型、2个基于GPT-5.5的研究智能体,以及4个将GPT-5.5或Claude Opus 4.7包装在Codex或Claude Code工作流中的命令行工具。
在IG-Exam上,结果相当严峻。最强的直接大语言模型GPT-5.5整体精确率仅为23.1%。最强的命令行工具组合GPT-5.5加Claude Code达27.3%,是所有参与者中的最高分。这意味着,对于测试中最难的题目,超过70%的情况下,AI给出的谱系判断是不一致的。
具体来看各维度成绩,呈现出明显的下降趋势。T1基因组抽象(单基因组阅读)最好的系统可达34.4%。T2继承追踪(跨基因组的多步追踪)最好可达37.9%。T3演化推理最好仅为25.3%。T4谱系验证最难,最好也只有17.4%。这一从T1到T4的梯度,完整呈现了复合推理的难度积累:T1只需读懂一个基因组;T4需同时保持父论文身份、基因组兼容性、驱动机制一致性和证据有效性四项约束全部正确,任何一项出错便全盘皆输。
工具辅助对不同任务的帮助差异极大。命令行工具在T2继承追踪上提升最显著(GPT-5.5从25.7%提升至37.9%),因为迭代式工具调用可帮助检索和比较多篇论文的基因组对象。但这一提升到T3演化推理就明显收窄,到T4谱系验证几乎消失。工具目前能帮助信息收集,但对复合一致性检验几乎无能为力。研究智能体(AI Scientist v2和CoI-Agent)的成绩与直接使用GPT-5.5几乎重叠,这说明检索密集型工作流本身并不能增加谱系推理能力。
在IG-Arena上,结果呈现另一番图景。从Question-only到Lineage的PES提升,在不同系统之间差异很大。GPT-5.5在Question-only条件下已表现良好(PES 85.2),加上谱系信息仅提升2.3分。而较弱的系统如Kimi-K2-Thinking从谱系信息中获益更多(提升6.9分)。总体中位提升为4.4分。谱系结构化信息平均而言有帮助,但其主要效果是“分辨”——将能真正利用基因组结构的系统与仅从更多文字中获益的系统区分开,而非均匀提升所有系统。
将PES按维度和动态模式分解后,最关键的发现浮现出来:变异性(Variation)和选择价值(Selection)在所有条件和所有动态类型下几乎保持不变,变化范围分别在82.7至84.7之间和79.7至82.2之间。而遗传性(Heredity)是唯一解释PES差距的维度。Question-only条件下的变异动态(无有效父机制的参数化发明)遗传性仅为61.9,PES仅为69.2。Lineage条件下的杂交动态(锚定到明确父基因组的重组)遗传性高达84.2,PES达到83.6。
这意味着:AI生成的想法并不缺乏新颖性,也不缺乏可行性的表面判断,缺的是“血统合法性”——提案是否真正传承了正确的父机制,是否真正针对前人已知的局限性。AI系统有能力生成看起来很有道理的研究想法,但这些想法往往飘在空中,没有根植于它声称要延伸的那条谱系。
还有一点值得关注:ELO与PES之间存在分歧。两者的Spearman秩相关系数为0.82,相关但并非一致。当一个措辞精美但谱系不连贯的提案,在成对偏好判断中战胜了一个不那么精美但传承扎实的提案时,ELO会给前者更高分,但PES不会。这正是研究团队将PES作为首要指标的原因——成对偏好捕捉的是表面吸引力,而PES衡量的是谱系条件下的种群插入质量。
九、四个关键发现:AI科研能力的真实边界何在
通过系统性实验,研究团队总结出四个主要发现,共同描绘了AI科研系统的能力边界。
第一个发现:论文级别的证据不够用。文献库比仅提供问题提供了更多信息,但无序的论文摘要集合无法说明哪些基因组对象被继承、变异、消失或从外部引入。谱系条件的提升——尤其是遗传性得分的提升——证明GenomeDiff结构携带的信息超越了论文摘要。知道“有哪些相关论文”与知道“这些论文之间的核心机制如何传递”,是两件完全不同的事。
第二个发现:验证能力是理解与生成之间的桥梁。最难的IG-Exam任务是T4谱系验证任务,而IG-Arena的评分体系需要的也是同样的检验:提案必须识别一个父论文,继承兼容的基因组对象,修补真实存在的局限,避免无效重组。将每个系统的IG-Exam整体精确率与IG-Arena谱系条件下的遗传性得分对比,可以看到一个正相关关系——闭卷谱系理解能力更强的系统,在开放式生成中更能保持遗传性。两个评测维度相关,但不冗余。
第三个发现:控制主干模型版本后,工具辅助帮助的是检索,而非推理一致性。对五个共用GPT-5.5主干的系统进行横向比较,研究智能体(AI Scientist v2、CoI-Agent)与直接使用GPT-5.5的雷达图几乎完全重叠,说明它们的检索密集型工作流并未增加谱系推理能力。命令行工具(Codex、Claude Code)在T2继承追踪上显著提升,维持了T1基因组抽象,但在T3演化推理上几乎无提升,在T4谱系验证上甚至略有下降。此外,研究智能体的生成得分(PES)比直接大语言模型还略低,说明多步流水线可能损害生成连贯性。工具放大了检索依赖型能力,但那个复合推理的瓶颈基本原封不动。
第四个发现:AI系统过度生产“合理感”,相对于谱系连贯性而言是过剩的。生成的想法往往在保存准确的父机制或局限性-改进对应关系之前就已听起来有用。PES动态分解图清晰展示了原因:变异性在所有条件和所有动态模式下都高居不下,而遗传性才是PES差距的驱动力。没有根基的组合可以是高变异、低遗传的;而基于基因组的重组,可以同时具备新颖性和连贯性。这两者之间的差距,是当前AI科研系统最需要解决的问题。
归根结底,这项研究揭示的不是AI“不够聪明”,而是AI缺少一种特定能力:在检索到相关论文之后,进一步辨别哪些核心机制真正被传递下来,哪些只是恰好出现在同一研究环境中。研究团队将这种能力称为“科学谱系胜任力”,并用IG-Bench提供了一个可量化衡量它的标准工具。
当前最好的系统在最难的谱系验证任务上仅有17.4%的正确率,这个数字告诉我们,AI做科研时产生的那些听起来合理的想法,很可能悬浮在真正的知识传承链之外。未来的研究方向因此变得非常清晰:自动化科研系统需要的不仅是更好的文献检索,而是真正具备复合验证能力的推理模块——能够在生成新想法的同时,核查那个想法是否真正传承了它声称要延伸的那条思想血脉。对于任何对AI科研能力感兴趣的读者,完整研究可通过arXiv:2607.08758v1查阅。
Q&A
Q1:思想基因组(Idea Genome)和普通的论文摘要有什么区别?
普通摘要是对论文内容的概括性描述,而思想基因组是专门为“传承判断”设计的最小功能单元。它有明确的类型标签(如“机制”“局限”“改进增量”),有来自原文的文字证据,且每个对象必须足够小、足够独立,使其可单独被继承、变异或消失。摘要告诉你这篇论文做了什么,思想基因组告诉你这篇论文哪些核心想法可被下一篇论文继承。
Q2:IG-Bench评测中AI最难通过的任务是哪类,为什么那么难?
最难的是T4谱系验证任务,最好的系统正确率仅为17.4%。这类任务要求AI同时保持多个约束全部正确:父论文的身份、继承的基因组是否兼容、驱动机制的标签、以及支撑证据是否有效。任何一个字段答错便全盘得零。难点并非单一判断困难,而是需要将四五个相互依赖的判断同时维持一致——这种“复合一致性”是当前AI系统的主要瓶颈。
Q3:PES(种群演化得分)和普通的AI生成质量评分有什么本质区别?
普通的质量评分通常在孤立情境中评价一个想法的好坏,比较其是否新颖、可行、表达清晰。PES则将评分条件设定在一个具体的谱系和邻居种群之中——这个提案能否作为这条谱系的合理后代被“插入”?它必须同时满足遗传性(传承了正确的父机制)、变异性(相对于周围已有工作有实质性新颖性)和选择价值(在此研究环境中具有竞争力)。简单说,PES考察的是“血统合法性”,而不仅仅是独立审美。
