随着高质量预训练数据逐渐耗尽,单纯扩大算力与参数规模的边际收益正在下降。上海交通大学团队发布的BigBang-V1通过让AI自主生成、筛选并迭代训练任务,在35B参数规模下实现了多项前沿评测的领先。本文将拆解其数据生产机制、核心评测表现及对未来模型演进路径的启示。
高质量训练数据的生产瓶颈
Scaling Law 表明,增加参数、算力与数据量通常能提升模型能力。但随着高质量数据被反复消耗,继续扩大规模的边际收益逐渐降低。当模型在部分任务上接近人类专家水平时,下一批能让模型继续进步的训练任务面临来源难题。
互联网上仍有海量文本,但具备训练价值的新任务并不充足。模型已掌握的知识重复学习难以扩展能力边界,真正的挑战在于持续提出模型尚未掌握且值得学习的问题。这类任务通常需要专业研究人员设计、求解与验证,而人类专家的时间无法像GPU一样快速扩容。
有效的训练任务必须同时满足两个条件:足够前沿以扩展能力边界,且能够可靠验证以确保学习方向正确。科学研究恰好提供了这一交汇点。科学问题不断涌现,并提供形式化证明、程序执行、数值计算、模拟器与实验反馈等多种验证手段。解决完整科学问题需要检索、假设、编码、工具调用与结果分析,是训练通用问题解决能力的综合场景。
内外层循环驱动的数据自我进化
BigBang 的核心在于将任务生成、筛选与策略调整交由AI完成,形成数据生产系统的自我进化。其技术框架包含内层循环与外层循环,分别负责快速迭代与真实效用校准。
内层循环:Generator 与 Critic 的对抗优化
内层循环由 Generator Agent 与 Critic Agent 组成。Generator 以代码 Agent 形式工作,直接修改、执行与调试数据合成程序,在任务构造、工具使用与答案验证中搜索更优策略。每轮实验后,系统记录修改动机与失败原因,优化对象从单条样本扩展至整套数据生产程序。
Critic Agent 负责快速评估合成数据的训练价值,提供密集优化信号。审查分为两层:第一层检查推理轨迹信息量、工具调用有效性、数据格式完整性及系统可解析性;第二层评估关键结论证据、步骤一致性、答案客观可验证性及任务所需的研究推理深度。通过审查的样本进入训练池,缺陷样本被修改或淘汰,反馈用于调整下一轮生成策略。
外层循环:Meta-Critic 校准与真实任务检验
内层循环存在将“复杂叙述”误判为“高训练价值”的风险。BigBang 引入外层循环,通过真实科研任务评测校准偏差。系统选择不同版本的数据生产管线,分别训练模型并在留出的真实研究任务中测试。
Meta-Critic 对比 Critic 的预判分数与模型实际能力变化。若数据获高评价但模型未进步,则调整 Critic 标准与 Generator 策略,重新配置下一轮数据的领域分布与难度要求。由此形成完整飞轮:真实任务暴露缺口,Generator 生产针对性问题,Critic 过滤低价值样本,合成数据训练新模型,评测结果反哺数据生产策略。
35B参数模型的跨域能力验证
BigBang-V1 基于 Qwen3.6-35B-A3B 进行后训练,使用约一万条完全由AI合成的数据。在11项评测中,10项超过基础模型,并在多项高难度任务上达到或超越更大规模前沿模型。
在 FrontierScience Research 上,BigBang-V1 获得 46.2 分,DeepSeek V4 Pro Preview 为 40.7 分;在 Humanity's Last Exam 上,前者为 50.3 分,后者为 48.2 分。在 BioMysteryBench Human-Difficult 与 PaperBench(Code-Dev)上同样取得领先。在开放网络长程检索任务 BrowseComp 上取得 76.5 分,真实软件工程评测 SWE-Bench Pro 上取得 54.2 分,均较基础模型显著提升。

能力提升不仅限于科学任务。搜索与代码能力的同步增长表明,模型学到的是一套跨领域问题解决流程:寻找证据、提出假设、调用工具、检查结果并根据失败调整路线。团队案例进一步验证了这一机制。
在 BioMysteryBench 病毒识别任务中,模型需分析三份肠道类器官样本的 FASTQ 文件以判断感染的 RNA 病毒。BigBang-V1 三次运行均收敛至 Norovirus GII.4 或 Norovirus,而对比模型三次给出不同类别。这体现了从噪声数据中建立稳定证据链并收敛至可复查结论的能力。
在旋量范数椭圆积分任务中,题目要求精确计算复杂椭圆积分并禁止使用数值积分或截断级数。BigBang-V1 找到公开证明纲要,核验 Landen 变换、边界条件与参数变换,最终给出仅含 Gamma 函数的闭式结果,形成完整推导与验证链。对比模型虽通过高精度数值计算确认结果一致性,但未完成从原始积分到特殊值的解析推导。两者差距集中在证明过程的完整性与可审计性。
从数据管线优化到递归自我改进
让AI参与训练数据生产并非首创。Absolute Zero 让模型自主提出并解决可由代码执行器验证的数学与编程任务,Google DeepMind 的 AlphaEvolve 利用大模型生成程序并通过自动评估器演化方案。BigBang 的不同在于将任务生成程序、任务分布与评价标准共同纳入优化范围,并用真实科研任务收益校准合成管线。
论文将此称为“数据层面的早期递归自我改进(RSI)”。完整 RSI 通常指 AI 自主改进研发能力、训练更强继任模型并推动下一轮升级。BigBang 目前展示的是数据管线与模型能力的共同演化,是该路径上阶段性的可执行方案。
过去的 Scaling Law 聚焦参数、数据量与计算量,BigBang 提出了新维度:数据引擎提升自身任务生成与验证能力的速度。当模型擅长回答已有问题后,竞争将深入问题生产端。谁能持续找到下一道值得学习、足够困难且能可靠验证的任务,谁就更有可能延续模型能力的增长曲线。
项目资源:
- 模型:https://huggingface.co/endless-frontier/BigBang-v1
- 项目主页:https://endlessfrontier.tech/
- 完整技术报告:https://endlessfrontier.tech/assets/paper.pdf
