当题库追不上模型,AI开始给自己出题:无尽前沿团队跑通数据层RSI
无尽前沿团队发布基座模型BigBang-V1,首次在数据层跑通recursive self-improving(RSI)闭环:训练数据100%由AI自主合成,AI自己负责出题、解题和验证。35B参数模型在长程搜索、代码、科学研究等评测中拿下10项第一,并在多项高难度科研任务上超过1T级DeepSeek V4 Pro Preview。
事件概述
由上海交大人工智能学院、深势科技、上海算法创新研究院组成的无尽前沿团队,发布基座模型 BigBang-V1。这是首个基于 recursive self-improving(递归自我改进,RSI)原生方式训练出的基座模型。
模型在训练中把出题、解题、验证全部交给AI把控,通过可验证的前沿任务持续生成高质量自演进合成数据,全程无需人类逐题参与。团队将其概括为:AI advancing science, and science advancing AI。
核心信息
- 模型规模:参数规模35B,推理时激活约3B参数,支持262K长上下文。
- 数据策略:后训练数据100%由AI自主合成,以科学前沿任务为核心。团队认为任务需同时满足“前沿性”和“可验证性”,前者保证题库不会被模型快速耗尽,后者保证系统能获得可靠训练信号。
- 基准成绩:在长程搜索、代码、科学研究、AI研究等评测中,拿下全部35B模型里的10项第一;在FrontierScience Research、PaperBench等多项高难度科研任务上,成绩超过1T级DeepSeek V4 Pro Preview。
- 任务表现:
- 在全基因组测序数据中定位一个47bp转座子插入位点,利用连接证据做约束映射,把断点锁定在坐标4144431,每一步证据可追溯;
- 在LBCS论文复现任务中,通读论文后进行冒烟测试,发现自身实现违反论文核心主张后,连续否决三个候选修复方案,最终将连续扰动改为二进制掩码翻转,并主动恢复一个脱离计算图的梯度项。最终复现评分0.7657,485个评分点通过331个。
- 能力泛化:BrowseComp基准达到76.5,SWE-Bench Pro为54.2,能力增益同时迁移到长程搜索、软件工程、代码等场景。
方法论与边界
BigBang的核心是一套能持续修改自身生产策略的自演化合成数据管线,由两类Agent协同工作:
- Generator Agent:负责提出并解决科学、技术及AI研究中的高难度任务,可修改、运行和调试数据合成程序,并决定后续任务领域、难度和数据筛选策略。
- Critic Agent:从对抗角度审查候选数据,既检查格式、工具执行和约束满足,也判断任务是否正确、可验证、足够困难,以及是否具备训练价值。
系统采用两层共同演化框架:快速内循环中Generator与Critic对抗协作;外循环则用真实训练结果反向校准Critic,并调整Generator下一轮的任务领域和难度,避免模型只学会迎合数据审查标准。
这一数据层RSI闭环使数据和模型一起变强。团队认为,100%纯AI合成数据可通过验证链避免“合成数据坍缩”,错误的答案不会被当成正确答案继续喂回训练。
不过,这并不意味着人类退出研发。研发目标、资源预算、风险边界、最终验收标准仍由人类定义;AI不能自行修改评测标准,也不能仅凭Critic高分就直接批准方案进入下一轮训练。人类负责确定方向和定义有效进步,AI负责大规模探索、实验和数据生产。
值得关注
BigBang-V1的模型权重已开放,技术报告同步公开。它展示了一条不同于单纯堆算力的路径:当训练数据的生产不再依赖人类逐题产出,AI开始参与决定下一代AI应该学什么,模型进步的天花板可能由数据智能本身来抬升。
