ScienceDiscovery:树搜索驱动科研代码自进化,低成本实现物理规律发现与算法加速

2026/09/04 16:57阅读量 2

openJiuwen社区开源的ScienceDiscovery平台利用树搜索技术驱动科研场景中的产物自我迭代(RSI),无需训练模型或调整参数。通过在沙箱中自动评估并选择最优分支,该系统在2小时内自主生成通用振荡积分器,显著提升了特殊函数求值精度,并以极低的调用成本从数据中反推物理方程。

核心机制:树搜索驱动的科研产物迭代

ScienceDiscovery 是 openJiuwen 社区开源的 AI 科研工作台,其核心创新在于将科研试错过程转化为树搜索(Tree Search)问题。不同于传统的单次执行或依赖强化学习训练专用模型的方法,该系统直接对科研代码本身进行演进。

  • 迭代流程:每一轮迭代包含四个步骤——选择一个父版本节点、由大模型改写、在隔离沙箱中评分、并将结果挂为新节点。运行失败或超时的版本同样入树并标记。
  • 选择策略:系统采用“深挖”与“铺开”相结合的策略。高得分节点获得更多改写机会(深挖),但同一节点被选中后权重衰减,促使搜索转向其他分支(铺开)。这种机制允许系统回溯到早期被搁置但具有潜力的版本,从而避免陷入局部最优。
  • 底座架构:底层固定为四个插槽(改什么、从哪出发、怎么打分、怎么合并),通过更换评分函数和根节点即可适配不同任务,支持并发扩展以加速搜索。

案例实证:小时级产出通用工具与发现物理规律

1. 半无穷区间振荡积分器的自动生成

通用数值积分库(如 scipy.integrate.quad)在处理不停振荡的函数时往往失效。ScienceDiscovery 针对38道此类积分题进行搜索:

  • 基线表现:直接调用标准库仅3道题进入3%容差,最差误差达24亿倍。
  • 搜索结果:历时2小时,产生236个版本。第119版得分-0.0007,19道测试题全部算准,平均相对误差0.07%。
  • 成果价值:最终生成的247行程序具备通用性,能根据发散点和振荡频率自动选择算法,在未参与打分的另外19道题上同样有效。

2. 高斯超几何函数双精度求值优化

针对公认难以覆盖全参数域的 ₂F₁(a,b;c;z) 函数:

  • 性能提升:使用 glm-5.2 模型进行48次扩展(耗时598秒),生成199行程序。在1000个未见点上,平均正确有效数字从9.836提升至11.771,能算到10位以上的点数从659增至965。
  • 算法洞察:搜索自动发现了经典恒等式,当 z < -1 时通过变换变量避开不收敛区域,并自行确定了切换条件。

3. AlgoTune 代码加速竞赛

在收录154个真实数值计算任务的基准上:

  • 表现:ScienceDiscovery 平均加速比达 2.279倍,耗时仅为参考实现的40%多。
  • 对比优势:超越了官方榜最高分(claude-opus-4.6 的 1.837)及需强化学习训练的 MetaEvolve(2.045),且全程未使用任何特定加速技术的提示词,完全由搜索自主发现。

4. 从观测数据反推物理方程

基于 LLM-SRBench 的符号回归任务:

  • 效率与成本:在4000行采样点的数据表中反解析表达式。111道题中有41.4%写出正确方程(包括玻尔能级、普朗克分布等)。
  • 极低开销:每题平均仅需16.5次模型调用,采用 deepseek-v4-flash 费用不足3元。相比之下,其他方法通常需250次左右调用。

关键结论与展望

  • 低成本高效率:相比依赖数百万次遗传变异的 LaSR 或需专门训练的 MetaEvolve,ScienceDiscovery 利用现成模型(deepseek-v4-flash, glm-5.2)和极少的调用次数,实现了同等甚至更优的效果。
  • 自动化程度:整个过程无需人工干预,验证成本低(秒级评分)是其快速迭代的关键。
  • 未来挑战:当前方法适用于可快速机器验证的任务(如代码、数值计算)。要推广至合成实验、风洞测试等长周期领域,需解决验证速度慢和高昂试错成本的问题,例如通过仿真代理模型或自动化实验室压缩验证时间。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。