AgentGarten:代码与扩散模型构建实时物理试炼场,加速智能体进化

2026/10/09 10:03阅读量 6

MirroS团队发布AgentGarten,通过结合可执行代码环境与神经渲染器,为AI智能体构建了具备物理确定性与逼真视觉反馈的实时交互世界。在捉迷藏实验中,智能体利用“实验手册”机制,仅用数轮迭代便掌握了搭建掩体和翻墙等复杂策略,效率远超传统强化学习。该技术还成功复用于陪伴、驾驶、牧羊等多种任务场景,展示了其在物理递归自我改进(Physical RSI)领域的潜力。

事件概述

MirroS团队发布了名为 AgentGarten 的系统,旨在解决智能体缺乏真实物理试错环境的痛点。该系统将基于代码的物理引擎与基于扩散模型的神经渲染器相结合,实现了“代码定义规则、模型生成视觉”的闭环。智能体可在其中通过行动、观察后果并记录经验,实现持续进化。

核心技术与架构

  • 分工协作机制:系统摒弃了纯视频生成模型中物理信息隐式存储的缺陷,也克服了传统游戏引擎画面粗糙的问题。代码环境负责计算精确的物理碰撞和状态更新;神经渲染器读取几何草图(深度/法线),实时生成拟真视觉反馈。
  • 流式渲染与性能优化:采用流式逐块生成技术,确保动作与画面同步。通过引入真实视频对抗训练(Adversarial Forcing)、精确重放机制以及定制化的Triton算子和CUDA Graph优化,系统在480p分辨率下实现了30+ fps的实时吞吐,解决了长程交互中的画面漂移和伪影问题。

关键实验与成果

  • 捉迷藏实验对比:
    • 传统路径:OpenAI 2019年的研究需经过约2500万局至1亿局的自我博弈强化学习,才能涌现出搭掩体和翻墙策略。
    • AgentGarten路径:智能体在第一人称视角下,通过每轮结束后的“撰写手册”环节进行复盘和经验沉淀。躲藏者在第4轮学会搭掩体,搜寻者在第10轮掌握翻墙技巧,极大缩短了探索周期。
  • 多场景泛化验证:同一套“探索-复盘-沉淀”循环被应用于其他四个截然不同的物理世界,均展现出稳健的行为演化:
    • 陪伴小狗:得分从首轮的13分提升至第4轮的19分。
    • 狭桥会车:双车通关耗时从71秒压缩至41秒。
    • 合作牧羊:从首轮漏圈三只羊到后三轮稳定全量圈入。
    • 采石场装载机:从勉强推石到提前31秒完成全流程。

值得关注:经验沉淀机制

AgentGarten的核心创新在于让智能体自主维护“实验手册”。演练流程分为领受任务、盲盒试错、撰写手册、封存传代四个阶段。智能体会区分事实与猜测,记录防坑指南(如“防守核心在于堵通道而非视线”、“搬物前先试拉”等)。这些结构化经验作为先验知识传递给下一轮智能体,构成了物理世界递归自我改进(Physical RSI)的基础。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。