ASU 魏华:大模型智能体正重蹈强化学习覆辙,域随机化能否跨越「仿真到现实」鸿沟? | IJCAI 2026

2026/08/21 11:11阅读量 2

亚利桑那州立大学助理教授魏华在 IJCAI 2026 演讲中指出,大模型智能体的跨环境脆弱性本质上与传统强化学习的「仿真到现实」差距一致。他借鉴机器人领域的域随机化技术,通过扰动提示词、动作和奖励空间,使 3B 参数模型跨语言表现超越 32B 模型,并强调不确定性量化与人类在环是可靠智能体的关键防线。

事件概述

亚利桑那州立大学助理教授魏华在 IJCAI 2026「Early Career Spotlight」环节发表演讲《Towards Reliable Agents》。他指出,当前大模型智能体在环境切换或跨语言场景下表现脆弱,本质上与传统强化学习在物理世界中面临的「仿真到现实(Sim-to-Real)」差距如出一辙,并非大模型时代特有的新问题。

从交通信号控制到 LLM 智能体

魏华早年研究交通信号控制强化学习,2018 与 2019 年的 KDD 论文曾证明强化学习可复现经典「绿波」优化解,并适应非匀速车流。但将算法部署到中国杭州等真实路网时,天气、摄像头视角、奖励函数定义等都会造成致命偏差,模拟器中的完美结果在现实中迅速崩溃。他将这类差距拆解为观察差距、状态差距、动作差距、动态差距和奖励差距五个子维度。

大模型智能体正在重蹈覆辙

魏华认为,基础模型智能体同样存在上述差距。例如,模型以英语数据为主要训练模态,切换至中文、德语或低资源语言时错误率会断崖式上升,这种多语言泛化难题本质上就是「观察差距」的一种表现。因此,机器人领域成熟的「域随机化(Domain Randomization)」思路可以迁移到 LLM 智能体:在训练和测试时对提示词、动作空间、奖励空间进行大规模随机化扰动。实验显示,一个仅 3B 参数的小模型经域随机化处理后,跨环境表现接近完美,甚至超过了 32B 参数的大模型。

可靠性底线:不确定性量化与人类在环

魏华强调,虚实鸿沟可能永远无法完全弥合,最终防线是「人类在环」。机器需要知道自己「何时不确定」,在关键时刻向人类求助。他为此提出四个层级的不确定性量化:答案本身是否可信、推理逻辑是否脆弱、能否定位出错的具体推理步骤、智能体认知是否与其他模型或系统对齐。他呼吁相关领域建立共通的评估标准,让智能体规模持续扩大的同时,不使人类监督负担随之指数级加重。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。