Sherry Yang 独家解密 World Gym:两张 A100 跑通云端演练,让机器人从失败中自我恢复
作者丨张 璐
编辑丨齐铖湧
在机器人技术狂飙突进的今天,具身智能领域正面临着一个行业性的核心困境:我们已经拥有了高容量的深度神经网络,但现实世界中高昂的交互与试错成本,成为了阻碍机器人通往AGI的最大瓶颈。
在虚拟世界里,游戏和代码的执行成本几乎为零,因此我们见证了 AlphaGo 的奇迹和大语言模型在编程大赛中夺冠。但在物理世界中,机器人每一次真机试错,都伴随着昂贵的时间成本、设备损耗与安全隐患。
如果无法将这种高交互成本降下来,机器人就无法像大模型那样利用海量数据疯狂自我进化。
在机器人顶级学术会议 RSS 的现场,来自 Google 实验室和纽约大学(NYU)的助理教授Sherry Yang给出了答案。
她的演讲题目是:《在世界模型中评估与提升物理代理》(Evaluating and Improving Physical Agents in a World Model),在演讲中,她提出了一个极具颠覆性的范式:直接利用可控的视频生成模型来作为真实世界的“替身”,让机器人在云端虚拟场景里完成无限次的低成本演练。
以下是 Sherry Yang 在 RSS 大会上发表的演讲精编稿,雷峰网AI科技评论基于原英文演讲的内容进行了翻译和编辑:
01
真机试错成本太贵!物理世界成了AI演化的阻碍
大家好,我是 Sherry Yang。很高兴今天能在这里和大家聊聊我们在评估和提升物理代理方面的一些最新探索。
在学术界,我们已经非常熟悉“代理与环境交互”的标准设定:神经网络模型采取行动,环境给出反馈,并告诉模型接下来会发生什么。
在这个设定下,我们见证了 AlphaGo 的超级表现,也看到了大语言模型在编程大赛里拿金牌。
我们之所以能在这些虚拟领域取得超越人类的成就,是因为我们满足了两个关键标准:第一是拥有高容量的模型,第二则是拥有极低成本的交互环境。
然而,当我们要训练一个物理世界中的 AI 时,这个低成本的基石就不复存在了。在物理世界中,交互成本极其高昂,你必须真正去操作真机,才能知道一个动作到底会带来什么后果。
但是,如果我们可以从机器人交互数据中,学会一个“世界模型”(World Model)来代替真实世界呢?
一旦这个模型训练成功,我们就相当于把物理代理重新带回了 AlphaGo 的低成本跑道。
我们可以直接在云端运行无数次模拟,通过强化学习不断训练、改进模型,直到它达到超级代理的水平。这也是我们团队近期工作的重中之重。
02
两张 A100 就能跑!用 World Gym 搭建云端模拟器
想要提升机器人,第一步永远是评估。
但在现实中评估策略太痛苦了:人类坐在那里耗费大量时间干等、硬件随时面临损坏风险,而且由于各家实验室机器人设备不同,论文结果根本无法标准化复现。
传统的软件模拟器虽然能在云端跑,但在处理复杂的物体交互时往往失真,而且很难横向扩展到成千上万种日常任务中。
为此,我们推出了World Gym。
我们完整保留了机器人原始动作的所有维度信息,采用了可扩展的 Transformer 架构(具体来说是 Diffusion Transformer,即 DiT 架构)。这个模型可以通过接收前序图像和当前的控制指令,持续生成未来的视频画面。
这里我想强调的是,世界模型的研究并不是只有资源垄断的超级大厂才能做。我们仅仅用了两张 A100 GPU,就在 Bridge 数据集下训出了一个泛化能力非常出色的模型。
欢迎大家去我们的 GitHub 下载代码,在自己的机器上跑跑看。
我们在包含 22 种机器人形态的多样化数据集上进行了训练。当我们在留存数据集上,将预设动作输入给世界模型,它生成的视频与真实机器人在真机上执行的动作画面表现出了极高的一致性。
03
加个电脑屏幕:在云端给机器人各种调试
一旦拥有了这个可控的视频世界模型,它就成了所有机器人策略模型的标准化评估层。
我们把目前业内主流的策略(例如 Octo、OpenVLA、RT-1)放进世界模型里进行滚动测试。
在一个“把茄子放进锅里”的任务中,各家策略的真实水平一目了然:OpenVLA 表现完美,顺利完成;Octo 动作做了一半,未能完全把茄子送进去;而几年前的老模型 RT-1,因为输出的控制动作完全超出了当前的分布(OOD),甚至直接把我们的世界模型都给“带崩”了——但这也正是世界模型的价值所在,它提醒我们,这种动作如果直接在真机上运行,是会把机器人搞坏的。
更有意思的是,我们不再需要费尽心思在现实中搭建各种奇奇怪怪的长尾场景,世界模型允许我们直接通过图像编辑,来定制任意的超出分布(OOD)安全测试。
比如,我们用图像编辑模型在场景里加了一张电脑屏幕,屏幕里画着一根胡萝卜,然后命令策略模型“去把胡萝卜拔出来”。
结果发现策略模型纠结了半天,最后居然冲着电脑屏幕去了。
我们还通过加入小黄鸭、玩具车等干扰物,发现策略模型的成功率瞬间暴跌;我们甚至用它来调试原因,发现目前的模型理解“颜色指令”的能力远好于理解“形状指令”。
数据证明,世界模型得出的评估结果,与真机实测的成功率呈现出强烈的正相关性。
我们在云端找到了一个极其廉价、可定制且100%可复现的质检标准。
04
World Gymnast:让机器人从失败中学会自我恢复
能够评估之后,下一步就是如何利用世界模型来提升策略。我们推出了World Gymnast项目,让机器人代理在世界模型中通过强化学习(RL)疯狂演练。
现在绝大多数机器人学习都依赖人类遥控的数据来做监督微调。但大语言模型的发展历史(从 GPT-3 到 ChatGPT)告诉我们,真正带来能力跨越的,是利用验证器(Verifier)和强化学习(RL)去大规模地扩增和解决训练任务。
在 World Gymnast 中,机器人数据集里的任意一个画面都可以作为强化学习的起始点。哪怕是一张机器人已经操作失败、干砸了的画面,我们也可以将其作为 RL 的起点,逼着策略模型在世界模型里学会如何从错误状态中恢复(Failure Recovery)。
我们利用视觉语言模型(VLM)作为通用的奖励模型(Reward Model),输入任务指令和世界模型生成的视频,让 VLM 像裁判一样给出成功或失败的反馈。
随后,这个反馈通过策略梯度(Policy Gradient)直接对策略网络进行在线更新。
我们通过第三方自动化重置平台对开门、关门、放茄子等 4 个完全没有见过的全新留存任务进行了真机测试。
结果令人振奋:在世界模型里跑过强化学习的模型,其表现不仅显著优于监督微调,也击败了在传统物理模拟器(如 Simpler)中训练的基准模型。
传统的软件模拟器在面对复杂的物体物理接触时经常失真,而世界模型由于直接从海量数据中进行最大似然学习,天然具备极强的接触动力学拟合能力。
05
未来怎么走?用内环与外环的“数据飞轮”撬开通用大门
尽管目前的视频世界模型并不完美,偶尔还是会出现轻微的幻觉,或者改变物体的颜色,但即使是不完美的模型,也已经能够提供足够正确的改进信号,让策略模型变得更强。
展望未来,通往具身智能 AGI 的关键在于建立一个混合数据飞轮:
1.内环:策略模型在参数化的视频世界模型里,进行成千上万种虚拟任务的低成本强化学习进化。
2.外环:机器人自主探索并产生失败数据,这些失败数据是完美的燃料,可以直接用来梯度更新我们的世界模型,让世界模型更精确。
互联网上庞大的 第一视角人类交互视频是极大的宝藏。人类是地球上最强大的物理代理,我们可以通过端到端控制,把人类视频转化为机器人的世界先验。
未来,通过世界模型将互联网视频的“广度”与机器人具身控制数据的“精度”桥接起来,我们就能真正敲开通用机器人的大门。谢谢大家。
06
现场 Q&A 环节
▎Q:感谢您的精彩演讲。在前半部分关于世界模型评估的介绍中,您提到当年测试 RT-1 模型时,由于动作太过于超出分布(OOD),直接把世界模型也给“带崩”(产生严重幻觉)了。
这看起来像是一个“鸡生蛋、蛋生鸡”的悖论:策略模型不工作,导致世界模型也不工作。当世界模型无法泛化到这种极端分布外的错误动作时,我们该怎么打破这个死局?
Sherry Yang:这确实是一个非常切中要害的问题。如果动作完全超出了分布,且在没有任何真机数据补充的情况下,单靠世界模型去打破这个 deadlock确实很难。
但如果我们换一个视角,把机器人看作是一个可以自主探索的自动化代理,情况就会发生改变。在真机落地中,机器人一定会自主产生大量的失败数据。
我们的解法是:利用这些真机踩坑碰壁的失败数据,优先去更新和微调我们的世界模型,让世界模型首先去理解这个“新分布”;当世界模型的模拟边界被这些失败数据拓宽之后,它反过来就能够产生正确的信号,继续指导和训练策略模型。这正是一个相互促进的飞轮过程。
一个人读论文太孤单,一群人刷顶会才好玩。
RSS 2026召开在即,我们正在召集一波含金量极高的 AI 研究者。群内主打实时论文跟踪与硬核技术探讨,拒绝灌水。
? 进群传送门:扫码进群或添加微信Luyoyo_2026,备注:论文群 + 关注的 AI 方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈