}


王潜 视觉中国 资料图

8月20日,在2026世界机器人大会上,自变量机器人创始人、首席执行官王潜发表演讲。

演讲中,他围绕具身智能底层技术逻辑、训练数据与基础设施建设、产业商业化落地三大维度展开论述,提出具身模型是独立于数字大模型的一类基础模型,具身训练数据是加工链路繁复的工业品,同时披露家庭、工业两大场景的落地进展,回应行业对于机器人普及节奏的两极化预期,给出不用苦等五至十年即可迎来物理世界通用智能的判断。王潜本科、硕士均毕业于清华大学,曾赴南加州大学攻读博士,在机器人实验室从事机器人学习、人机交互等研究。

他是较早在神经网络研究中引入注意力机制的研究者之一,2023年12月,王潜在深圳创立自变量机器人,带领团队聚焦端到端通用具身智能基础模型研发,希望为机器人构建能够理解并作用于物理世界的“通用大脑。”

具身模型是另一类基础模型

王潜认为,具身智能的关键任务不是让机器人完成跑步、跳舞或攀岩,而是解决精细操作(Manipulation)。全身运动控制更多是在对抗重力场,而抓取、使用工具等操作涉及遮挡、不确定性、三维空间结构以及复杂的接触过程,参数空间会迅速膨胀。即使在机器人运动能力快速提升的当下,通用抓取仍是一项困难任务。

在他看来,这类复杂性决定了机器人需要端到端的基础模型。此外,王潜表示,很多人认为,可以把多模态模型迁移到物理世界,“我们认为这件事可能性比较低。”因为物理世界的性质很难通过其他模态获得,动作模态与视觉、语言模态存在显著差异,互联网视频也难以完整记录摩擦、受力和接触等物理信息,不能简单把语言模型或多模态模型迁移到物理世界。具身模型应当成为与数字世界基础模型平行的另一类基础模型。

王潜称,自变量的技术路线,是希望能把所有能力集合在一起,做完全通才的模型,即联合处理动作生成、视频预测、语言、三维重建等任务,让不同模态在统一训练中建立联系。王潜认为,模型不只是输出动作,还应学习物体如何运动、环境如何变化以及操作会带来什么结果,进而形成对物理规律的理解。

数据不是“石油”,而是工业品

围绕行业普遍关注的数据问题,王潜提出,数据不应被简单类比为“石油”。石油是相对标准化的原材料,而能够真正用于训练具身模型的数据,更像链条很长、加工复杂的工业品,“极度复杂”。生产过程覆盖任务定义、采集、质量判断、处理、训练验证和反向优化,复杂程度可能高于模型本身。

王潜介绍,自变量已搭建了覆盖硬件、数据处理流水线和模型训练的数据体系,并尝试提高非真机数据的利用效率。公司还将VLA模型、世界模型、训练部署工具及部分数据和基础设施开源,希望借此降低行业重复建设成本、培养人才,并加快模型迭代。

在AI基础设施方面,他认为,具身AI Infra并不比语言模型Infra简单,甚至比语言模型Infra难得多,因为大部分机器人集成,不论是强化学习还是单纯做预训练,一定要和硬件打交道,硬件的性质会带来大量通信上、能否同步等问题。

物理世界的GPT时刻绝对不用等五年十年

家庭场景是王潜此次演讲中谈及落地的重要部分。2026年4月21日,自变量曾宣布,搭载具身智能基础模型WALL-B的新一代机器人将在35天后、即5月25日进入首批真实家庭。王潜当时在接受媒体采访时表示,希望机器人入户第一天就能处理大部分家务;但他同时强调,这并不意味着所有任务都能百分之百由AI自主完成,必要时仍需远程人员兜底和接管,狭窄空间、复杂工具等也会形成现实限制。

在本次大会演讲中,王潜披露,自变量的机器人已经为数百户家庭提供保洁服务。除与平台合作、参与钟点保洁外,也有机器人长期驻留在客户家中,“能够跟用户产生情感上的连接,并且实时获得用户的反馈。

工业场景也被他视为基础模型路线的阶段性验证。王潜称,自变量已在真实工业产线上部署机器人,相关场景的投资回报率达到或超过人工水平;项目从数据采集、模型训练到生产部署用时约三个月。他认为,基础模型的泛化能力正在缩短单一场景的开发周期,具身智能已开始从展示和情绪价值场景转向生产力场景。

王潜认为,现在整个社会的注意力和机器人模型的发展有一些微妙的错位,“大家有的时候会特别乐观,去年很多人问我,一年之内机器人能够很快用到家庭里面;今年又有很多人很悲观,认为需要五年到十年。”

对于今后的预期,王潜仍然保持乐观。他判断,物理世界的通用智能并非遥不可及,机器人广泛进入千行百业和千家万户“绝对不用等五年、十年”,“五年后回过头看已经生活在机器人进入千行百业、千家万户的世界活着已经基本能替代人类体力劳动的世界里。”

澎湃新闻记者 喻琰