本报讯 (记者金婉霞)当大模型在语言、代码等数字世界实现能力跃迁后,人工智能正加快走进物理世界。机器人如何感知环境、理解任务、执行动作,并从真实反馈中持续进化,成为具身智能产业关注的核心问题。7月19日,由智元创新(上海)科技股份有限公司(以下简称“智元创新”)与上海觅蜂具身智能科技有限公司(以下简称“觅蜂科技”)联合主办的2026世界人工智能大会(WAIC)“智启具身论坛2026——迎接物理AI智能涌现”在上海举行。来自清华大学、PhysicalIntelligence、GenesisAI、DynaRobotics、腾讯RoboticsX等高校和企业的代表,围绕物理AI如何翻越ScalingLaw“物理墙”展开讨论。
ScalingLaw(规模扩展定律)通常指随着模型参数、训练数据和算力持续增加,人工智能模型的能力会呈现相对可预测的提升。大语言模型正是沿着这一路径实现能力跃迁。但在物理世界中,机器人不仅需要处理信息,还要完成抓取、移动、操作等真实动作,同时受到数据采集成本、硬件性能、环境变化和试错风险等多重因素限制。因此,简单扩大模型和数据规模,未必能够复制大语言模型的成功,这被业内形象地称为ScalingLaw的“物理墙”。
智元创新合伙人、高级副总裁、具身业务部总裁,觅蜂科技董事长兼首席执行官姚卯青表示,物理AI要实现规模化发展,仍需突破数据、表征和闭环三道障碍:真实交互数据稀缺且采集成本高;跨任务、跨场景、跨机器人本体的统一物理表征尚未形成;真实环境中的试错代价高、反馈速度慢,难以形成大规模训练闭环。
围绕上述难题,智元创新构建了“预训练—后训练—持续学习”三阶段训练体系,并沿VLA(视觉—语言—动作模型)和WAM(世界—动作模型)两条路线推进融合,探索WRAM(世界推理动作大模型)。同时,该公司通过仿真系统、分布式真机强化学习和部署数据回流,推动模型持续迭代。
数据基础设施也成为论坛讨论的重点。姚卯青介绍,觅蜂科技已布局数据采集终端、治理平台和真机数据集,尝试形成“执行—回流—挖掘—更新”的数据飞轮。相关技术已在江西南昌3C平板生产线进行规模化验证,公司称产线作业成功率达到99.99%。
清华大学计算机系副研究员苏航认为,具身智能的预训练范式,正从单一本体、特定任务的行为模仿训练,转向开放世界通用能力训练。未来,机器人轨迹、遥操作数据、第一视角视频和人类行为视频等多源数据将进入统一训练体系,行业竞争也将从单项任务演示,转向模型的通用性、迁移性和持续学习能力。
PhysicalIntelligence研究科学家任至意介绍,其模型已尝试将在一种机械臂上学习到的衣物折叠能力,迁移至另一种双臂机器人,验证能力跨本体复用。DynaRobotics联合创始人兼首席科学家马也骋表示,该公司通过研究、部署和数据回流形成迭代闭环,其模型在餐巾折叠任务中的成功率达到99.4%,并实现24小时无人干预作业。
圆桌讨论中,与会嘉宾认为,机器人要迎来类似大模型的“ChatGPT时刻”,仍需要大规模、多来源的物理交互数据。互联网数据、第一视角数据、真机数据、仿真数据和部署回流数据,将共同构成物理AI的“数据配方”。
对于技术路线,嘉宾普遍认为,VLA与WAM并非相互替代,未来可能进一步融合。物理AI的能力涌现也不会来自单一模型或单一数据源,而取决于数据、模型、仿真、真机反馈、部署场景和机器人本体共同形成的持续进化体系。
(编辑 鲍鹏宇 张伟)