• 盖世汽车产业大数据
  • 采购项目
  • 配套企业库
  • 销量查询
  • 盖世汽车社区
  • 盖世大学堂
  • 盖亚系统
  • 具身智能
  • 人形机器人感知系统产业报告(2026版)
  • 2026第四届AI定义汽车论坛
  • 汽车出海新书发布
  • 造车2.0新书发布
当前位置:首页 > 活动 > 正文

光象科技吕尧:迈向泛在具身智能之路,物理原生的世界模型、数据结构与训练算法

盖世直播 张情 2026-09-16 18:49:03

光象实验室首席科学家吕尧围绕具身智能的发展方向、技术框架与产业实践进行了系统分享。他表示,人工智能正从以信息处理为核心的时代走向以物理交互为特征的新阶段,具身智能的核心在于通过感知、决策、控制和学习形成持续闭环,使智能体能够通过行动改变真实环境。围绕这一发展逻辑,光象科技提出物理原生智能体系,从模型结构、数据结构和训练算法三个层面进行系统设计,依据显隐状态解耦、因果时序驱动、物理规律约束等核心特征,提升智能体对真实世界的理解和交互能力。

在技术落地方面,光象科技已形成覆盖数据生成、模型训练、安全探索和部署集成的一站式开发体系,并推出物理原生世界模型及相关应用。相关技术已在可完成上下料、汽车尾线质检等任务的工业级具身智能机器人展开验证。吕尧认为,随着人工智能进一步从信息世界走向物理世界,未来需要通过模型、数据与算法的协同设计,推动具身智能从单一场景应用向更加通用的物理智能能力演进。

光象科技吕尧:迈向泛在具身智能之路,物理原生的世界模型、数据结构与训练算法
 

吕   尧 | 光象实验室首席科学家

以下为演讲内容整理:

具身智能的三阶段演进与泛在具身智能概念

在感知、决策、控制与学习构成的闭环定义下,具身智能的发展将经历三个主要阶段。首先,智能辅助驾驶是首个能够量产的具身智能任务对象,其核心解决复杂智能体的自主移动问题。当前,行业已进入机器人时代,主要面向通用的移动和操作能力进行开发。未来,智能将扩展到一切可交互的物理实体之上。尽管这三个时代面向的本体构型各不相同,但它们全部共享同一套感知、决策、控制和学习的闭环体系。这正是泛在具身智能概念的出发点。要实现泛在具身智能,需要建立一套完整的开发体系。

人工智能时代的先驱们提供了重要启发:模型应当学习世界的一般表征,掌握人类认知的因果规律,并通过物理系统的集体性质实现智能计算。由此,能否将世界的具体描述、动作产生的后果变化以及客观物理规律整合到同一套智能开发体系中?这便是物理原生智能(Phi)要解决的核心问题。

物理原生智能强调,在整个体系开发中,需要面向智能体与环境交互的需求,在交互中让智能涌现。模型需要理解世界将如何变化,动作会产生什么后果,以及在学习过程中遵循底层物理规律或安全约束。因此,物理原生智能从世界模型、数据结构、训练算法三个层面展开协同设计:模型需要学习世界的变化规律,数据需要提供相应的学习信号和准则,算法则需要将信息注入模型,使模型习得真实能力。

物理原生智能的三大基本特征

物理原生智能主要有三个基本特征。

第一是状态解耦表征。位置、速度、力等显式物理状态具有明确物理含义,可以直接利用已有的物理模型描述其状态变化。相对而言,二维图像和三维点云等难以显式建模的状态,可以通过神经网络进行隐式状态提取,学习状态转移规律。显隐状态结合的方式相当于站在人类的肩膀上,直接利用人类整理提取出的知识,再通过数据驱动方式学习无法直接建模的世界转移部分。

第二是时序因果驱动。在客观物理世界中,总是先有动作才会导致环境状态变化,模型学习也应遵循这种先后关系。同时,模型需要对动作干预足够敏感。例如夹爪夹取物品时,夹爪开合时间、移动速度都会对最终的位置和接触状态产生相应变化,模型必须对这类动作干预保持敏感。

第三是物理定律约束。即使通过神经网络学习状态转移,转移过程也需满足最底层的物理规律约束,包括诺特定理给出的守恒性和对称性要求,这些约束应注入到模型结构设计和算法设计中。

这三个特征的核心目标是让模型更清晰地认知世界,更明确地理解问题,并使学习过程更加稳定。

物理原生世界模型架构与数据算法体系

朴素世界模型学习的是世界的自治转移规律,受控世界模型将动作作为条件引入学习,世界动作模型能联合学习未来状态预测和动作序列生成。但世界模型还应显式了解动作对未来后果的影响,并将这种影响注入到动作策略学习中,而不应仅将预测未来状态作为唯一学习目标。因为具身智能的核心任务是通过动作影响世界,实现最安全、最稳定的任务完成。

因此,物理原生世界模型设置多个功能模块:策略模块负责提出动作预案,转移模块预测动作后果,评价模块评估任务实现的能力与效果,并反馈至策略模块用以提升动作的生成能力。

在物理原生世界模型的总体设计架构下,语言用于提供任务描述与目标,物理观测和多源感知提供显式和隐式的物理状态。策略模块通过显隐状态给出动作提案,受控转移模块判断在状态和动作影响下世界将发生的变化,最终通过任务效能和人类经验评估动作执行情况,并影响策略模块本身。在受控转移模块中,显式物理状态主要通过显式物理动力学模型刻画,隐式物理状态通过神经网络进行受控推演。该模块分组的核心设计目标是将动作后果的影响及相关评价真正注入到动作生成中,而非仅以未来状态预测准确性作为学习目标。

在模型结构设计之上,还需要数据提供可学习的信息。数据体量固然重要,但不同来源、不同质量的数据对模型学习发挥着不同职能。互联网视频数据提供对世界底层理解和模型基础能力构建,有动作标注的数据使模型更好地对齐动作,仿真和合成数据以更低成本、更可控的方式大量生成动作对比和反事实信号,让模型在动作对比中真正学习物理世界底层状态转移规律。这些数据需关注转移特性、奖励信号和经验知识三个要素,并通过不同训练阶段和配比注入模型训练。通常先通过监督预训练打好基础能力底座,再通过强化学习探索不同动作导致的未来变化影响,使模型对齐不同任务能力,最后通过真机强化弥补仿真到真机的差异,落地到特定机体构型和工位场景。

在算法方面,要考虑三方面要求。首先是训练稳定性,模型需同时学习状态、动作和环境变化,多目标优化导致梯度复杂,可能产生震荡甚至发散,因此将参数优化视为虚拟的物理系统,将守恒性、对称性等要求注入优化过程,通过结构保持提升训练稳定性。其次是绝对安全性,具身智能通过动作真实影响物理世界,错误决策可能直接导致人身财产危险,因此从算法理论层面要求训练过程中每一代模型及数据探索过程均满足绝对安全的硬约束。最后是性能持续进化,面向通用泛化具身智能,当面对新工位、新零件、新工种时,模型能力应持续单调提升,而不应通过牺牲一种能力来置换另一种能力。

开发平台与理论模型探索

光象科技开发了一站式具身智能开发平台,用户只需给出具体训练任务和目标,即可完成数据生成、具身智能模型训练调优及部署集成工作。该平台集成了大量前期开发的代表性算法,涵盖策略学习、稳定训练、安全探索和状态估计等方面。在世界模型理论探索方面,光象科技关注世界模型应学会什么。研究发现,仅学会准确预测未来状态并不等于真正掌握物理世界的转移规律,需分层看待:世界模型学到的表征是否反映真实物理状态,以及能否区分状态自身变化和动作影响的状态变化。当数据集中仅有某一类成功的示范数据时,模型难以学会不同动作的执行后果,动作变化会导致未来预测误差显著增大。实验表明,单步预测误差小不等于真实学会状态转移规律,核心仍需通过更多动作对比信号及动作分布覆盖程度,让模型真正学会从当前状态到下一状态的转移规律。在此思想下,光象科技联合清华大学李升波教授课题组发布了第一代物理原生世界模型ActEffect。该模型在推理过程中给出直觉提案、粗提案和精提案三类动作提案,动作转移模块对三种不同动作分别预测实际执行的未来结果,并通过反事实对比信号告知模型不同动作导致不同未来变化,使模型直观了解动作对未来后果的影响。在最终部署阶段,受控转移部分可直接去除,仅需前向推理即可获得最终应用动作,保证在线推理效率。在LIBERO单臂操作基准上,ActEffect达到98.8%平均成功率,在RoboCasa-GR1人形双臂操作基准的24个任务中达到67.5%平均成功率,这说明,动作后果驱动的训练方式,在更复杂、更高维的操作任务中同样有效。

实际应用与未来展望

面向工业应用场景,光象科技开发了Phi-Bot X1工业级具身智能机器人。该机器人在WRC会场进行一机多能双工位测试,面向上下料工位和汽车尾线质检工位,能够进行单机双工位连续循环迭代测试。在上下料工位,直接面向工厂实际工业环境和工件工装,实现料件上下料,需满足毫米级定位及0.3度角度偏差的误差约束。完成上下料后,通过自主到达质检工位,完成路径规划和车身扫描。

人工智能在信息领域已实现重大突破,当前正大步迈入物理AI世界。需要将模型、数据和算法进行统一设计,将模型置于交互环境中,通过动作对比方式真正学会物理世界底层由动作引起的状态转移的因果规律及客观物理规律。只有掌握这些规律,智能才有可能通用泛化到不同本体,实现泛在具身智能。未来,随着物理原生智能体系的持续完善,具身智能有望在更多物理实体上实现扩展,但需持续解决仿真到现实的差异、绝对安全约束下的探索以及跨本体泛化等挑战。光象科技将继续推进世界模型理论与算法创新,推动通用泛化具身智能的实现。

(以上内容来自光象实验室首席科学家吕尧于2026年9月15日在2026具身感知融合与多模态大模型创新研讨会发表的《迈向泛在具身智能之路:物理原生的世界模型、数据结构与训练算法》主题演讲。)

本文地址:https://auto.gasgoo.com/news/202609/16I70472210C106.shtml

 
0

好文章,需要你的鼓励

微信扫一扫分享该文章