• 采购项目
  • 配套企业库
  • 销量查询
  • 盖世汽车社区
  • 盖世大学堂
  • 盖亚系统
  • 盖世汽车APP
  • 2026盖世汽车研究院年中闭门沙龙 智竞全球——AI 重构・格局重塑・出海新程
  • 汽车出海新书发布
  • 2026金辑奖申报
  • 2026具身感知融合与多模态大模型创新研讨会
  • 2026第四届AI定义汽车论坛
  • 走进上汽创新技术展示交流会
  • 2026第六届智能汽车芯片生态大会
当前位置:首页 > 智能网联 > 正文

VLA还没死,WAM也没立,物理AI终局尚早

盖世汽车 吴宇 2026-07-23 14:20:48
文章标签: 具身智能

2026年,具身智能赛道热度虽没减,争议却换了焦点:VLA是不是真的已经过时了?

过去两年,VLA(视觉-语言-动作模型)几乎是具身智能基座的标准答案——输入视觉和语言,直接输出动作。这套"感知-决策-执行"的端到端架构,支撑了行业从“示教重复”到“指令泛化”的第一次跃迁。

但进入2026年,世界模型成为了行业新的技术热点,特别是面向机器人控制的世界动作模型(World Action Model,简称WAM)快速走向落地,从顶会论文到产业实践,越来越多团队宣布重点投入该路线,“VLA已死,WAM当立”的说法在行业内悄然流传。

争议之中,有企业全面转向WAM,有企业仍在坚守VLA阵地,但同时也有玩家选择双线押注,一个新的产业共识由此逐渐浮现:VLA远未退场,WAM也非万能解药,物理AI的基座模型,还远没到"架构定局"的时刻。

正本清源:两条路线的本质分野

要讨论VLA与世界模型的路线之争,首先要回到这两种技术路线的本质差异。用通俗的话讲,VLA与世界模型最核心的区别,在于“做事的逻辑不一样”。

VLA的逻辑,在行为层面很像人类的“肌肉记忆”:看到眼前的场景、听到要做的任务,大脑直接支配执行机构做出动作。

更具体一点,VLA是一套“感知-动作”的直接映射——输入视觉图像和语言指令,模型经过计算后,直接输出下一步的动作指令,中间没有额外的“思考推演”环节。

这种架构的优势非常直观。“VLA非常擅长语义理解、任务Grounding以及粗粒度任务规划,总结来说,它能够帮助我们明确当前对象是什么、环境状态是什么,以及我们需要完成什么任务。”在智元合伙人、高级副总裁、具身业务总裁、觅蜂科技董事长兼CEO姚卯青看来。

VLA还没死,WAM也没立,物理AI终局尚早

图片来源:智元机器人

不仅如此,VLA还具备高效的推理效率,因为没有中间的推演步骤,计算量相对可控,更容易满足机器人实时控制的低延迟要求。

但其短板也同样明显。由于跳过了对世界环境的认知建模环节,一旦遇到训练数据中没有覆盖的新场景、新任务,VLA很难做出适配性调整,泛化能力会出现明显下滑。

“我们发现,对于传统VLA模型,非常容易出现性能退化问题,也就是当遇到新场景、新任务时,模型的能力会出现退化。”日前,在WAIC 2026同期举办的“智启具身:迎接物理AI智能涌现论坛”上,清华大学计算机系副研究员苏航直言。

不仅如此,由于缺乏对物理世界运行规律的内在因果建模,VLA很难像人类一样,在行动前预先推演不同动作可能带来的结果,也就难以完成对安全性、规划性要求较高的复杂任务。

比较之下,WAM的思路则完全相反,它更像人类“先想后做”的做事方式:动手之前,先在脑子里推演一遍动作的过程和结果,确认没问题了再执行。换言之,WAM不直接从画面输出动作,而是先生成“做完动作后世界会变成什么样”的视觉画面,再基于这个预想的目标,反推出应该做什么动作。

这种“推演式”的架构,天然具备三个核心优势:第一,长程任务规划能力更强,通过在未来时间尺度上进行粗粒度意图规划、在近处进行细粒度物理控制,可以做到“近处精细、远处粗略”,避免走一步看一步,最终导致偏离整体目标;

第二,鲁棒性更好,因为WAM在推理时会预判动作后的世界状态,这种“预测-验证”机制为异常检测和策略调整提供了理论基础,一旦实际和预想不符,能主动调整策略纠错,而不是像VLA那样容易“死循环”;

第三,对视频数据利用率更高。WAM 的预测式建模逻辑与海量互联网视频天然适配,能更高效地从中学习物理世界运行规律,有望降低对高成本真机示教数据的依赖。

当然,WAM也不是绝对完美的。首先,它的语义理解能力弱于VLA,对复杂自然语言指令的跟随性没那么好;其次,因为WAM需要在行动前推演未来的物理状态,这导致推理的算力开销更大,对机器人端侧芯片的算力和带宽提出了更高要求。

正因为各有优劣,从技术本质上看,VLA和WAM其实并非同一维度的替代关系,而是分别对应了具身智能的两类核心能力:一个偏向认知与语义理解,一个偏向物理与运动控制,各有清晰的能力边界。

路线选择:场景适配下的融合大势

尽管关于VLA和WAM的路线之争仍未结束,但其实坚持纯粹的“唯VLA论”或“唯WAM论”的企业也并不多,反而一个新的共识正在逐步形成:这两条路线大概率将走向融合,只是融合的方式、节奏和主导者,各家仍有不同判断。

智平方创始人兼CEO郭彦东就曾在多个场合指出,VLA与世界模型不是替代关系,而是深度融合、整合共生的关系。“人的大脑本身就内置了世界模型,用来理解物理环境、预判环境变化,同时依靠高层认知完成任务规划,对应机器人的VLA能力。人脑的结构已经告诉我们技术终局,融合才是唯一答案,不存在二选一。”

本次论坛上,姚卯青也明确表示,未来这两条路线的终局一定是融合,据此智元提出了World Reasoning Action Model(世界推理动作模型)。“WRAM的工作方式可以理解为,先理解任务,再去推演未来,进一步评估选择,最后落实到实施行动。这不再是简单的感知-动作的肌肉映射,而是具备物理世界推演能力的一个终极智能体。”

VLA还没死,WAM也没立,物理AI终局尚早

部署Act2Goal模型的机器人练习绘制未见过的图案,图片来源:智元机器人

聚焦这一目标,智元构建了“预训练—后训练—持续学习”的三阶段训练架构,并正沿着VLA与WAM两条路线持续演进。

其中在VLA技术路线方面,智元已经相继推出了GO-1和GO-2两个基座模型,其中GO-1赋予了机器人可靠的理解能力,GO-2则聚焦解决规划到执行的衔接问题,首次引入了动作思维链。在此基础上,智元预计今年底进一步推出GO-3模型。

而在世界模型路线方面,智元已经推出支持记忆的GE-Act,以及首次实现Goal-to-Action的Act2Goal,实现了从未来预测到机器人闭环控制的跨越。

Physical Intelligence(π)研究科学家任至意同样认为,VLA与WAM没有冲突。

作为硅谷头部具身智能初创企业,π的定位是做通用具身大脑,核心目标是最大化模型的泛化性与可引导性,让一个模型能适配不同本体、不同场景、不同任务。为此,PI在过去两年先后推出了多代具身大脑模型,最新一代是π0.7,于今年4月正式发布。

据了解,π0.7的核心思路是在成熟的VLA架构基础上,加入未来视觉子目标生成模块:用世界模型先生成“下一步要达成的目标画面”,再用VLA根据这个目标画面输出具体动作。这种模式,既保留了VLA在语义对齐、泛化性上的优势,又补上了长程规划与状态预判的短板,工程实现难度也更低。

“到目前为止,我还没看到哪家的demo能比π-07更让人印象深刻,所以VLA可能还没死。”任至意在回应“VLA已死”的说法时,甚至直言。

Dyna Robotics,则是WAM转向派的代表。

作为海外落地派具身智能的代表性初创企业,Dyna Robotics的核心目标不是做最通用的模型,而是在具体场景里把成功率做到极致,让机器人能24小时不间断干活。

Dyna Robotics联合创始人马也骋指出,他们从VLA转向WAM,核心驱动就是落地需求。

不过,马也骋同时也坦言,VLA和WAM各有千秋,不存在绝对的好坏,关键看场景适配:“针对我们所需的不同能力来说,有的场景用WM实现会比VLA更高效,也有的场景VLA会更高效。”

腾讯干脆跳出了“单一模型谁更好”的争论,直接采用分层架构。

VLA还没死,WAM也没立,物理AI终局尚早

图片来源:腾讯Robotics X实验室

腾讯首席科学家、腾讯Robotics X实验室主任张正友认为,具身智能还在早期,没有形成统一收敛的框架,不像大语言模型,Transformer基本定了,加数据加算力就能往前推。

所以腾讯打造了持续在线的具身智能体Apexio,该智能体分为三层:上层是认知系统,负责推理规划;中层是感知行动系统,负责决策;底层是肢体反应系统,负责实时运动控制。

三层各自闭环、信息互通,在不同频率下运行。在这个体系里,VLA和WAM不过是不同层级的工具,不存在谁替代谁的问题。

值得一提的是,除了Apexio,腾讯还于近期发布了新一代具身VLM(视觉语言)基座模型Hy-Embodied-VLM-1.0、具身原生的世界认知模型Hy-Embodied-RxBrain-1.0、视觉-语言-动作(VLA)模型Hy-Embodied-VLA-0.5三大方案,目前都已经开始进入真实工业场景,并在导购导览、养老服务等多个任务中完成落地验证。

整体来看,不同企业的路径选择看似分化,实则指向清晰的行业共识:在当前阶段,单一架构尚无法覆盖物理AI的全部场景需求,VLA与世界模型的融合,是技术演进的必然方向。

终局猜想:多元路线并行的长期演进

具身模型持续演进背后,整个行业都在追问同一个问题:具身智能会不会像大语言模型一样,最终收敛到一个统一的架构,然后进入拼数据、拼算力的缩放定律阶段?

目前来看,至少短期内,还不太可能收敛。

背后的原因并不复杂:首先,物理世界的复杂度远高于数字世界。

语言是一维、离散、规则明确的,而物理世界是三维、连续、充满不确定性的,摩擦力、形变、碰撞、扰动,变量多到无法穷举。仅仅依靠单一架构,很难同时覆盖语义理解、物理推演、运动控制等完全不同的能力维度。

其次,端侧算力的约束,决定了分层是必然选择。

姚卯青算了一笔账:当前最先进的端侧芯片,也只能跑50亿-100亿参数的模型,运行频率也就10赫兹左右。因此,不可能把一个上千亿参数的大模型放在机器人本体上,直接控制每秒上千次的电机运动。

这就倒逼行业必须走端云结合、分层控制的路线:云端大模型做低频的认知规划,端侧小模型做高频的动作执行。在这个架构下,天然就不会存在一个“包打天下”的单一模型。

最后,场景的碎片化,也决定了技术路线的多元化。

工业制造、家庭服务、仓储物流,不同场景对精度、速度、成本、泛化性的要求天差地别,没有一种架构能在所有场景里都做到最优。

正是因为统一架构的时代远未到来,具身智能赛道已经形成了多元技术路线并行发展的格局。除了VLA、世界模型以及二者融合的主流路线,还有多条差异化路径正在同步推进。

VLA还没死,WAM也没立,物理AI终局尚早

图片来源:具脑磐石

类脑智能便是其中之一,国内代表性企业有具脑磐石、智平方、千诀科技、灵生科技等。

这条路线不走“大数据+大模型”的传统拟合路径,而是主张用清晰的类脑智能思想替代盲目的计算,通过复刻人脑认知逻辑,构建兼具抽象推理、自主规划、持续学习能力的机器心智。

在具脑磐石创始人&CEO朱森华看来,当前以VLA体系为代表的具身智能1.0已抵达能力天花板,全球技术路线正集体转向世界模型,行业开始迈入可推演、可规划、可自主决策的具身智能2.0阶段。但目前业界对“世界模型”的定义不清晰,算法演化方向也不明确。

基于多重考虑,具脑磐石认为,突破具身智能能力上限的根本,不在于单纯的数据量积累,而在于神经网络底层范式的革命性创新。更具体一点,即类脑智能才是行业破局唯一核心路径,也是通往AGI的必由之路。

为此,具脑磐石已经自研了Bi-VLA(Brain inspired-VLA)和Bi-Agent(Brain inspired-Agent)两大脑启发具身技术底座,并据此打造了首代脑启发具身大脑产品EBKernel Brain,该方案支持“一脑多机”与“一脑多形”,此前已经展开了相关的落地验证。

郭彦东也认为,“类脑”将成为下一代物理世界AI破局的关键要素

在他看来,具身大模型不只是堆算力和堆数据的游戏,即便是世界模型跟VLA结合,也远远达不到机器人大脑的一个终局的方案。“未来要真正解决具身大模型面临的训练效率、算力和能耗等核心挑战,关键要靠类脑。”

VLA还没死,WAM也没立,物理AI终局尚早

图片来源:智平方

聚焦这一目标,智平方采用“大脑皮层—小脑—脊髓”三层架构,打造了首个类脑式具身智能系统NeuroVLA,于今年6月刚刚发布。在该系统中,大脑皮层主要负责语义理解和任务规划,小脑负责高频运动协调与动态修正,脊髓则负责毫秒级运动执行与安全反射。

目前,该系统已搭载于智平方AlphaBot 2机器人,并于WAIC 2026期间公开亮相,展示在工业制造领域的PCB上下料,完成托盘取料、上下料、移动运输、双臂协同等一系列连续动作。

值得一提的是,这种多元路线并行的格局,恰恰也是赛道走向成熟的信号。

两年前,行业还在反复论证具身智能的产业价值;一年前,各家还在比拼演示视频的惊艳程度。而今天,从业者已经开始细致讨论不同技术路线的适配场景、成本效率与融合路径,这意味着,行业已经走出概念启蒙期,进入了实打实的技术深耕与落地验证阶段。

结语

数字世界的规律,能靠大规模数据拟合,但物理世界充满复杂性与不确定性,这也注定了具身智能的演进,不会只有一条标准答案。

因此,不必急于断言VLA已经退场,也不必把WAM捧成新神话。至少目前来看,VLA在语义理解上的积累仍有其价值,WAM在物理推演上的突破也还在持续推进,叠加类脑智能等更多差异化路线的探索,将共同拓宽行业的技术边界。

最终,所有技术路线的价值,都要靠真实场景的落地来检验。当机器人能稳定、低成本地解决真实世界的具体问题时,路线之争自然会尘埃落定。

*版权声明:本文为盖世汽车原创文章,如欲转载请遵守 转载说明 相关规定。违反转载说明者,盖世汽车将依法追究其法律责任!

本文地址:https://auto.gasgoo.com/news/202607/23I70467026C601.shtml

 
0

好文章,需要你的鼓励

微信扫一扫分享该文章