新闻详情

新闻详情

首页 / 资讯中心 / 详情

从VLM到WAM:物理AI的三大数学内核与工程落地

发布时间:2026/9/17 19:34:42来源:尧图网络
从VLM到WAM:物理AI的三大数学内核与工程落地
如果你最近和我一样在折腾具身智能、机器人控制或者自动驾驶规控大概率绕不开三个缩写的组合拳VLM、VLA以及被反复提及的WAM。“物理AI”这个词听起来很唬人但说白了就一句话让模型不只是会读、会看、会聊而是真的能在物理世界里动手操作并且对“动了之后会发生什么”提前有预判。我最早接触这套东西时也以为只是把大模型接到机器人上后来才发现VLM解决的是多模态表征对齐VLA解决的是从感知到动作的条件分布建模WAM解决的是一段连续时间里世界状态怎么演化、行动怎么被规划。数学基础完全不是一回事。这篇就把这三层的原理、公式背后的直觉、以及我踩过的落地坑一次说清楚适合正打算入局物理AI、或者已经在用VLA但总觉得模型“差点意思”的工程师。1. 物理AI不是“AI加物理”的拼盘先厘清三个模型各管哪一段1.1 从“会看图说话”到“真的动手做”缺的不是模型而是数学对象传统大语言模型所有的训练目标都落在离散词元上输出空间是词表上的概率分布。物理AI要处理的则是连续世界的状态机械臂关节角度、末端执行器的位姿、车辆下一时刻的横向加速度、夹爪要不要再收紧一点。这些量有物理单位有上下限约束稍微错一点轻则任务失败重则撞坏设备。所以物理AI和传统AI的本质区别不在于用了什么神经网络结构而在于数学对象变了从“下一个token是什么”变成“下一个状态是什么、下一个动作该是什么、这个动作对后续状态的影响有多大”。VLM视觉语言模型的数学对象是跨模态表征空间图像特征和文本特征如何映射到同一个度量空间里并保持语义和空间一致性。VLA视觉语言动作模型的数学对象是条件动作分布给定视觉观测和语言指令模型输出的是一个动作的概率分布而不是单一动作点。WAM世界动作模型World Action Model的数学对象是状态转移和动作选择的联合建模不仅要回答“现在该做什么”还要回答“做了之后世界会变成什么样”。我见过不少团队一上来就微调VLM让它输出关节角结果效果很差因为视觉语言模型训练时根本没有“物理上可行”这个概念。模型不知道关节限位不知道夹爪碰到桌面会打滑更不知道控制频率不对会导致抖动发散。这不是模型不够聪明而是从数学任务的设定上就错了。1.2 为什么通用VLM不能直接驱动机器人感知精度与闭环动作是两码事把GPT-4V或者Qwen-VL这类通用VLM接到机器人上做抓取是很多人的第一反应结果往往惨不忍睹。问题出在两个层面。第一感知精度不够。VLM的视觉编码器为了语义理解通常会把图像缩到336x336或者更小分辨率这对识别“这是杯子”足够了但对精确的6自由度抓取位姿来说完全是灾难。抓取位姿误差超过一公分夹爪很可能撞到杯壁或者从杯沿滑掉。物理操作需要的是亚厘米级、甚至亚毫米级的空间推理语义级对齐给不了这个精度。第二没有闭环动作能力。VLM只回答“是什么”不回答“怎么动”更不回答“动了之后怎么修正”。真实物理操作是一个闭环过程视觉反馈、力矩反馈、当前关节速度、下一步规划这些信号以几十到几千赫兹的频率在循环。通用VLM一次前向推理要几百毫秒甚至几秒反应速度就失配了。所以VLM在物理AI中的定位是“大脑皮层”负责高层语义理解、任务分解和常识推理。真正动手的部分必须由VLA或者专门的策略模型来完成而要让它提前预判后果就需要WAM这类世界模型。它们不是替代关系而是各管一段。2. VLM的数学内核多模态表征对齐到底在优化什么损失2.1 从CLIP到单塔融合对比损失与InfoNCE的直觉VLM里最早也是最核心的数学机制来自CLIP那套双塔对比学习。它做的事情用一句话概括就是把对应的图像和文本映射到向量空间之后让它们的余弦相似度在批量内排名第一。对比损失的典型形式是InfoNCEL_contra -log exp(sim(z_v, z_t) / τ) / Σ_{j1}^{N} exp(sim(z_v, z_tj) / τ)其中z_v是图像编码器输出的归一化向量z_t是文本编码器的输出τ是温度系数N是batch内样本数。分子是正样本对的相似度分母是正样本加上所有负样本对的相似度。我理解这个公式最好的方式是把训练过程想象成一个“抽认卡游戏”把一批图片和一批文本随机配对其中只有对角线上的配对是正确的图像和它自己的描述。模型的任务是给每个图像找出它对应的文本。如果batch里有一张猫的照片模型需要在几十句描述里找出“一只猫坐在沙发上”而不能被“一条狗在跑步”带偏。梯度更新方向也就清楚了把正样本对在表征空间里拉近把负样本对推开。温度系数τ控制推挤的强度τ越小模型对相似度差异越敏感负样本的惩罚越重但如果τ太小训练会变得极不稳定因为模型会被要求在一个很小的窗口里区分非常相似的样本。物理AI场景下重看这个损失有一个容易被忽略的重点对齐的质量取决于负样本的构造方式。常规VLM训练用的负样本是随机语句差距很大很容易区分。但机器人的视觉状态和指令描述往往非常相似——比如“把红色方块放到蓝色方块左边”和“把红色方块放到蓝色方块右边”只有半句话的差别。如果对比学习阶段没有刻意构造这种细粒度负样本后续VLA模型的动作精度就会在底层视觉特征上吃大亏。2.2 从双塔到单塔生成式VLM里的Token化对齐原理CLIP证明了双塔结构能做全局对比对齐但双塔的问题也很明显图像编码器和文本编码器是独立的视觉信息要想参与文本生成必须通过一个固定的向量接口细粒度交互不够。现在主流的VLM比如Qwen2-VL、Llama 3.2 Vision基本都是单塔生成式架构图像被切块打成视觉token经过一个投影层映射到语言模型的embedding空间然后和文本token拼在一起走标准的自回归生成。这套架构在数学上最关键的机制是视觉token不是以“全局向量”进入语言模型而是以序列元素进入注意力计算。每一层Transformer的注意力头都可以让文本token有选择地关注图像里某一小块区域这等价于在训练过程中持续动态地做局部对齐而不是CLIP里那种一次性全局对比。训练目标也很朴素就是文本标记的交叉熵损失L_CE -Σ_i log p(token_i | token_i, visual_tokens)从物理AI的角度这种逐token的细粒度交叉注意力相当重要因为空间位置很多情况下就藏在视觉token的顺序和位置上。一些新的VLM还会在image embedding里直接编码位置坐标让模型能回答“目标在图像坐标系的哪个位置”这是VLA模型需要的关键感知能力。不过需要注意的是单塔VLM虽然交互能力更强但对齐的“数学可解释性”反而变差了。你很难说清楚某个视觉token和文本token在哪个语义维度上对齐了它是在千亿参数的黑箱里通过注意力权重和学习到的表征自然涌现的。这种情况下为了让VLM真正服务物理AI任务最好的办法不是只看图文匹配分数而是实际测试它输出的空间描述在目标坐标系里是否可执行。3. VLA模型把“看懂了”翻译成“怎么做”的分布估计3.1 动作表征的三条技术路线离散Token、连续向量、扩散分布VLA和VLM最大的差异在于输出头。VLM输出文本词元分布VLA则需要输出动作。动作怎么表示直接决定了损失函数的形式和训练的稳定性。目前主流路线有三条。离散Token路线代表是RT-2。思路很直接把动作空间离散化例如把关节角度的增量量化成256个bin动作就变成了一个整数模型输出的就是动作token的概率分布直接套用交叉熵损失。a* argmax p(a_token | visual_tokens, text_tokens)优点是可以完全复用语言模型的训练框架动作和文本是同一套优化范式。缺点也很明显量化精度受限离散化粒度不够细时动作看起来是“一步一卡”的机器人动起来很僵硬。而且动作空间通常远大于词表离散化会丢掉动作之间的连续性关系——0.1弧度和0.2弧度之间的平滑关系在离散bin里得不到任何体现。连续向量回归路线代表是OpenVLA。模型最终输出头不接softmax逻辑回归而是接一个MLP直接回归连续动作向量损失函数用L2或者L1距离L_action ‖a_pred - a_target‖²这个路线解决了量化精度问题但引入了新麻烦动作空间中不同维度的量纲完全不同。关节角度的量级是零点几弧度夹爪开合可能是一到两厘米末端位姿的平移部分可能要预测几十厘米的位移。把这些不同量纲的量直接算L2训练时梯度会天然偏向数值大的维度。所以连续回归的VLA通常需要精心设计动作归一化或者对每个维度做独立的损失权重这个细节特别影响实机效果。扩散路线代表是π0π VLA以及Diffusion Policy系列。动作预测被建模成一个从高斯噪声逐步去噪生成动作序列的过程。数学上用的是去噪扩散概率模型目标函数是预测噪声的L2损失L_diff E[ ‖ε - ε_θ(o, t, c, s)‖² ]其中ε是高斯噪声ε_θ是神经网络预测的噪声。推理时从一个随机噪声向量出发迭代T步去噪得到一个动作轨迹。扩散路线的优点非常突出它拟合的不是一个均值动作而是一个完整的动作分布天然支持多模态行为。同样的场景和指令既可以选择稍微靠左抓也可以选择稍微靠右抓模型不再需要被迫平均。这在机器人操作里尤为重要因为很多任务的解根本不是唯一的强行回归均值会让动作变得犹豫不决。缺点是推理慢去噪迭代在低功耗设备上可能成为瓶颈现在的Lightning等加速蒸馏方案就是在缓解这个问题。3.2 从行为克隆到物理约束注入VLA损失函数里的隐藏工程翻VLA论文时你会发现很多论文公开的loss就是简简单单一项动作回归。但真正部署到真机的工程团队都知道只在loss里加一个动作回归项是不够的。物理AI的动作学习本质上是在一堆超出网络容量范围的物理约束里找可行解。关节限位是最基础的约束速度限制和力矩限制是物理层面的夹爪的力反馈是交互层面的。如果模型在训练时没见过接近极限的样本推理时就很容易输出一个超过限位的动作。一种便宜的工程手段是在loss里加正则项。比如用关节空间的角度差和角速度差构造一个平滑性惩罚L L_action λ1 * ‖Δq‖² λ2 * ‖Δv‖²其中Δq是连续两步的关节角度差Δv是速度差λ是权重。这个正则项会迫使模型输出平滑的动作轨迹减少抖动。更强的约束是把预测动作送到一个可微的机器人运动学模型里算出末端位姿然后对关节限位和碰撞距离施加惩罚。但可微运动学链的装配误差和真实机器人总有偏差压得太狠同样有问题。行业里更常见的是“软约束后处理”的组合拳训练时用动作分布建模保证多样性推理时加一个安全筛选器把关节超限或者碰撞风险高的动作丢弃再从候选集中选一个。这也是为什么π0这类扩散模型在实际部署时受欢迎因为采样多次可以得到多个候选动作比单点回归更容易做“安全拒绝采样”。3.3 从RT-2到Alpamayo、π0VLA主流架构的共同骨架如果把这些架构摆在一起看会发现它们的骨干网络几乎都来自预训练VLM。RT-2直接用PaLI-X初始化OpenVLA用Prismatic-DINOv2加Llama-2特斯拉和英伟达那边面向辅助驾驶的VLA推理模型如Alpamayo也是基于一套大规模预训练视觉语言骨干再叠加轨迹或动作预测头。这背后的数学逻辑很清晰物理操作需要感知先验而感知先验可以从海量互联网图文数据中预训练得到再用机器人数据做后训练。机器人真机数据极其昂贵一小时遥操作数据可能对应几小时的标注和清洗指望纯机器人数据训练出强视觉感知器完全不现实。VLA模型的骨架加上轻量动作头本质上是把“语言对齐”到“动作分布”做了一个迁移。有人会问这种迁移会不会影响VLM原本的语言能力会。这也是我反复提醒团队慎用全量微调的原因。灾难性遗忘是实际存在的预训练模型在图文任务上的能力会在机器人数据上一轮一轮退化。LoRA之类参数高效微调会好一些但动作头的容量往往不够动作精度会打折扣。这是一个需要反复权衡的工程点。4. WAM的本质在模型内部建立“世界变化”的可计算过程4.1 从状态转移概率到隐世界模型WAM的第一个数学对象VLA回答了“现在该做什么”但它不太擅长回答另一个问题“做了这个动作之后世界会发生什么”。后者就是世界模型和WAM的立足点。经典强化学习里环境被形式化为马尔可夫决策过程。核心的数学对象是状态转移概率p(s_{t1} | s_t, a_t)它表示在当前状态s_t采取动作a_t之后下一时刻状态变成s_{t1}的概率。VLA的数学目标是从观测到动作的条件分布p(a|o, x)而WAM要在模型内部额外建模这个转移过程并且把“预测未来”和“选择动作”放在同一个可微的计算图里。为什么要强调“可计算”因为真实物理世界不能用一张表查。桌面上一个杯子状态有位置、朝向、速度、接触力等无数维连续量完整状态转移无法枚举。WAM的做法是学习一个隐编码z来表示当前世界状态然后预测隐状态的转移规律s_encoder(o_t) → z_t z_{t1} f(z_t, a_t) o_{t1} ~ g(z_{t1})其中f是转移函数g是生成观测的解码器。模型不需要显式追踪每个物理量而是在隐空间里找到一组能预测未来观测的低维表示。这就是Dreamer、IRL等世界模型方法的雏形。在物理AI的语境里WAM进一步强化了“动作”的位置——不仅预测未来还把动作产生也纳入同一个优化闭环。4.2 WAM如何把感知先验变成动作规划的约束WAM不是要取代VLA或者VLM它的实际价值是把感知和规划拧在一起。举一个我实际调过的场景机械臂要从桌上抓杯子VLM负责识别杯子位置VLA负责输出抓取动作。如果中间没有一个“世界模型”帮忙推理VLA可能会直接规划一条从当前位置穿桌而过的轨迹因为它在训练数据里没见过“桌子是不可穿过的障碍物”这件事。把WAM接到规划环节后问题被形式化为一个带约束的优化a* argmin_a Σ_t c(s_t, a_t) s.t. s_{t1} WAM(s_t, a_t) g(s_t) ≤ 0其中c是代价函数g是环境约束。这里VLM/VLA的输出不是直接执行命令而是变成代价函数里的一个soft先验VLA主张往哪个方向抓世界模型检查这条轨迹是否在动力学上合理如果VLA的动作会导致杯子被撞飞或者机械臂关节超限世界模型给出的状态预测就会让代价函数飙升规划器就会去选VLA的次优动作。这种“生成候选模型评估规划筛选”的范式比单纯端到端让VLA自己负责一切要稳得多。代价是推理多了一个环节延迟上升但它把“预测”和“决策”两个数学任务分开各自的可解释性都更好。4.3 联合训练目标预测误差和决策误差为什么不能简单相加把VLM感知、VLA动作和WAM世界预测放在一个损失函数里训练看起来顺理成章L_total λ1 * L_act λ2 * L_pred但这个简单的加法在实践里坑很多。第一个坑是量纲失配。动作预测的L2误差通常零点几图像观测重建的误差动辄几十上百直接加权会让模型把所有容量都花在重建图像上决策能力反而退化。第二个坑是梯度路径差异。动作预测的梯度从输出头往回传要经过VLA的骨干网络世界模型预测的梯度是从下一时刻的观测预测输出往回传经过的是转移函数和隐编码网络。两个梯度的尺度相对大小会随着训练动态变化固定权重很难保证两者都正常收敛。第三个坑是冲突样本的处理。有些任务里一个视觉输入可能对应多个可行动作但对应的未来状态却非常不同。模型需要的是“有条件地预测多样性”而不是逼着世界模型在训练里把两个差异巨大的未来观测平均成一个模糊状态。我的经验是除非有足够的算力做鲁棒优化否则不要轻易端到端联合训。更稳的路线是分阶段训练先用VLM冷启动初始化感知再用VLA独立训动作最后冻结大部分骨干只联合微调WAM和浅层策略头。这也正是很多工业级方案在做的事因为数学上“漂亮”的联合训练落到工程上经常是原地爆炸。5. VLM、VLA、WAM的工程落地数据、算力与评测的三角博弈5.1 数据管道的顺序不能反先对齐语义再混合动作数据物理AI项目里最容易被低估的是数据管道设计。很多人拿到一个开源VLM直接拿真机遥操作数据开始微调效果往往很差。背后的数学原因是预训练分布和后训练分布的mismatch会毁了对齐好的表征。机器人数据通常只有几万到几十万条而VLM预训练阶段见过的是几亿甚至几十亿图文对。直接微调相当于用很小的数据分布去覆盖巨大的先验知识除非学习率压得极低并且用LoRA之类的约束化训练否则模型会迅速“忘记”通用视觉语义变成只知道当前任务数据分布的专用模型。今天我们拿到一个新任务它可能跟训练时完全不一样——堆叠、开抽屉、插线、倒水——如果通用感知先验被覆盖掉了泛化能力就没了。我的建议是分三步走。第一步用通用图文数据充分训练VLM把视觉和语言的语义对齐做扎实第二步混入机器人数据但保持大比例通用数据让模型逐步适应动作预测格式第三步才把通用数据比例降下来在目标任务数据上做最后的策略精修。步骤反了后面再想找回通用语义代价比一开始就按顺序做要大得多。5.2 算力分配VLA动作头很便宜WAM才是最吃显存的模块聊物理AI的基础设施时有个反直觉的点我想专门说一下VLA的动作头往往只是一层MLP或者一个小型去噪网络非常便宜真正吃算力的是WAM的预测模块和骨干VLM的视觉编码器。骨干VLM的视觉编码器输入是高分辨率多帧图像显存占用随序列长度线性增长。WAM做未来帧预测时即使只预测隐空间而非完整图像训练时也要同时维护预测头、转移网络和目标帧编码显存需求非常可观。NVIDIA在辅助驾驶场景推的VLA推理模型比如Alpamayo把感知、预测、规控一体化放到车上时最大的工程瓶颈其实也是显存和延迟——车端推理芯片的算力远比不上训练集群。所以做物理AI项目前先算一笔账你的模型并行尺寸、动作序列长度、未来预测步数分别会占用多少显存。我见过一个项目VLA全参微调时batch size设得很小结果BN层的统计量估算严重偏差训练出来的动作头在真机上一路狂抖。后来改成固定视觉编码器、只训动作头和WAM的浅层预测器显存占用降了一半效果反而更稳。5.3 评测指标为什么总是“看着对上手错”最后聊评测。很多人用成功率来评VLA但成功率这个指标在数据量少的时候统计噪声太大了——十条任务错一条成功率从100掉到90根本看不出模型是变好还是变坏。而且成功率只回答“成没成”回答不了“失败在哪个环节”。我自己的项目里会把评测拆成三个层次。感知层目标物体的检测精度、位姿估计误差、类别识别正确率。这层主要检验VLM的视觉本质质量是和真机效果强相关的第一道关卡。策略层给定固定初始场景VLA输出的动作轨迹与示范轨迹的偏离程度、成功率、回合平均步数。这层检验VLA学的策略是否准确以及它面对多模态行为时是否过于平均化。动力学层WAM预测的未来状态和真实环境状态之间的误差以及基于WAM的规划器与基于真实模型的MPC的差距。这层直接暴露“模型脑子里想象的物理世界”和“真实物理世界”的偏差。很多团队跳过了第一层直接评第三层结果模型后处理里的噪声被误当成策略问题一边调策略一边摇头。其实回头看一眼感知层的VLM位姿精度八成问题出在早期特征对齐上。我的习惯是每个阶段都要有能和真机记录对齐的日志系统把感知输出、动作输出、世界模型预测和真机真实状态记录到同一个时间轴上失败之后能回溯是哪一层先崩的。物理AI项目的调试绝大多数时间不是在看模型结构而是在看数据分布和这三级评测里到底哪一级先失守。写在最后的实操心得如果只让我给一条最实在的建议那就是别一上来就端到端。先把VLM的视觉特征对齐做好再让VLA学会输出动作分布最后用WAM兜底做物理约束校验每一步单独验证能大幅降低排障难度。数学原理上VLM盯着表征对齐VLA盯着条件分布WAM盯着状态转移三者各司其职混在一起只会让梯度互相打架。真机实验时多留一份记录任何一层输出异常都能在日志里找到这会让你在调试路上少走一半弯路。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

skill-validator 评估结果排查指南:读懂 results.json、定位失败模式与修复评估场景 2026/9/17 21:01:56

skill-validator 评估结果排查指南:读懂 results.json、定位失败模式与修复评估场景

skill-validator 评估结果排查指南:读懂 results.json、定位失败模式与修复评估场景 【免费下载链接】skills Repository for skills to assist AI coding agents with .NET and C# 项目地址: https://gitcode.com/GitHub_Trending/skills17/skills 本指南源…

阅读更多 →
深入解析 .NET Runtime 的栈缓冲区溢出防护:Guard Stack(GS)机制在 RyuJIT 中的实现 2026/9/17 21:01:56

深入解析 .NET Runtime 的栈缓冲区溢出防护:Guard Stack(GS)机制在 RyuJIT 中的实现

深入解析 .NET Runtime 的栈缓冲区溢出防护:Guard Stack(GS)机制在 RyuJIT 中的实现 【免费下载链接】runtime .NET is a cross-platform runtime for cloud, mobile, desktop, and IoT apps. 项目地址: https://gitcode.com/GitHub_Trendi…

阅读更多 →
在 Raspberry Pi 上用 Grove 光传感器构建智能小夜灯:硬件接线、Python 轮询与 ADC 原理实战(IoT-For-Beginners 第 3 课) 2026/9/17 21:01:56

在 Raspberry Pi 上用 Grove 光传感器构建智能小夜灯:硬件接线、Python 轮询与 ADC 原理实战(IoT-For-Beginners 第 3 课)

在 Raspberry Pi 上用 Grove 光传感器构建智能小夜灯:硬件接线、Python 轮询与 ADC 原理实战(IoT-For-Beginners 第 3 课) 【免费下载链接】IoT-For-Beginners 12 Weeks, 24 Lessons, IoT for All! 项目地址: https://gitcode.com/GitHub_T…

阅读更多 →
english-note 英语语法笔记:VuePress 2 文档站的内容体系、本地开发与自动化部署 2026/9/17 21:01:56

english-note 英语语法笔记:VuePress 2 文档站的内容体系、本地开发与自动化部署

english-note 英语语法笔记:VuePress 2 文档站的内容体系、本地开发与自动化部署 【免费下载链接】english-note 从0开始学习英语语法 项目地址: https://gitcode.com/GitHub_Trending/en/english-note english-note 是 INet 社区出品的一套「从 0 开始」的英…

阅读更多 →
Maven 4 不可变工具链模型(Immutable Toolchains Model)深入解析 2026/9/17 21:01:56

Maven 4 不可变工具链模型(Immutable Toolchains Model)深入解析

Maven 4 不可变工具链模型(Immutable Toolchains Model)深入解析 【免费下载链接】maven Apache Maven core 项目地址: https://gitcode.com/GitHub_Trending/ma/maven 导读 工具链(Toolchain)是 Maven 让构建过程摆脱&qu…

阅读更多 →
terraform-provider-aws 中 aws_appconfig_application 数据源:按名称或 ID 查找 AppConfig 应用的完整指南 2026/9/17 20:58:55

terraform-provider-aws 中 aws_appconfig_application 数据源:按名称或 ID 查找 AppConfig 应用的完整指南

terraform-provider-aws 中 aws_appconfig_application 数据源:按名称或 ID 查找 AppConfig 应用的完整指南 【免费下载链接】terraform-provider-aws The AWS Provider enables Terraform to manage AWS resources. 项目地址: https://gitcode.com/GitHub_Trendi…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞