具身智能 VLA 模型崛起:从 RT-2 到 1.5B 小模型,机器人开始"看图动手"

摘要:2023 年 7 月,Google DeepMind 发布 RT-2,首次让"视觉—语言—动作"统一表征的机器人模型走入产业视野;2024 至 2026 年,从 OpenVLA、Helix 到国产的极佳视界 GigaBrain-0.5M* 与面壁智能 MiniCPM-Robot,VLA 模型正以"小参数、低延迟、可在端侧跑"的姿态,把具身智能从演示视频拉进工业产线和家庭场景。本文基于 Bing 检索到的最新行业报道,梳理 VLA 模型的技术演进、代表玩家和落地拐点。

一、什么是 VLA?为什么是"具身智能的新范式"

VLA 全称 Vision-Language-Action,中文译作"视觉—语言—动作模型",它把大语言模型的推理能力、视觉模型的感知能力与机器人的控制能力合并到同一个端到端网络中。机器人不再需要把"看见的画面"和"接下来要做的动作"分成两个模型处理,而是直接接收摄像头画面与自然语言指令,输出一组连续动作。

这个范式的关键创新,是把机器人动作"文本化"。根据 36 氪对 VLA 算法的系统性梳理,RT-2 的最大贡献,是让机械臂的关节角度、末端执行器指令可以像自然语言 token 一样被统一编码、联合微调。这意味着一个原本只懂"图像+文字"的大模型,可以直接读懂"把桌上的红色方块放进蓝色盒子里"这种指令,并在没有为这个任务专门训练的情况下完成它——这就是常说的"涌现能力"。

2024 年 3 月,丰田、谷歌、斯坦福、UC 伯克利联合发布 OpenVLA,首次把一个 70 亿参数的 VLA 模型完整开源。它基于 Llama 2 文本骨干,融合 DINOv2 与 SigLIP 的视觉特征,在 97 万条真实机器人演示数据上完成训练。官方公布的实验数据显示,OpenVLA 在 29 项任务中的绝对任务成功率比 RT-2-X(550 亿参数)高 16.5%,参数量却少了 7 倍,首次让"小而强"的 VLA 路线成为可能。

二、从 6 自由度到 35 自由度:人形机器人的 VLA 拐点

早期的 VLA 模型以桌面机械臂为载体,自由度通常不超过 7。2025 年 2 月 20 日,Figure.AI 发布 Helix 模型,把 VLA 推到了人形机器人的维度。Helix 的快慢双系统架构,让 Figure 02 机器人可以以 200Hz 的频率生成 24 自由度动作,整体自由度达到 35,远超 RT-2 的 6 自由度水平。

Helix 的另一个突破是"单模型、多任务"。传统 VLA 系统要为不同任务(抓取、推拉、折叠)分别微调,Helix 则通过统一的自然语言接口,让一个模型完成所有这些动作。在训练数据上,Figure 只用了约 500 小时的高质量远程操作监督数据,而一般 VLA 预训练动辄需要上万小时,这意味着"用更少的数据训练出更强的多任务模型"是可行的。

Figure.AI 在机器人行业的地位,常被类比为 OpenAI 在 LLM 行业的位置——它不一定是发论文最多的团队,但往往代表最接近量产的工程方案。Helix 发布后不久,行业开始用"快慢双系统"作为人形机器人 VLA 的标准范式:慢系统负责语义理解与任务规划,快系统负责毫秒级动作执行。

三、国产 VLA 的两条路线:世界模型驱动 vs 端侧小模型

2026 年开年,国产 VLA 出现了两个明显的技术分支。

第一条是"世界模型驱动"。2026 年 2 月,极佳视界发布 GigaBrain-0.5M*,它的核心创新在于把世界模型作为条件信号,引导 VLA 在动作执行前"先想象未来"。在 RoboChallenge 全球第一的基础上,GigaBrain-0.5M* 用 GigaWorld 世界模型合成了 6653 小时训练数据(占总量 61%),加上 4278 小时真实数据,形成 10931 小时的多样化机器人操作数据集。

在与 π*0.6 提出的 RECAP 基线方法对比中,GigaBrain-0.5M* 在折纸盒、咖啡制备、衣物折叠等长时程任务上,任务成功率提升近 30%,并能实现数小时连续零失误执行。尤其在叠衣服任务中,世界模型预测的价值曲线与任务物理进程高度对齐:衣物摆正时价值上升,出现干扰物时价值骤降,干扰移除后价值恢复——这正是"认知先验"对价值函数的支撑作用。

第二条是"端侧小模型"。2025 年世界人工智能大会(WAIC)期间,面壁智能发布并开源 MiniCPM-Robot 系列。MiniCPM-RobotManip 仅 1.5B 参数,在 LIBERO、Calvin、RoboTwin2 等主流 VLA 评测中进入第一梯队,与 π0.5 处在相近水平。

真正让 MiniCPM-Robot 拉开差距的是"记忆力"。多数 VLA 模型在执行动作时,主要根据当前一帧画面做判断,叠衣服做到一半就忘了自己已经叠过几件。MiniCPM-RobotManip 把历史观测和此前执行过的动作一并纳入判断,在 RMBench 中拿到 53 分,而 π0.5 仅有约 10 分(接近随机)。在 H100 显卡 bf16 精度下,单次决策延迟约 120 毫秒,接近 π0.5 的一半。

MiniCPM-RobotTrack 则把视觉、语言、机器人控制决策放进同一个 0.9B 模型,做到"看见人、跟着走",即便在电梯、地下停车场这种弱网甚至无网环境,机器狗也能持续识别目标、规划动作,端到端响应延迟约 180 毫秒。配合宇树 Go2 原装摄像头与本地算力,这套模型可以在 Go2 Edu 上跑起来,不需要外接开发板。

四、为什么"小参数"反而成了优势?

过去两年,LLM 行业的竞争是"谁更大",但机器人行业的逻辑完全不同。面壁智能多模态首席科学家姚远在接受访谈时表示,机器人要看、要听、要动作,每一帧都要在毫秒级完成推理,模型太大反而会拖慢执行。

面壁内部把 200 毫秒视为机械臂操作体验的一道临界线——再慢下去,机械臂和机器狗的卡顿感就会明显增加。当前主流 VLA 基础模型基本都控制在 4B 以内,行业正在用"单位算力能换来多少真实能力"作为新的评价标准。

更重要的是,机器人的实际部署需要端侧推理。展厅导览、园区巡检、家庭陪伴,这些场景的网络信号不会一直满格。面壁与乐聚机器人合作推出的展厅导览 Agent,在无网环境下也能基于本地知识库完成离线讲解;园区巡检机器人可以识别车辆违停、路面异常,敏感画面直接在本地处理,数据不出客户侧。

1.5B 和 0.9B 的意义,不止是"小"。它回答的是:当 AI 真正长出手脚,除了聪明,还得跑得动、用得起,最后把活干完。

五、PhyAI:从模型到真机的"最后一公里"

模型训好之后,装到真机上还有一道关。摄像头采集、画面编码、模型推理、动作生成、指令传输,任何一个环节慢下来,最终都会反映在机械臂的卡顿上。

面壁与明体科技、北京邮电大学、北京大学联合发布的 PhyAI 推理框架,目标就是把这道关打通。在 RTX 5090 上,PhyAI 对 π0、π0.5、GR00T 分别实现约 2.85 倍、1.82 倍、2.28 倍加速。适配 MiniCPM-Robot 时,PhyAI 通过 CUDA Graph 把推理帧率从 10.12Hz 提高到 33.28Hz,再通过定制融合算子在 NVIDIA H20 上推到 36.77Hz。

模型能干活,还得尽快跑上硬件,跑得足够快,才能真正进入更多机器人。这是 VLA 工程化落地的关键环节,也是 2026 年具身智能从"演示视频"走向"量产部署"的分水岭。

六、国标首测:VLA 开始接受"标准化考场"

2025 年 11 月 7 日,中国电子技术标准化研究院基于编制中的国家标准《人工智能具身智能大模型系统技术要求》正式发布"求索"具身智能测评基准 EIBench,并邀请了多家国内顶尖团队参与首次测评。北京人形机器人创新中心的 XR-1 模型成为唯一一个通过测试的 VLA 模型,获得 CESI-CTC-20251103 具身智能测试证书。

EIBench 的"三个一"准则值得关注:一条标准化流程,确保可复现的公平评测;一个综合任务库,覆盖多维度复杂场景;一套测试指标,量化模型综合性能。在安全方面,基准建立了包括可控性、鲁棒性、可问责性、隐私保护、功能安全、韧性等 14 项一级指标。

XR-1 在天工 2.0、UR、Franka 三款机器人上,针对取放、推拉、旋转、插入等双臂技能完成基础测试,以及物体颜色、位置、姿态、环境亮度、色温、背景、干扰物等七大维度泛化测试,均通过。每项测试定量采集 40-50 条少量数据,在每个任务每项测试维度进行 10 次以上的真机测试,全程由研究院专家参与。

这意味着 VLA 行业从"各自发 Demo"进入"统一标准评测"阶段。未来谁能在 EIBench 这样的国标体系下持续拿到高分,谁就更有可能进入工业采购清单。

七、量产拐点:从汽车工厂到半导体车间

VLA 真正走出实验室,是从 2025 年底到 2026 年初这波"工业落地潮"开始的。

2026 年 4 月,智平方与东风柳汽达成战略合作,搭载全球首个全域全身 VLA 大模型 GOVLA 的 AlphaBot 2 进驻工厂,在上下料、拖拽料车、贴标、收纳保护布等多环节执行智能化作业,覆盖质量检测、装配、物流转运等关键流程。这是国产具身大模型首次获得汽车制造全场景验证。

半导体场景同样在加速。智平方与吉利科技旗下晶能微电子合作,AlphaBot 已进入杭州基地;与全球第三大面板厂商惠科签订 3 年 1000 台订单,覆盖仓储物流、上下料、零部件装配到质检测试全流程,订单金额近 5 亿元,被摩根士丹利认定为"全球生产力型机器人最大的单一订单"。

生物制造场景对 VLA 的需求更加直接。无菌车间对人员进出有严格限制,物料转运、拆包、视觉检验等环节人力成本极高,生物制品对操作一致性要求严苛。智平方与全球生物科技龙头华熙生物的合作,把 AlphaBot 推进了无菌车间,VLA 的零样本学习能力使机器人能快速适配不同物料的拆包方式和检验标准,无需为每种新物料重新编程。

在公共服务端,2025 年底智平方推出"智魔方"模块化具身智能服务空间,机器人日均工作超 10 小时,商品覆盖咖啡、冰淇淋、冰糖葫芦、抹茶等。截至 2026 年 4 月,已覆盖江苏、上海、浙江、福建、广东、广西、贵州等 7 省,三年计划落地 1000 个智魔方。

八、行业格局:从"参数竞赛"转向"飞轮效率"

VLA 行业的竞争已经不再单纯比模型规模,而是看谁能更快跑通"模型 × 硬件 × 场景"的飞轮。智平方能走到今天,关键在于自有产线年产千台、每月稳定出货超百台,真实场景的运行数据反哺模型迭代,模型的提升又推动硬件进入更多场景。

相比之下,银河通用、自变量、星海图、千寻智能等玩家也都在加速布局:银河通用主攻智慧零售和康养医疗,自变量聚焦工业自动化与家庭服务,星海图提供全栈解决方案,千寻智能从工业制造逐步扩展到商业服务和家庭场景。具身智能行业从来不缺精彩 Demo,真正难的是离开展台之后,机器人还能不能稳定工作。

从 RT-2 的 6 自由度、RT-2-X 的 550 亿参数,到 Helix 的 35 自由度、OpenVLA 的 7B 开源、MiniCPM-Robot 的 1.5B 端侧、再到 GigaBrain-0.5M* 的世界模型驱动,VLA 用三年时间走出了一条从"实验室奇观"到"产线生产力"的清晰路径。下一阶段,行业的关键问题不再是"VLA 能不能用",而是"谁能用更少的数据、更小的模型、更低的延迟,把活干完"。

当机器人开始"看图动手",具身智能的真正奇点,可能不在某一个超大模型的发布日,而在 1000 个智魔方、1000 台 AlphaBot 共同在真实场景中稳定运行的那个清晨。