声页ShengYe04-05 · 技术概念

04-05 · 技术概念

VLA 是什么?

理解机器人如何把“看见什么、听懂什么、接下来怎么做”连接到统一模型中。

一句话总结

VLA(Vision-Language-Action)可以理解为:让机器人把视觉信息、语言任务和动作决策连接起来的一类模型,使机器人能够根据“看到的环境”和“听到的指令”判断下一步应该采取什么行动。

Plain language

用人话理解

还是用“拿杯子”来理解 VLA 场景:用户对机器人说:“把桌上的杯子拿给我。”VLA 要处理的不是让某个电机转多少度,而是把环境、指令和动作意图连接起来。

  1. 01

    看见桌子、杯子和用户

  2. 02

    听懂“拿杯子给我”

  3. 03

    判断目标是哪一个杯子

  4. 04

    理解任务最终目标

  5. 05

    决定靠近、伸手、抓取等下一步动作

  6. 06

    把动作意图交给后续运动控制与本体执行

VLA 更像是在“理解世界 + 理解任务 + 决定动作意图”。

System loop

VLA 放回完整机器人系统中,位于哪里?

  1. 环境
  2. 感知
  3. VLA / 大脑相关智能能力
  4. 动作意图 / 高层动作输出
  5. 小脑 / 运动规划 / 控制
  6. 本体执行
  7. 环境变化

Four modules

VLA 三个字母分别是什么

V · Vision

机器人看到了什么?

  • 物体
  • 位置
  • 场景
  • 状态变化

Vision 让模型从视觉信息中理解当前环境。

L · Language

用户想让我做什么?

  • 自然语言指令
  • 任务目标
  • 对象指代
  • 上下文

Language 帮助模型听懂任务,而不只匹配固定口令。

A · Action

接下来应该采取什么动作?

  • 动作决策
  • 动作表示
  • 高层动作输出
  • 动作序列

这里的 Action 更偏动作决策和动作输出,不直接等于电机底层控制。

Responsibility boundary

前四张现在怎么串起来

VLA 不是一个孤立概念,它处在已经建立的感知—决策—行动系统中。

04-01 · 完整闭环

建立系统坐标

示例:“感知—决策—行动持续循环

04-02 · 大脑

理解与决策

示例:“理解环境、任务与下一步该做什么

04-03 · 小脑

运动与控制

示例:“让身体稳定、协调地完成动作

04-04 · 本体

物理执行

示例:“把动作真正执行到物理世界

04-05 · VLA

连接视觉、语言与动作决策

示例:“从看见和听懂走向下一步动作意图

VLA 位于理解与动作决策这一侧,不应被理解为包办所有运动控制和物理执行。

Continuous feedback

为什么 VLA 重要

传统机器人常依赖大量人工规则和固定程序;VLA 希望提升机器人对开放环境、自然语言和新任务的适应能力。

传统方式:每换一个任务或场景,往往需要重新编写和调试规则

VLA 方向:理解环境与任务后生成动作意图,减少逐条规则配置

它推动机器人从“执行固定动作”向“理解任务后行动”发展,但并不意味着机器人已经能适应所有新场景。

VLA and robot brain

VLA 和机器人大脑是什么关系?

VLA 可以是机器人大脑的重要技术路线之一,但机器人大脑不完全等于 VLA。

完整的机器人大脑还可能需要处理长期记忆、长任务规划、状态管理、安全约束以及多种模型和系统之间的协同。

  • 世界模型
  • 记忆
  • 长任务规划
  • 状态管理
  • 安全约束
  • 多模型协同
  • 其他推理与决策模块

VLA ≠ 整个机器人系统,≠ 电机控制器,≠ 机器人本体,也不能替代所有底层运动控制能力。

Quick memory

VLA 快速记忆

01 · 看懂世界

Vision

02 · 听懂任务

Language

03 · 决定怎么行动

Action

VLA 连接“看见 + 理解 + 动作决策”,但稳定执行动作仍然需要小脑和本体。

Related concept · 04-world-model

世界模型和 VLA 有什么关系?

世界模型关注环境如何变化,以及动作可能带来什么结果,可以帮助机器人形成对现实世界的内部理解。

世界模型可能增强 VLA 的预测与规划能力,但两者不是同一个概念。

04-world-model 世界模型 · 即将补充

Related concept · 04-07

强化学习如何影响动作能力?

强化学习通过试错和反馈学习策略,经常用于训练机器人运动或任务执行能力。

强化学习是一类学习方法,不等于 VLA。

04-07 强化学习 · 即将补充

Related concept · 04-08

为什么需要 Sim2Real?

机器人可以先在仿真中训练,再把能力迁移到真实本体,以降低真实试错成本。

仿真与真实环境存在差异,迁移后的能力仍需验证和适配。

04-08 Sim2Real · 即将补充

Related concept · 04-robot-data

机器人数据为什么关键?

VLA 需要视觉、语言和动作之间相互对应的数据,真实高质量数据的采集成本很高。

数据规模重要,但数据质量、覆盖范围和本体匹配同样关键。

04-robot-data 机器人数据 · 即将补充

Related concept · 04-multimodal-model

多模态模型提供了什么基础?

多模态模型让视觉和语言信息能够在统一表示中被理解,为连接动作提供了重要基础。

能看图和听懂语言,不代表已经具备可靠的机器人动作能力。

04-multimodal-model 多模态模型 · 即将补充

Real-world difficulty

为什么 VLA 很难

  1. 01

    真实机器人数据昂贵

  2. 02

    视觉、语言、动作数据难统一

  3. 03

    动作错误会产生真实物理风险

  4. 04

    不同机器人本体的动作空间不同

  5. 05

    模型泛化能力和实时性仍然困难

VLA 不只要在模型里给出合理答案,还要在真实机器人的时间、身体和安全约束下产生可执行的动作意图。

Solution perspective

解决方案人员为什么要理解 VLA?

重点不是学习模型算法,而是判断客户问题发生在哪一层,以及 VLA 能提升什么、不能解决什么。

客户:“换个说法机器人就不会了。

语言理解 / 模型泛化

客户:“东西换个位置就抓不到。

视觉理解 / 泛化 / 感知

客户:“机器人知道要抓,但就是抓不稳。

小脑 / 控制 / 本体,不应首先归因 VLA

客户:“连续做十几步任务容易失败。

长任务规划 / 状态管理 / 模型能力

解决方案人员需要判断客户期望是否超出当前机器人能力边界,并区分模型听不懂、控制做不好和身体做不到。

Recommended learning

平台:哔哩哔哩

智驾的VLA与世界模型对比【陈老师科普】

推荐理由:用对比方式理解 VLA 与世界模型的差异和联系,适合在读完相关节点后进一步建立技术边界。

去 B 站学习 →

Related knowledge

关联知识

Personal notes

我的笔记

仅保存在当前页面,刷新后清空

记录你的判断:

  • • 哪个观点与你已有认知不同?
  • • 是否可以应用到工作?
  • • 是否值得进一步研究?

声页不是替你学习,而是辅助你形成自己的知识。

Feedback

这张知识卡对你有帮助吗?