04-05 · 技术概念
VLA 是什么?
理解机器人如何把“看见什么、听懂什么、接下来怎么做”连接到统一模型中。
一句话总结
VLA(Vision-Language-Action)可以理解为:让机器人把视觉信息、语言任务和动作决策连接起来的一类模型,使机器人能够根据“看到的环境”和“听到的指令”判断下一步应该采取什么行动。
Plain language
用人话理解
还是用“拿杯子”来理解 VLA 场景:用户对机器人说:“把桌上的杯子拿给我。”VLA 要处理的不是让某个电机转多少度,而是把环境、指令和动作意图连接起来。
- 01
看见桌子、杯子和用户
- 02
听懂“拿杯子给我”
- 03
判断目标是哪一个杯子
- 04
理解任务最终目标
- 05
决定靠近、伸手、抓取等下一步动作
- 06
把动作意图交给后续运动控制与本体执行
VLA 更像是在“理解世界 + 理解任务 + 决定动作意图”。
System loop
VLA 放回完整机器人系统中,位于哪里?
- 环境
- 感知
- VLA / 大脑相关智能能力
- 动作意图 / 高层动作输出
- 小脑 / 运动规划 / 控制
- 本体执行
- 环境变化
Four modules
VLA 三个字母分别是什么
V · Vision
机器人看到了什么?
- 物体
- 位置
- 场景
- 状态变化
Vision 让模型从视觉信息中理解当前环境。
L · Language
用户想让我做什么?
- 自然语言指令
- 任务目标
- 对象指代
- 上下文
Language 帮助模型听懂任务,而不只匹配固定口令。
A · Action
接下来应该采取什么动作?
- 动作决策
- 动作表示
- 高层动作输出
- 动作序列
这里的 Action 更偏动作决策和动作输出,不直接等于电机底层控制。
Responsibility boundary
前四张现在怎么串起来
VLA 不是一个孤立概念,它处在已经建立的感知—决策—行动系统中。
04-01 · 完整闭环
建立系统坐标
示例:“感知—决策—行动持续循环”
04-02 · 大脑
理解与决策
示例:“理解环境、任务与下一步该做什么”
04-03 · 小脑
运动与控制
示例:“让身体稳定、协调地完成动作”
04-04 · 本体
物理执行
示例:“把动作真正执行到物理世界”
04-05 · VLA
连接视觉、语言与动作决策
示例:“从看见和听懂走向下一步动作意图”
VLA 位于理解与动作决策这一侧,不应被理解为包办所有运动控制和物理执行。
Continuous feedback
为什么 VLA 重要
传统机器人常依赖大量人工规则和固定程序;VLA 希望提升机器人对开放环境、自然语言和新任务的适应能力。
传统方式:每换一个任务或场景,往往需要重新编写和调试规则
VLA 方向:理解环境与任务后生成动作意图,减少逐条规则配置
它推动机器人从“执行固定动作”向“理解任务后行动”发展,但并不意味着机器人已经能适应所有新场景。
VLA and robot brain
VLA 和机器人大脑是什么关系?
VLA 可以是机器人大脑的重要技术路线之一,但机器人大脑不完全等于 VLA。
完整的机器人大脑还可能需要处理长期记忆、长任务规划、状态管理、安全约束以及多种模型和系统之间的协同。
- 世界模型
- 记忆
- 长任务规划
- 状态管理
- 安全约束
- 多模型协同
- 其他推理与决策模块
VLA ≠ 整个机器人系统,≠ 电机控制器,≠ 机器人本体,也不能替代所有底层运动控制能力。
Quick memory
VLA 快速记忆
01 · 看懂世界
Vision
02 · 听懂任务
Language
03 · 决定怎么行动
Action
VLA 连接“看见 + 理解 + 动作决策”,但稳定执行动作仍然需要小脑和本体。
Related concept · 04-world-model
世界模型和 VLA 有什么关系?
世界模型关注环境如何变化,以及动作可能带来什么结果,可以帮助机器人形成对现实世界的内部理解。
世界模型可能增强 VLA 的预测与规划能力,但两者不是同一个概念。
→ 04-world-model 世界模型 · 即将补充Related concept · 04-07
强化学习如何影响动作能力?
强化学习通过试错和反馈学习策略,经常用于训练机器人运动或任务执行能力。
强化学习是一类学习方法,不等于 VLA。
→ 04-07 强化学习 · 即将补充Related concept · 04-08
为什么需要 Sim2Real?
机器人可以先在仿真中训练,再把能力迁移到真实本体,以降低真实试错成本。
仿真与真实环境存在差异,迁移后的能力仍需验证和适配。
→ 04-08 Sim2Real · 即将补充Related concept · 04-robot-data
机器人数据为什么关键?
VLA 需要视觉、语言和动作之间相互对应的数据,真实高质量数据的采集成本很高。
数据规模重要,但数据质量、覆盖范围和本体匹配同样关键。
→ 04-robot-data 机器人数据 · 即将补充Related concept · 04-multimodal-model
多模态模型提供了什么基础?
多模态模型让视觉和语言信息能够在统一表示中被理解,为连接动作提供了重要基础。
能看图和听懂语言,不代表已经具备可靠的机器人动作能力。
→ 04-multimodal-model 多模态模型 · 即将补充Real-world difficulty
为什么 VLA 很难
- 01
真实机器人数据昂贵
- 02
视觉、语言、动作数据难统一
- 03
动作错误会产生真实物理风险
- 04
不同机器人本体的动作空间不同
- 05
模型泛化能力和实时性仍然困难
VLA 不只要在模型里给出合理答案,还要在真实机器人的时间、身体和安全约束下产生可执行的动作意图。
Solution perspective
解决方案人员为什么要理解 VLA?
重点不是学习模型算法,而是判断客户问题发生在哪一层,以及 VLA 能提升什么、不能解决什么。
客户:“换个说法机器人就不会了。”
→ 语言理解 / 模型泛化
客户:“东西换个位置就抓不到。”
→ 视觉理解 / 泛化 / 感知
客户:“机器人知道要抓,但就是抓不稳。”
→ 小脑 / 控制 / 本体,不应首先归因 VLA
客户:“连续做十几步任务容易失败。”
→ 长任务规划 / 状态管理 / 模型能力
解决方案人员需要判断客户期望是否超出当前机器人能力边界,并区分模型听不懂、控制做不好和身体做不到。
Recommended learning
推荐学习资料
平台:哔哩哔哩
智驾的VLA与世界模型对比【陈老师科普】
推荐理由:用对比方式理解 VLA 与世界模型的差异和联系,适合在读完相关节点后进一步建立技术边界。
去 B 站学习 →Related knowledge
关联知识
- 04-01机器人怎么从“看见”到“行动”已完成 →
- 04-02什么是机器人的“大脑”?已完成 →
- 04-03什么是机器人的“小脑”?已完成 →
- 04-04什么是机器人本体?已完成 →
- 04-world-model世界模型即将补充
- 04-07强化学习即将补充
- 04-08Sim2Real即将补充
- 04-robot-data机器人数据即将补充
- 04-multimodal-model多模态模型即将补充
- 04-06下一阶段知识节点即将补充
Personal notes
我的笔记
记录你的判断:
- • 哪个观点与你已有认知不同?
- • 是否可以应用到工作?
- • 是否值得进一步研究?
声页不是替你学习,而是辅助你形成自己的知识。
Feedback