04-10 · 技术概念
什么是多模态模型?
理解机器人如何融合图像、语言、声音等不同信息,并共同服务于任务判断与行动。
一句话总结
多模态模型可以理解为能够同时处理并关联多种类型信息的模型,例如图像、视频、语言、声音、深度和触觉;它的核心不是简单把不同数据放在一起,而是理解这些信息之间的对应关系。
Plain language
用人话理解
场景:机器人面前有三个杯子,用户说:“把我刚才用过的那个杯子拿给我。”只看图像,机器人知道桌上有三个杯子,却不一定知道用户指哪一个;只听语言,它又不知道目标杯子在哪里。
- 01
视觉:桌上有什么、物体在哪里
- 02
语言:用户说了什么任务
- 03
上下文:刚才哪个杯子被使用过
- 04
机器人状态:手现在在哪里
- 05
把不同信息对应到同一个目标
- 06
形成更完整的任务判断并决定下一步
多模态不是“信息更多”,而是让不同信息能够互相补充。
System loop
多种信息如何共同形成任务理解?
- 视觉 / 声音 / 语言
- 机器人状态与上下文
- 信息对齐
- 信息融合
- 任务理解
- 决策与行动
Four modules
什么叫“模态”?
A · 视觉
机器人看到了什么?
- 图像
- 视频
- 深度
- 点云
视觉提供物体、位置、场景和变化等信息。
B · 语言
用户表达了什么任务?
- 文字
- 语音指令
- 对话
- 上下文
语言提供任务目标、约束条件和对象指代。
C · 声音
环境和设备发出了什么声音?
- 环境声音
- 设备声音
- 语音
- 异常声响
声音可以补充视觉看不到的事件和设备状态。
D · 身体与触觉
机器人身体感受到了什么?
- 力觉
- 触觉
- 机器人状态
- 本体传感
身体和触觉信息告诉机器人是否接触物体、用了多大力以及自身状态。
Responsibility boundary
多模态模型主要解决什么问题?
“模态”可以简单理解为信息进入系统的不同形式,多模态能力负责让这些信息互相对应并共同服务任务。
01 · 信息对齐
让“这句话”对应到“这个物体”
示例:““拿红色杯子”与画面中的红色杯子对应”
02 · 信息融合
把视觉、语言和状态一起考虑
示例:“同时参考目标位置、用户指令和机械臂状态”
03 · 上下文理解
结合前后信息判断当前任务
示例:“理解“刚才用过的那个”指的是哪个杯子”
04 · 跨模态推理
用一种信息补充另一种信息
示例:“语言给出筛选条件,视觉找到符合条件的对象”
多模态的价值不是堆叠输入,而是让不同来源的信息正确对齐、互相补充。
Continuous feedback
为什么只看图像还不够?
机器人看到两个外观一样的箱子,但用户说“把刚刚送来的那个搬走”,单纯视觉无法判断“刚刚送来的”是哪一个;看到有人挥手时,也可能需要结合“停下来”的语音才能理解动作意图。
单一视觉:知道场景中有什么,却可能缺少任务语义和历史上下文
多种信息结合:利用语言、声音、状态和上下文确定真正目标
真实任务中的意义,往往来自多个信息源共同决定。
Why embodied AI is harder
多模态模型和 VLA 是什么关系?
多模态模型
- • 理解和融合多种信息
- • 回答看到了什么、听懂了什么
- • 建立不同信息之间的关系
VLA
- • 进一步连接视觉、语言与动作决策
- • 关注理解之后下一步应该做什么
- • 涉及动作输出和机器人任务
多模态模型 ≠ VLA。VLA 可以建立在多模态理解能力之上,但不是所有多模态模型最终都会变成 VLA。
Multimodal data and robot brain
多模态模型和机器人数据、“大脑”是什么关系?
多模态理解可以是机器人大脑的重要能力,但不等于整个机器人大脑。
多模态模型需要画面、语言指令、机器人状态、后续动作和最终结果之间正确对应。如果时间不同步或关系标错,模型可能学到错误联系。
- 长期记忆
- 任务规划
- 状态管理
- 世界模型
- 安全约束
- 推理与决策
- 多模型协同
多模态数据最难的不只是“多”,而是“对得上”;完整机器人大脑还需要多模态理解之外的规划、记忆、安全和决策能力。
Quick memory
多模态模型快速记忆
01 · Vision
看见什么
02 · Language
听懂 / 读懂什么
03 · Other Modalities
声音、触觉、状态等补充信息
04 · Fusion
把不同信息连接起来理解任务
多模态的核心不是“输入更多”,而是让不同信息互相补充,形成更完整的理解。
Related concept · 04-vision
机器人视觉为什么值得单独理解?
视觉是机器人理解物体、位置、场景和变化的重要信息来源,也是多模态系统中最常见的基础输入之一。
视觉很重要,但真实任务通常不能只依赖视觉完成。
→ 04-vision 机器人视觉 · 即将补充Related concept · 04-tactile
触觉能补充什么信息?
触觉和力觉可以告诉机器人是否接触物体、抓取是否稳定,以及当前作用力是否合适。
触觉能补充视觉难以判断的接触状态,但也需要与动作和时间正确对齐。
→ 04-tactile 触觉 · 即将补充Related concept · 04-audio
声音感知在机器人中有什么作用?
语音可以承载任务指令,环境和设备声音也可能帮助识别事件、异常或运行状态。
声音容易受到现场噪声影响,需要与其他模态互相验证和补充。
→ 04-audio 机器人声音感知 · 即将补充Real-world difficulty
为什么机器人里的多模态更难
- 01
数据不同步:摄像头、语音、关节和触觉频率不同
- 02
信息可能冲突:视觉与语言可能表达不同内容
- 03
真实环境噪声大:光照、声音、遮挡和传感误差
- 04
模型还要服务动作:理解错误可能导致错误行为
- 05
本体和场景差异:不同机器人能感知和执行的能力不同
难点不是把更多输入塞进模型,而是让这些信息在真实世界中稳定、同步、正确地支持行动。
Solution perspective
解决方案人员什么时候要想到“多模态问题”?
重点不是问客户用了几个模态,而是判断任务能否只靠一种信息完成,还是必须把看、听、感受和机器人状态结合起来。
客户:“机器人看得见设备,但听不懂现场人员临时说的指令。”
→ 语言理解 / 多模态融合
客户:“两个外观一样的物体,机器人经常拿错。”
→ 视觉 + 语言 / 上下文 / 对象指代
客户:“夹爪已经碰到物体了,但机器人还继续用力。”
→ 视觉不够 / 力觉 / 触觉 / 本体反馈
客户:“环境太吵以后语音控制经常失效。”
→ 声音噪声 / 多模态冗余 / 感知融合
解决方案人员要判断:这个任务到底能不能只靠一种信息完成,还是必须把“看、听、感受、状态”结合起来。
Related knowledge
关联知识
- 04-02什么是机器人的“大脑”?已完成 →
- 04-05VLA 是什么?已完成 →
- 04-09机器人数据为什么重要?已完成 →
- 04-06什么是世界模型?已完成 →
- 04-vision机器人视觉即将补充
- 04-tactile触觉即将补充
- 04-audio机器人声音感知即将补充
Personal notes
我的笔记
记录你的判断:
- • 哪个观点与你已有认知不同?
- • 是否可以应用到工作?
- • 是否值得进一步研究?
声页不是替你学习,而是辅助你形成自己的知识。
Feedback