声页ShengYe04-10 · 技术概念

04-10 · 技术概念

什么是多模态模型?

理解机器人如何融合图像、语言、声音等不同信息,并共同服务于任务判断与行动。

一句话总结

多模态模型可以理解为能够同时处理并关联多种类型信息的模型,例如图像、视频、语言、声音、深度和触觉;它的核心不是简单把不同数据放在一起,而是理解这些信息之间的对应关系。

Plain language

用人话理解

场景:机器人面前有三个杯子,用户说:“把我刚才用过的那个杯子拿给我。”只看图像,机器人知道桌上有三个杯子,却不一定知道用户指哪一个;只听语言,它又不知道目标杯子在哪里。

  1. 01

    视觉:桌上有什么、物体在哪里

  2. 02

    语言:用户说了什么任务

  3. 03

    上下文:刚才哪个杯子被使用过

  4. 04

    机器人状态:手现在在哪里

  5. 05

    把不同信息对应到同一个目标

  6. 06

    形成更完整的任务判断并决定下一步

多模态不是“信息更多”,而是让不同信息能够互相补充。

System loop

多种信息如何共同形成任务理解?

  1. 视觉 / 声音 / 语言
  2. 机器人状态与上下文
  3. 信息对齐
  4. 信息融合
  5. 任务理解
  6. 决策与行动

Four modules

什么叫“模态”?

A · 视觉

机器人看到了什么?

  • 图像
  • 视频
  • 深度
  • 点云

视觉提供物体、位置、场景和变化等信息。

B · 语言

用户表达了什么任务?

  • 文字
  • 语音指令
  • 对话
  • 上下文

语言提供任务目标、约束条件和对象指代。

C · 声音

环境和设备发出了什么声音?

  • 环境声音
  • 设备声音
  • 语音
  • 异常声响

声音可以补充视觉看不到的事件和设备状态。

D · 身体与触觉

机器人身体感受到了什么?

  • 力觉
  • 触觉
  • 机器人状态
  • 本体传感

身体和触觉信息告诉机器人是否接触物体、用了多大力以及自身状态。

Responsibility boundary

多模态模型主要解决什么问题?

“模态”可以简单理解为信息进入系统的不同形式,多模态能力负责让这些信息互相对应并共同服务任务。

01 · 信息对齐

让“这句话”对应到“这个物体”

示例:““拿红色杯子”与画面中的红色杯子对应

02 · 信息融合

把视觉、语言和状态一起考虑

示例:“同时参考目标位置、用户指令和机械臂状态

03 · 上下文理解

结合前后信息判断当前任务

示例:“理解“刚才用过的那个”指的是哪个杯子

04 · 跨模态推理

用一种信息补充另一种信息

示例:“语言给出筛选条件,视觉找到符合条件的对象

多模态的价值不是堆叠输入,而是让不同来源的信息正确对齐、互相补充。

Continuous feedback

为什么只看图像还不够?

机器人看到两个外观一样的箱子,但用户说“把刚刚送来的那个搬走”,单纯视觉无法判断“刚刚送来的”是哪一个;看到有人挥手时,也可能需要结合“停下来”的语音才能理解动作意图。

单一视觉:知道场景中有什么,却可能缺少任务语义和历史上下文

多种信息结合:利用语言、声音、状态和上下文确定真正目标

真实任务中的意义,往往来自多个信息源共同决定。

Why embodied AI is harder

多模态模型和 VLA 是什么关系?

多模态模型

  • 理解和融合多种信息
  • 回答看到了什么、听懂了什么
  • 建立不同信息之间的关系

VLA

  • 进一步连接视觉、语言与动作决策
  • 关注理解之后下一步应该做什么
  • 涉及动作输出和机器人任务

多模态模型 ≠ VLA。VLA 可以建立在多模态理解能力之上,但不是所有多模态模型最终都会变成 VLA。

Multimodal data and robot brain

多模态模型和机器人数据、“大脑”是什么关系?

多模态理解可以是机器人大脑的重要能力,但不等于整个机器人大脑。

多模态模型需要画面、语言指令、机器人状态、后续动作和最终结果之间正确对应。如果时间不同步或关系标错,模型可能学到错误联系。

  • 长期记忆
  • 任务规划
  • 状态管理
  • 世界模型
  • 安全约束
  • 推理与决策
  • 多模型协同

多模态数据最难的不只是“多”,而是“对得上”;完整机器人大脑还需要多模态理解之外的规划、记忆、安全和决策能力。

Quick memory

多模态模型快速记忆

01 · Vision

看见什么

02 · Language

听懂 / 读懂什么

03 · Other Modalities

声音、触觉、状态等补充信息

04 · Fusion

把不同信息连接起来理解任务

多模态的核心不是“输入更多”,而是让不同信息互相补充,形成更完整的理解。

Related concept · 04-vision

机器人视觉为什么值得单独理解?

视觉是机器人理解物体、位置、场景和变化的重要信息来源,也是多模态系统中最常见的基础输入之一。

视觉很重要,但真实任务通常不能只依赖视觉完成。

04-vision 机器人视觉 · 即将补充

Related concept · 04-tactile

触觉能补充什么信息?

触觉和力觉可以告诉机器人是否接触物体、抓取是否稳定,以及当前作用力是否合适。

触觉能补充视觉难以判断的接触状态,但也需要与动作和时间正确对齐。

04-tactile 触觉 · 即将补充

Related concept · 04-audio

声音感知在机器人中有什么作用?

语音可以承载任务指令,环境和设备声音也可能帮助识别事件、异常或运行状态。

声音容易受到现场噪声影响,需要与其他模态互相验证和补充。

04-audio 机器人声音感知 · 即将补充

Real-world difficulty

为什么机器人里的多模态更难

  1. 01

    数据不同步:摄像头、语音、关节和触觉频率不同

  2. 02

    信息可能冲突:视觉与语言可能表达不同内容

  3. 03

    真实环境噪声大:光照、声音、遮挡和传感误差

  4. 04

    模型还要服务动作:理解错误可能导致错误行为

  5. 05

    本体和场景差异:不同机器人能感知和执行的能力不同

难点不是把更多输入塞进模型,而是让这些信息在真实世界中稳定、同步、正确地支持行动。

Solution perspective

解决方案人员什么时候要想到“多模态问题”?

重点不是问客户用了几个模态,而是判断任务能否只靠一种信息完成,还是必须把看、听、感受和机器人状态结合起来。

客户:“机器人看得见设备,但听不懂现场人员临时说的指令。

语言理解 / 多模态融合

客户:“两个外观一样的物体,机器人经常拿错。

视觉 + 语言 / 上下文 / 对象指代

客户:“夹爪已经碰到物体了,但机器人还继续用力。

视觉不够 / 力觉 / 触觉 / 本体反馈

客户:“环境太吵以后语音控制经常失效。

声音噪声 / 多模态冗余 / 感知融合

解决方案人员要判断:这个任务到底能不能只靠一种信息完成,还是必须把“看、听、感受、状态”结合起来。

Related knowledge

关联知识

Personal notes

我的笔记

仅保存在当前页面,刷新后清空

记录你的判断:

  • • 哪个观点与你已有认知不同?
  • • 是否可以应用到工作?
  • • 是否值得进一步研究?

声页不是替你学习,而是辅助你形成自己的知识。

Feedback

这张知识卡对你有帮助吗?