声页ShengYe04-01 · 技术概念

04-01 · 技术概念

机器人到底是怎么从“看见”到“行动”的?

先看懂一台机器人完整的“感知—决策—控制—执行”闭环。

一句话总结

机器人工作,本质上是在不断重复一个闭环:先感知环境,再理解和判断该做什么,然后控制身体执行动作,并根据新的环境状态继续调整。

Plain language

用人话理解

场景:一个人在陌生房间里拿杯子。

  1. 01

    先看见杯子在哪

  2. 02

    判断我要去拿它

  3. 03

    控制身体伸手

  4. 04

    抓住杯子

  5. 05

    如果杯子移动或没抓稳,再继续调整

System loop

一台机器人的核心结构

  1. 环境
  2. 感知
  3. 理解 / 决策
  4. 运动控制
  5. 本体执行
  6. 环境发生变化
  7. 再次感知

Four modules

四个核心模块

A · 感知

机器人先要知道“周围发生了什么”

  • Camera
  • 深度 / LiDAR
  • IMU
  • 力觉 / 触觉
  • 机器人必须先获得环境信息

感知就是机器人的眼睛、耳朵和皮肤。

B · 大脑

理解“我看到了什么,现在应该做什么”

  • 环境理解
  • 任务理解
  • 推理
  • 任务规划

大脑负责想明白:我现在到底应该做什么。

C · 小脑

知道动作之后,身体到底怎么动

  • 运动规划
  • 运动控制
  • 平衡
  • 轨迹
  • 关节协调

小脑负责把大脑的任务变成稳定、可执行的身体动作。

D · 本体

真正让机器人动起来

  • 电机
  • 执行器
  • 关节
  • 灵巧手
  • 机械结构

大脑决定做什么,小脑解决怎么动,本体负责真的动。

Continuous feedback

为什么必须形成闭环

机器人执行动作后环境会变化,因此必须重新感知并持续调整。

计算一次 → 执行结束

边看、边判断、边行动、边修正

机器人不是执行一次指令就结束,而是在真实世界里持续闭环。

Why embodied AI is harder

为什么具身智能更难

传统机器人

  • 固定环境
  • 固定程序
  • 重复任务

具身智能

  • 环境变化
  • 任务变化
  • 自然语言
  • 未知情况
  • 实时调整

具身智能真正难的是在不确定现实环境里持续完成“感知—理解—行动”的闭环。

Quick memory

大脑 / 小脑 / 本体快速记忆

大脑

做什么

小脑

怎么动

本体

真的动

Related concept · 04-05

那最近常说的 VLA,放在这张图里是哪一段?

在刚才这条“感知 → 理解 / 决策 → 行动”的链路里,VLA 主要尝试把“看见什么、理解任务、应该怎么行动”连接进一个统一模型体系。

它更靠近感知、理解与动作生成之间的桥梁,但不会取代底层运动控制、电机、关节和执行器。

04-05 VLA · 即将补充

Solution perspective

工作里怎么用?

解决方案人员不需要会写所有算法,但必须能够把客户问题放回系统架构中定位。

客户:“机器人经常认错目标

感知 / 识别层

客户:“知道要拿什么,但抓不稳

控制 / 触觉 / 灵巧手 / 执行器

客户:“换一个环境就不会干活

泛化 / 数据 / 感知 / 决策

解决方案岗位的重要能力,不是自己解决所有技术问题,而是判断问题在哪一层,并知道下一步应该协同谁解决。

Key takeaways

记住这 4 件事

  1. 01机器人是系统,不是单一技术
  2. 02核心是感知—决策—行动闭环
  3. 03大脑、小脑、本体承担不同角色
  4. 04做解决方案先学会定位问题发生在哪一层

Related knowledge

关联知识

  • 04-02什么是机器人的“大脑”?已完成 →
  • 04-03什么是机器人的小脑?即将补充
  • 04-04什么是机器人本体?即将补充
  • 04-05VLA 是什么?即将补充
  • 02-perception感知系统即将补充
  • 02-actuator执行器即将补充
  • 02-dexterous-hand灵巧手即将补充

Personal notes

我的笔记

仅保存在当前页面,刷新后清空

记录你的判断:

  • • 哪个观点与你已有认知不同?
  • • 是否可以应用到工作?
  • • 是否值得进一步研究?

声页不是替你学习,而是辅助你形成自己的知识。

Feedback

这张知识卡对你有帮助吗?