04-01 · 技术概念
机器人到底是怎么从“看见”到“行动”的?
先看懂一台机器人完整的“感知—决策—控制—执行”闭环。
一句话总结
机器人工作,本质上是在不断重复一个闭环:先感知环境,再理解和判断该做什么,然后控制身体执行动作,并根据新的环境状态继续调整。
Plain language
用人话理解
场景:一个人在陌生房间里拿杯子。
- 01
先看见杯子在哪
- 02
判断我要去拿它
- 03
控制身体伸手
- 04
抓住杯子
- 05
如果杯子移动或没抓稳,再继续调整
System loop
一台机器人的核心结构
- 环境
- 感知
- 理解 / 决策
- 运动控制
- 本体执行
- 环境发生变化
- 再次感知
Four modules
四个核心模块
A · 感知
机器人先要知道“周围发生了什么”
- Camera
- 深度 / LiDAR
- IMU
- 力觉 / 触觉
- 机器人必须先获得环境信息
感知就是机器人的眼睛、耳朵和皮肤。
B · 大脑
理解“我看到了什么,现在应该做什么”
- 环境理解
- 任务理解
- 推理
- 任务规划
大脑负责想明白:我现在到底应该做什么。
C · 小脑
知道动作之后,身体到底怎么动
- 运动规划
- 运动控制
- 平衡
- 轨迹
- 关节协调
小脑负责把大脑的任务变成稳定、可执行的身体动作。
D · 本体
真正让机器人动起来
- 电机
- 执行器
- 关节
- 灵巧手
- 机械结构
大脑决定做什么,小脑解决怎么动,本体负责真的动。
Continuous feedback
为什么必须形成闭环
机器人执行动作后环境会变化,因此必须重新感知并持续调整。
计算一次 → 执行结束
边看、边判断、边行动、边修正
机器人不是执行一次指令就结束,而是在真实世界里持续闭环。
Why embodied AI is harder
为什么具身智能更难
传统机器人
- • 固定环境
- • 固定程序
- • 重复任务
具身智能
- • 环境变化
- • 任务变化
- • 自然语言
- • 未知情况
- • 实时调整
具身智能真正难的是在不确定现实环境里持续完成“感知—理解—行动”的闭环。
Quick memory
大脑 / 小脑 / 本体快速记忆
大脑
做什么
小脑
怎么动
本体
真的动
Related concept · 04-05
那最近常说的 VLA,放在这张图里是哪一段?
在刚才这条“感知 → 理解 / 决策 → 行动”的链路里,VLA 主要尝试把“看见什么、理解任务、应该怎么行动”连接进一个统一模型体系。
它更靠近感知、理解与动作生成之间的桥梁,但不会取代底层运动控制、电机、关节和执行器。
→ 04-05 VLA · 即将补充Solution perspective
工作里怎么用?
解决方案人员不需要会写所有算法,但必须能够把客户问题放回系统架构中定位。
客户:“机器人经常认错目标”
→ 感知 / 识别层
客户:“知道要拿什么,但抓不稳”
→ 控制 / 触觉 / 灵巧手 / 执行器
客户:“换一个环境就不会干活”
→ 泛化 / 数据 / 感知 / 决策
解决方案岗位的重要能力,不是自己解决所有技术问题,而是判断问题在哪一层,并知道下一步应该协同谁解决。
Key takeaways
记住这 4 件事
- 01机器人是系统,不是单一技术
- 02核心是感知—决策—行动闭环
- 03大脑、小脑、本体承担不同角色
- 04做解决方案先学会定位问题发生在哪一层
Related knowledge
关联知识
- 04-02什么是机器人的“大脑”?已完成 →
- 04-03什么是机器人的小脑?即将补充
- 04-04什么是机器人本体?即将补充
- 04-05VLA 是什么?即将补充
- 02-perception感知系统即将补充
- 02-actuator执行器即将补充
- 02-dexterous-hand灵巧手即将补充
Personal notes
我的笔记
记录你的判断:
- • 哪个观点与你已有认知不同?
- • 是否可以应用到工作?
- • 是否值得进一步研究?
声页不是替你学习,而是辅助你形成自己的知识。
Feedback