04-07 · 技术概念
什么是强化学习?
理解机器人为什么能通过“尝试—反馈—调整”逐渐学会更好的动作策略。
一句话总结
强化学习(Reinforcement Learning)可以理解为:让智能体通过不断采取动作、观察结果、获得奖励或惩罚,再逐步调整策略的一类学习方法。
Plain language
用人话理解
机器人是怎么逐渐学会走路的? 场景:一个机器人刚开始学习走路。人工不会提前把每个关节、每一步以及每种失衡情况全部写成固定规则。
- 01
向前迈一步
- 02
观察身体是否晃动
- 03
站稳并向前移动时获得较高奖励
- 04
摔倒时获得较低奖励或惩罚
- 05
根据结果调整下一次动作策略
- 06
重复大量尝试,逐渐学会稳定行走
强化学习更像:“做 → 看结果 → 得反馈 → 调整 → 再做”。
System loop
强化学习如何通过试错形成策略?
- 观察当前状态
- 采取动作
- 环境产生结果
- 获得奖励或惩罚
- 调整策略
- 再次尝试
Four modules
强化学习最核心的几个概念
A · State
机器人现在处于什么情况?
- 身体姿态
- 关节角度
- 速度
- 脚是否接触地面
状态是机器人做决定时掌握的当前情况。
B · Action
机器人下一步可以做什么?
- 调整关节
- 迈腿
- 改变力矩
- 修正姿态
动作是机器人在当前状态下可以采取的选择。
C · Reward
什么结果是好的?
- 向前走
- 保持平衡
- 少耗能
- 不摔倒
奖励告诉机器人结果好不好,而不是直接给出每一步的正确答案。
D · Policy
遇到这种情况,应该采取什么动作?
- 状态到动作的选择
- 行为策略
- 持续调整
- 经验积累
强化学习的目标,就是逐渐学到一套更好的策略。
Continuous feedback
强化学习为什么适合一些机器人任务?
机器人自由度高、环境变化复杂,平衡、行走和抓取等动作又存在连续反馈,很多“好动作”很难全部写成明确规则。
完全人工写规则:难以覆盖每种姿态、扰动和环境变化
强化学习:通过大量交互自动寻找表现更好的行为策略
强化学习不是所有机器人任务都必须使用,也不是“用了强化学习就一定更智能”。
Why embodied AI is harder
强化学习和世界模型是什么关系?
强化学习
- • 通过反馈学习怎样行动更好
- • 可以直接通过真实或仿真交互学习策略
- • 关注奖励与策略改进
世界模型
- • 预测采取动作后环境可能发生什么
- • 可以在内部预演部分动作结果
- • 关注状态变化与后果预测
两者可以结合,提高规划或学习效率,但强化学习并不必须依赖世界模型,它们也不是从属关系。
Reinforcement learning and cerebellum
强化学习和机器人的“小脑”是什么关系?
强化学习可以训练某些“小脑”相关运动策略,但强化学习不等于小脑。
在我们的通俗认知框架里,强化学习经常用于行走、跑步、平衡、起身、抗扰动,以及某些抓取和运动控制任务。
- 行走
- 跑步
- 平衡
- 起身
- 抗扰动
- 抓取
- 运动控制
“小脑”是理解运动规划、稳定控制和关节协调等能力的系统级比喻;强化学习只是一类训练和学习方法。大脑 / 小脑 / 本体是方便跨行学习的认知框架,不是行业统一架构定义。
Quick memory
强化学习快速记忆
01 · 状态
我现在是什么情况?
02 · 动作
我接下来做什么?
03 · 奖励
这个结果好不好?
04 · 策略
以后遇到类似情况应该怎么做?
强化学习就是通过不断“行动—反馈—调整”,逐渐学会更好的行为策略。
Related concept · 04-08
为什么强化学习经常在仿真里训练?
真实机器人反复摔倒的成本高,训练次数又往往非常大。仿真可以并行运行大量训练环境,也可以人为加入扰动,让策略练习更多情况。
仿真让机器人“便宜地犯错”,真实世界再验证能力是否真的可用。
→ 04-08 Sim2Real · 即将补充Related concept · 04-policy-learning
强化学习与监督学习有什么直观区别?
监督学习通常从带有正确答案的样本中学习;强化学习则通过行动后得到的奖励或惩罚,逐步改善行为策略。
两种方法解决的问题和反馈形式不同,也可以在同一机器人系统中共同使用。
→ 04-policy-learning 策略学习 · 即将补充Related concept · 04-09
机器人数据为什么同样重要?
无论在仿真还是真实环境,策略都需要大量交互结果来判断哪些动作更好。
数据覆盖范围会影响策略面对新环境和新扰动时的泛化能力。
→ 04-09 机器人数据 · 即将补充Real-world difficulty
为什么强化学习很难
- 01
奖励函数难设计:设计不好时,机器人可能学会“钻空子”
- 02
训练数据量大:可能需要大量交互和尝试
- 03
仿真与真实世界存在差距
- 04
稳定性与安全性:真实机器人不能无限制试错
- 05
泛化能力有限:换环境、速度或本体后策略可能失效
策略在训练环境里表现好,不代表它已经能安全、稳定地应对所有真实场景。
Solution perspective
解决方案人员什么时候要想到强化学习?
重点不是判断客户有没有使用强化学习,而是判断问题是否涉及运动策略、平衡、连续控制、抗扰动、环境适应或策略泛化。
客户:“机器人在平地走得很好,换成斜坡就容易摔。”
→ 运动策略 / 泛化 / 强化学习 / Sim2Real
客户:“轻推一下机器人就站不稳。”
→ 平衡控制 / 抗扰动策略
客户:“不同速度切换时步态很僵。”
→ 运动策略 / 控制策略
客户:“机器人明明知道要去哪里,但就是走不好。”
→ 更可能是小脑 / 控制 / 策略层,不应首先归因大脑或 VLA
解决方案人员要区分:“机器人不知道做什么”和“机器人知道要做什么,但身体不会稳定地做”。
Related knowledge
关联知识
- 04-03什么是机器人的“小脑”?已完成 →
- 04-06什么是世界模型?已完成 →
- 04-05VLA 是什么?已完成 →
- 04-08什么是 Sim2Real?即将补充
- 04-09机器人数据即将补充
- 04-simulation机器人仿真即将补充
- 04-motion-control运动控制即将补充
- 04-policy-learning策略学习即将补充
Personal notes
我的笔记
记录你的判断:
- • 哪个观点与你已有认知不同?
- • 是否可以应用到工作?
- • 是否值得进一步研究?
声页不是替你学习,而是辅助你形成自己的知识。
Feedback