声页ShengYe04-07 · 技术概念

04-07 · 技术概念

什么是强化学习?

理解机器人为什么能通过“尝试—反馈—调整”逐渐学会更好的动作策略。

一句话总结

强化学习(Reinforcement Learning)可以理解为:让智能体通过不断采取动作、观察结果、获得奖励或惩罚,再逐步调整策略的一类学习方法。

Plain language

用人话理解

机器人是怎么逐渐学会走路的? 场景:一个机器人刚开始学习走路。人工不会提前把每个关节、每一步以及每种失衡情况全部写成固定规则。

  1. 01

    向前迈一步

  2. 02

    观察身体是否晃动

  3. 03

    站稳并向前移动时获得较高奖励

  4. 04

    摔倒时获得较低奖励或惩罚

  5. 05

    根据结果调整下一次动作策略

  6. 06

    重复大量尝试,逐渐学会稳定行走

强化学习更像:“做 → 看结果 → 得反馈 → 调整 → 再做”。

System loop

强化学习如何通过试错形成策略?

  1. 观察当前状态
  2. 采取动作
  3. 环境产生结果
  4. 获得奖励或惩罚
  5. 调整策略
  6. 再次尝试

Four modules

强化学习最核心的几个概念

A · State

机器人现在处于什么情况?

  • 身体姿态
  • 关节角度
  • 速度
  • 脚是否接触地面

状态是机器人做决定时掌握的当前情况。

B · Action

机器人下一步可以做什么?

  • 调整关节
  • 迈腿
  • 改变力矩
  • 修正姿态

动作是机器人在当前状态下可以采取的选择。

C · Reward

什么结果是好的?

  • 向前走
  • 保持平衡
  • 少耗能
  • 不摔倒

奖励告诉机器人结果好不好,而不是直接给出每一步的正确答案。

D · Policy

遇到这种情况,应该采取什么动作?

  • 状态到动作的选择
  • 行为策略
  • 持续调整
  • 经验积累

强化学习的目标,就是逐渐学到一套更好的策略。

Continuous feedback

强化学习为什么适合一些机器人任务?

机器人自由度高、环境变化复杂,平衡、行走和抓取等动作又存在连续反馈,很多“好动作”很难全部写成明确规则。

完全人工写规则:难以覆盖每种姿态、扰动和环境变化

强化学习:通过大量交互自动寻找表现更好的行为策略

强化学习不是所有机器人任务都必须使用,也不是“用了强化学习就一定更智能”。

Why embodied AI is harder

强化学习和世界模型是什么关系?

强化学习

  • 通过反馈学习怎样行动更好
  • 可以直接通过真实或仿真交互学习策略
  • 关注奖励与策略改进

世界模型

  • 预测采取动作后环境可能发生什么
  • 可以在内部预演部分动作结果
  • 关注状态变化与后果预测

两者可以结合,提高规划或学习效率,但强化学习并不必须依赖世界模型,它们也不是从属关系。

Reinforcement learning and cerebellum

强化学习和机器人的“小脑”是什么关系?

强化学习可以训练某些“小脑”相关运动策略,但强化学习不等于小脑。

在我们的通俗认知框架里,强化学习经常用于行走、跑步、平衡、起身、抗扰动,以及某些抓取和运动控制任务。

  • 行走
  • 跑步
  • 平衡
  • 起身
  • 抗扰动
  • 抓取
  • 运动控制

“小脑”是理解运动规划、稳定控制和关节协调等能力的系统级比喻;强化学习只是一类训练和学习方法。大脑 / 小脑 / 本体是方便跨行学习的认知框架,不是行业统一架构定义。

Quick memory

强化学习快速记忆

01 · 状态

我现在是什么情况?

02 · 动作

我接下来做什么?

03 · 奖励

这个结果好不好?

04 · 策略

以后遇到类似情况应该怎么做?

强化学习就是通过不断“行动—反馈—调整”,逐渐学会更好的行为策略。

Related concept · 04-08

为什么强化学习经常在仿真里训练?

真实机器人反复摔倒的成本高,训练次数又往往非常大。仿真可以并行运行大量训练环境,也可以人为加入扰动,让策略练习更多情况。

仿真让机器人“便宜地犯错”,真实世界再验证能力是否真的可用。

04-08 Sim2Real · 即将补充

Related concept · 04-policy-learning

强化学习与监督学习有什么直观区别?

监督学习通常从带有正确答案的样本中学习;强化学习则通过行动后得到的奖励或惩罚,逐步改善行为策略。

两种方法解决的问题和反馈形式不同,也可以在同一机器人系统中共同使用。

04-policy-learning 策略学习 · 即将补充

Related concept · 04-09

机器人数据为什么同样重要?

无论在仿真还是真实环境,策略都需要大量交互结果来判断哪些动作更好。

数据覆盖范围会影响策略面对新环境和新扰动时的泛化能力。

04-09 机器人数据 · 即将补充

Real-world difficulty

为什么强化学习很难

  1. 01

    奖励函数难设计:设计不好时,机器人可能学会“钻空子”

  2. 02

    训练数据量大:可能需要大量交互和尝试

  3. 03

    仿真与真实世界存在差距

  4. 04

    稳定性与安全性:真实机器人不能无限制试错

  5. 05

    泛化能力有限:换环境、速度或本体后策略可能失效

策略在训练环境里表现好,不代表它已经能安全、稳定地应对所有真实场景。

Solution perspective

解决方案人员什么时候要想到强化学习?

重点不是判断客户有没有使用强化学习,而是判断问题是否涉及运动策略、平衡、连续控制、抗扰动、环境适应或策略泛化。

客户:“机器人在平地走得很好,换成斜坡就容易摔。

运动策略 / 泛化 / 强化学习 / Sim2Real

客户:“轻推一下机器人就站不稳。

平衡控制 / 抗扰动策略

客户:“不同速度切换时步态很僵。

运动策略 / 控制策略

客户:“机器人明明知道要去哪里,但就是走不好。

更可能是小脑 / 控制 / 策略层,不应首先归因大脑或 VLA

解决方案人员要区分:“机器人不知道做什么”和“机器人知道要做什么,但身体不会稳定地做”。

Related knowledge

关联知识

Personal notes

我的笔记

仅保存在当前页面,刷新后清空

记录你的判断:

  • • 哪个观点与你已有认知不同?
  • • 是否可以应用到工作?
  • • 是否值得进一步研究?

声页不是替你学习,而是辅助你形成自己的知识。

Feedback

这张知识卡对你有帮助吗?