强化学习是什么-从游戏AI到Agent决策
> **本文适合谁**:对"强化学习"这个词好奇,但不知道它和ChatGPT、和Agent有什么关系的读者。读完这篇,你会明白:强化学习是如何从游戏AI一路演变到ChatGPT背后的训练技术,以及它为什么和你将要写的Agent系统有直接的逻辑联系。
强化学习是什么:从游戏AI到Agent决策
本文适合谁:对"强化学习"这个词好奇,但不知道它和ChatGPT、和Agent有什么关系的读者。读完这篇,你会明白:强化学习是如何从游戏AI一路演变到ChatGPT背后的训练技术,以及它为什么和你将要写的Agent系统有直接的逻辑联系。
本文阅读时间:约12分钟
后续应用:理解本文后,第6章"LLM基础"会讲RLHF如何训练出ChatGPT,第12章"LLM Agent"会展示感知-行动循环如何延伸到LLM Agent的设计。
强化学习和我们写的Agent有什么关系?
这是很多人读完强化学习介绍后仍然困惑的问题。本文从最基本的思想讲起,经过AlphaGo的案例,到ChatGPT背后的训练机制,最终回答这个问题:强化学习的感知-行动循环,就是LLM Agent架构的思想来源。
强化学习的核心思想:用奖惩代替例题
上一篇讲的机器学习,核心是"给机器大量带标签的例题让它学"。这在很多场景下都很好用,但有一类问题,它完全搞不定:
当你没有"标准答案",只知道最终结果的好坏时,怎么学习?
下围棋时,你没办法在每一步棋后就告诉AI"这步棋的正确走法是什么"——围棋棋局有10的170次方种可能,穷举是不可能的。你能告诉它的只是:这局棋最终赢了还是输了。
训练一个聊天机器人时,你没办法给每一个回答都写出"完美版本"——这成本太高了。你能做的是让人类评估员说"这个回答比那个好"。
强化学习(Reinforcement Learning,RL)就是为了解决这类问题而生的。
按照AWS的定义:强化学习是一种ML技术,可训练软件做出决策以获得最佳结果。 核心机制就是:智能体在环境中行动,做对了获得奖励,做错了获得惩罚,通过不断试错,逐渐学会最优策略。
训狗类比:
这个过程最像训狗。你不需要向狗解释"坐下"的语言含义——你只需要在狗坐下时给它零食(奖励),在它乱跑时不理它(没有奖励或给予惩罚)。重复几十次,狗学会了"听到坐下指令就坐下"这个行为。它不懂语言,但它懂奖惩。
强化学习完全是这个逻辑。
四个核心概念
理解强化学习,你只需要记住四个词:
| 概念 | 含义 | 训狗类比 | LLM Agent类比 |
|---|---|---|---|
| 智能体(Agent) | 做决策的主体 | 狗 | LLM + 工具调用逻辑 |
| 环境(Environment) | 智能体所处的世界 | 训练场 | 用户、工具、外部系统 |
| 状态(State) | 当前情况的描述 | 当前姿势、周围情况 | 当前对话历史 + 上下文 |
| 奖励(Reward) | 行动之后得到的反馈 | 零食或惩罚 | 任务完成度/用户满意度 |
还有一个重要概念:策略(Policy)。策略是智能体的"决策规则"——在看到当前状态后,决定采取什么行动的方法。可以理解为一套内化的经验法则。训练越好的智能体,策略越优。
感知-行动循环:强化学习的工作方式
强化学习的工作方式是一个不断循环的过程:
强化学习的感知-行动循环——五个步骤不断重复,策略在循环中逐渐优化
记住这个循环:感知 → 决策 → 行动 → 反馈 → 更新 → 感知……
这个循环有一个根本性的挑战:大多数行动不能立即得到明确的奖励。
下围棋的时候,你不知道第37步棋是好是坏——要等到整局结束才知道赢还是输。这叫奖励稀疏问题——大多数时间没有明确反馈,只有偶尔才能得到奖励信号。强化学习的很大一部分工作,就是解决"如何从稀疏的奖励信号中,倒推哪些行动是好的"。
经典案例:AlphaGo是怎么学会下棋的
2016年,AlphaGo击败了围棋世界冠军李世石。这件事震惊了全世界,因为围棋一直被认为是人类最后的智力堡垒——棋盘上的可能局面数量,比宇宙中的原子数量还多。
AlphaGo(2016年):先学人类,再超越人类
AlphaGo的训练分两个阶段:
第一阶段:收集16万局职业棋手的对局记录,让AI先"临摹"人类的下法。这一步用的是普通的监督学习——有标准答案(人类怎么下的),AI照着学。
第二阶段:以第一步的结果为起点,让AI和自己的另一个版本对弈。赢了就是奖励,输了就是惩罚。AI不断试错,不断改进策略,最终超越了人类顶尖水平。
关键洞察:监督学习让AI达到人类水平,强化学习让AI超越人类水平。
AlphaGo Zero(2017年):更惊人的版本
DeepMind随后发布了AlphaGo Zero,做了一个激进的尝试:完全不用人类棋谱,从零开始。
它只知道围棋的规则(哪里能下、怎么算赢)。从完全随机下棋开始,纯靠自我对弈和输赢信号,经过3天训练超越了原版AlphaGo,经过40天训练超越了所有人类棋手。
| 对比 | AlphaGo | AlphaGo Zero |
|---|---|---|
| 是否使用人类棋谱 | 是(16万局) | 否 |
| 训练起点 | 监督学习预训练 | 纯随机 |
| 最终强度 | 超越人类冠军 | 超越AlphaGo本身 |
| 揭示的意义 | RL可以超越人类 | RL甚至不需要人类知识 |
AlphaGo Zero的成功揭示了一个深刻结论:在规则明确的领域,给足时间,纯强化学习可以超越所有人类经验的积累。
RLHF:强化学习如何训练出ChatGPT
现在你知道了强化学习的基本思想。但它和ChatGPT有什么关系?
问题:纯预训练的大模型不"听话"
GPT-3刚训练出来时,目标只有一个:预测下一个词。训练数据是互联网上所有文字——好的、坏的、有用的、有害的都有。
纯预训练的模型被问到"如何改善睡眠"时,可能会写出一篇充满焦虑的失眠分析文章,而不是给出实用建议——因为它只是在做"这段文字后面最可能出现什么",不会判断"这样回答对不对、有没有用"。
这就是对齐问题——模型的行为和人类的期望不一致。
RLHF三步流程
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是解决这个问题的核心技术,也是GPT-3变成ChatGPT的关键。
RLHF 三步流程——监督微调、训练奖励模型、强化学习优化
用一个培训实习生的类比来理解这三步:
你雇了一个刚毕业的实习生(预训练大语言模型)。他学识渊博,但不知道职场规范——回答问题可能太啰嗦、太学术、不考虑实际需求。
怎么培训他?
第一步:给他看优秀员工的案例(SFT,监督微调)
收集高质量的"问题-好回答"示例,让模型对着这些例子学习。这一步让模型建立了"对话助手的基本形态"——从一个"什么都能续写的文字接龙机"变成了"见过优质对话的初级助手"。
但光靠这一步不够——你不可能给他看所有情况的完美示例。
第二步:培养一个自动打分的主管(训练奖励模型)
你不可能时时刻刻盯着每个回答亲自打分。所以先做一件事:让专业评估员对模型的多个不同版本的回答进行排序——"A比B好,B比D好,C比D好"。排序比写标准答案容易得多。
用这批排序数据,训练一个独立的"自动打分器"(奖励模型)——输入任意一个问题和回答,它能输出"人类大概会给这个回答打几分"。
第三步:用这个打分器来优化模型(强化学习)
有了自动打分器,就可以大规模训练了:
- 让模型生成一个回答
- 用奖励模型给这个回答打分
- 分高的回答模式被强化,分低的被弱化
- 不断循环,模型越来越会给出人类喜欢的回答
RLHF训练流程:
预训练大语言模型(知识丰富但行为不对齐)
|
↓ 第一步:监督微调(用优质对话示例)
初步对齐的助手模型
|
↓ 第二步:训练奖励模型(用人类排序数据)
自动打分器就绪
|
↓ 第三步:强化学习优化(用奖励模型不断打磨)
最终的ChatGPT风格助手
ChatGPT相比GPT-3的质变,主要来自这个过程。它让模型从"博学的文字接龙机"变成了"符合人类期望的对话助手"。
从游戏AI到LLM Agent:逻辑连接
现在来回答本文开头的问题:强化学习和你将要写的Agent有什么关系?
强化学习循环与 LLM Agent 循环的结构对比——相似的感知-行动逻辑,不同的实现方式
这两个循环几乎是一样的结构。LLM Agent本质上是强化学习循环的一个变体——只不过Agent的"策略"不是通过训练强化学习算法得到的,而是预训练LLM内置的推理能力。
| 强化学习概念 | LLM Agent对应 |
|---|---|
| 状态(State) | 当前对话上下文 + 工具调用历史 |
| 行动(Action) | 调用工具 / 生成文字 / 向用户提问 |
| 策略(Policy) | LLM的推理能力(Prompt驱动) |
| 奖励(Reward) | 任务完成度 / 用户满意度(通常是隐式的) |
| 一局游戏(Episode) | 从用户发起请求到任务完成的一次完整交互 |
关键差异:强化学习的Agent在每次交互后会更新自身(改变神经网络参数),而LLM Agent通常不更新参数——它靠Prompt和上下文来"适应"任务。
这也解释了LLM Agent的一个重要局限:LLM的"策略"(推理方式)是固定的,它无法像强化学习Agent那样从当前任务的失败中真正学习并更新自身。这是当前Agent技术最重要的局限之一,也是未来要突破的方向。
你需要学强化学习到什么程度?
| 目标 | 需要掌握的内容 |
|---|---|
| Agent应用开发者(本课程主要读者) | 理解本文的概念就够了:感知-行动循环、RLHF的基本思想、Agent和RL的关系 |
| AI工程师 | 需要了解具体算法(Q-Learning、PPO等)和框架(Gymnasium) |
| LLM微调/对齐方向 | 需要深度掌握RLHF全流程,包括奖励模型训练细节 |
小结
| 概念 | 一句话理解 |
|---|---|
| 强化学习 | 通过试错和奖励学习策略,适合没有标准答案的决策任务 |
| 智能体/Agent | 在环境中做决策并获得奖励的主体 |
| 感知-行动循环 | 观察状态→做决策→行动→获得反馈→更新策略,这是RL和LLM Agent共同的底层逻辑 |
| AlphaGo | 先监督学习学人类,再强化学习超越人类;AlphaGo Zero证明不需要人类知识 |
| RLHF | 用人类反馈训练奖励模型,再用奖励模型强化训练大模型,让模型"对齐"人类期望 |
| LLM Agent局限 | 策略固定,无法从失败中真正学习更新自身,是当前重要研究方向 |
后续阅读:第6章"LLM基础"会详细讲RLHF在LLM训练中的具体细节。第12章"LLM Agent"会展示如何用代码实现感知-规划-行动的完整循环。
下一篇,第1章的最后一篇——把Token、RAG、Agent、MCP这些课程里反复出现的词,一次性说清楚。