课程0基础Agent开发课 / AI全景认知 / 强化学习是什么-从游戏AI到Agent决策
— 10 min read

强化学习是什么-从游戏AI到Agent决策

> **本文适合谁**:对"强化学习"这个词好奇,但不知道它和ChatGPT、和Agent有什么关系的读者。读完这篇,你会明白:强化学习是如何从游戏AI一路演变到ChatGPT背后的训练技术,以及它为什么和你将要写的Agent系统有直接的逻辑联系。

强化学习是什么:从游戏AI到Agent决策

本文适合谁:对"强化学习"这个词好奇,但不知道它和ChatGPT、和Agent有什么关系的读者。读完这篇,你会明白:强化学习是如何从游戏AI一路演变到ChatGPT背后的训练技术,以及它为什么和你将要写的Agent系统有直接的逻辑联系。

本文阅读时间:约12分钟

后续应用:理解本文后,第6章"LLM基础"会讲RLHF如何训练出ChatGPT,第12章"LLM Agent"会展示感知-行动循环如何延伸到LLM Agent的设计。


强化学习和我们写的Agent有什么关系?

这是很多人读完强化学习介绍后仍然困惑的问题。本文从最基本的思想讲起,经过AlphaGo的案例,到ChatGPT背后的训练机制,最终回答这个问题:强化学习的感知-行动循环,就是LLM Agent架构的思想来源


强化学习的核心思想:用奖惩代替例题

上一篇讲的机器学习,核心是"给机器大量带标签的例题让它学"。这在很多场景下都很好用,但有一类问题,它完全搞不定:

当你没有"标准答案",只知道最终结果的好坏时,怎么学习?

下围棋时,你没办法在每一步棋后就告诉AI"这步棋的正确走法是什么"——围棋棋局有10的170次方种可能,穷举是不可能的。你能告诉它的只是:这局棋最终赢了还是输了。

训练一个聊天机器人时,你没办法给每一个回答都写出"完美版本"——这成本太高了。你能做的是让人类评估员说"这个回答比那个好"。

强化学习(Reinforcement Learning,RL)就是为了解决这类问题而生的。

按照AWS的定义:强化学习是一种ML技术,可训练软件做出决策以获得最佳结果。 核心机制就是:智能体在环境中行动,做对了获得奖励,做错了获得惩罚,通过不断试错,逐渐学会最优策略。

训狗类比

这个过程最像训狗。你不需要向狗解释"坐下"的语言含义——你只需要在狗坐下时给它零食(奖励),在它乱跑时不理它(没有奖励或给予惩罚)。重复几十次,狗学会了"听到坐下指令就坐下"这个行为。它不懂语言,但它懂奖惩。

强化学习完全是这个逻辑。


四个核心概念

理解强化学习,你只需要记住四个词:

概念 含义 训狗类比 LLM Agent类比
智能体(Agent) 做决策的主体 LLM + 工具调用逻辑
环境(Environment) 智能体所处的世界 训练场 用户、工具、外部系统
状态(State) 当前情况的描述 当前姿势、周围情况 当前对话历史 + 上下文
奖励(Reward) 行动之后得到的反馈 零食或惩罚 任务完成度/用户满意度

还有一个重要概念:策略(Policy)。策略是智能体的"决策规则"——在看到当前状态后,决定采取什么行动的方法。可以理解为一套内化的经验法则。训练越好的智能体,策略越优。


感知-行动循环:强化学习的工作方式

强化学习的工作方式是一个不断循环的过程:

Environment 环境

Agent 智能体

Action 行动

State, Reward

策略 Policy

状态 State
奖励 Reward

强化学习的感知-行动循环——五个步骤不断重复,策略在循环中逐渐优化

记住这个循环:感知 → 决策 → 行动 → 反馈 → 更新 → 感知……

这个循环有一个根本性的挑战:大多数行动不能立即得到明确的奖励

下围棋的时候,你不知道第37步棋是好是坏——要等到整局结束才知道赢还是输。这叫奖励稀疏问题——大多数时间没有明确反馈,只有偶尔才能得到奖励信号。强化学习的很大一部分工作,就是解决"如何从稀疏的奖励信号中,倒推哪些行动是好的"。


经典案例:AlphaGo是怎么学会下棋的

2016年,AlphaGo击败了围棋世界冠军李世石。这件事震惊了全世界,因为围棋一直被认为是人类最后的智力堡垒——棋盘上的可能局面数量,比宇宙中的原子数量还多。

AlphaGo(2016年):先学人类,再超越人类

AlphaGo的训练分两个阶段:

第一阶段:收集16万局职业棋手的对局记录,让AI先"临摹"人类的下法。这一步用的是普通的监督学习——有标准答案(人类怎么下的),AI照着学。

第二阶段:以第一步的结果为起点,让AI和自己的另一个版本对弈。赢了就是奖励,输了就是惩罚。AI不断试错,不断改进策略,最终超越了人类顶尖水平。

关键洞察:监督学习让AI达到人类水平,强化学习让AI超越人类水平。

AlphaGo Zero(2017年):更惊人的版本

DeepMind随后发布了AlphaGo Zero,做了一个激进的尝试:完全不用人类棋谱,从零开始

它只知道围棋的规则(哪里能下、怎么算赢)。从完全随机下棋开始,纯靠自我对弈和输赢信号,经过3天训练超越了原版AlphaGo,经过40天训练超越了所有人类棋手。

对比 AlphaGo AlphaGo Zero
是否使用人类棋谱 是(16万局)
训练起点 监督学习预训练 纯随机
最终强度 超越人类冠军 超越AlphaGo本身
揭示的意义 RL可以超越人类 RL甚至不需要人类知识

AlphaGo Zero的成功揭示了一个深刻结论:在规则明确的领域,给足时间,纯强化学习可以超越所有人类经验的积累。


RLHF:强化学习如何训练出ChatGPT

现在你知道了强化学习的基本思想。但它和ChatGPT有什么关系?

问题:纯预训练的大模型不"听话"

GPT-3刚训练出来时,目标只有一个:预测下一个词。训练数据是互联网上所有文字——好的、坏的、有用的、有害的都有。

纯预训练的模型被问到"如何改善睡眠"时,可能会写出一篇充满焦虑的失眠分析文章,而不是给出实用建议——因为它只是在做"这段文字后面最可能出现什么",不会判断"这样回答对不对、有没有用"。

这就是对齐问题——模型的行为和人类的期望不一致。

RLHF三步流程

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是解决这个问题的核心技术,也是GPT-3变成ChatGPT的关键。

预训练大语言模型

SFT 监督微调

奖励模型
训练

RL 强化学习优化

ChatGPT 风格助手

RLHF 三步流程——监督微调、训练奖励模型、强化学习优化

用一个培训实习生的类比来理解这三步:

你雇了一个刚毕业的实习生(预训练大语言模型)。他学识渊博,但不知道职场规范——回答问题可能太啰嗦、太学术、不考虑实际需求。

怎么培训他?

第一步:给他看优秀员工的案例(SFT,监督微调)

收集高质量的"问题-好回答"示例,让模型对着这些例子学习。这一步让模型建立了"对话助手的基本形态"——从一个"什么都能续写的文字接龙机"变成了"见过优质对话的初级助手"。

但光靠这一步不够——你不可能给他看所有情况的完美示例。

第二步:培养一个自动打分的主管(训练奖励模型)

你不可能时时刻刻盯着每个回答亲自打分。所以先做一件事:让专业评估员对模型的多个不同版本的回答进行排序——"A比B好,B比D好,C比D好"。排序比写标准答案容易得多。

用这批排序数据,训练一个独立的"自动打分器"(奖励模型)——输入任意一个问题和回答,它能输出"人类大概会给这个回答打几分"。

第三步:用这个打分器来优化模型(强化学习)

有了自动打分器,就可以大规模训练了:

  1. 让模型生成一个回答
  2. 用奖励模型给这个回答打分
  3. 分高的回答模式被强化,分低的被弱化
  4. 不断循环,模型越来越会给出人类喜欢的回答
code
RLHF训练流程:

预训练大语言模型(知识丰富但行为不对齐)
        |
        ↓ 第一步:监督微调(用优质对话示例)
初步对齐的助手模型
        |
        ↓ 第二步:训练奖励模型(用人类排序数据)
自动打分器就绪
        |
        ↓ 第三步:强化学习优化(用奖励模型不断打磨)
最终的ChatGPT风格助手

ChatGPT相比GPT-3的质变,主要来自这个过程。它让模型从"博学的文字接龙机"变成了"符合人类期望的对话助手"。


从游戏AI到LLM Agent:逻辑连接

现在来回答本文开头的问题:强化学习和你将要写的Agent有什么关系?

强化学习循环 vs LLM Agent循环
强化学习循环与 LLM Agent 循环的结构对比——相似的感知-行动逻辑,不同的实现方式

这两个循环几乎是一样的结构。LLM Agent本质上是强化学习循环的一个变体——只不过Agent的"策略"不是通过训练强化学习算法得到的,而是预训练LLM内置的推理能力。

强化学习概念 LLM Agent对应
状态(State) 当前对话上下文 + 工具调用历史
行动(Action) 调用工具 / 生成文字 / 向用户提问
策略(Policy) LLM的推理能力(Prompt驱动)
奖励(Reward) 任务完成度 / 用户满意度(通常是隐式的)
一局游戏(Episode) 从用户发起请求到任务完成的一次完整交互

关键差异:强化学习的Agent在每次交互后会更新自身(改变神经网络参数),而LLM Agent通常不更新参数——它靠Prompt和上下文来"适应"任务。

这也解释了LLM Agent的一个重要局限:LLM的"策略"(推理方式)是固定的,它无法像强化学习Agent那样从当前任务的失败中真正学习并更新自身。这是当前Agent技术最重要的局限之一,也是未来要突破的方向。


你需要学强化学习到什么程度?

目标 需要掌握的内容
Agent应用开发者(本课程主要读者) 理解本文的概念就够了:感知-行动循环、RLHF的基本思想、Agent和RL的关系
AI工程师 需要了解具体算法(Q-Learning、PPO等)和框架(Gymnasium)
LLM微调/对齐方向 需要深度掌握RLHF全流程,包括奖励模型训练细节

小结

概念 一句话理解
强化学习 通过试错和奖励学习策略,适合没有标准答案的决策任务
智能体/Agent 在环境中做决策并获得奖励的主体
感知-行动循环 观察状态→做决策→行动→获得反馈→更新策略,这是RL和LLM Agent共同的底层逻辑
AlphaGo 先监督学习学人类,再强化学习超越人类;AlphaGo Zero证明不需要人类知识
RLHF 用人类反馈训练奖励模型,再用奖励模型强化训练大模型,让模型"对齐"人类期望
LLM Agent局限 策略固定,无法从失败中真正学习更新自身,是当前重要研究方向

后续阅读:第6章"LLM基础"会详细讲RLHF在LLM训练中的具体细节。第12章"LLM Agent"会展示如何用代码实现感知-规划-行动的完整循环。

下一篇,第1章的最后一篇——把Token、RAG、Agent、MCP这些课程里反复出现的词,一次性说清楚。

本页目录