课程0基础Agent开发课 / LLM基础 / LLM基础导读-理解语言模型的工作原理
— 13 min read

LLM基础导读-理解语言模型的工作原理

> **本文适合谁**

LLM 基础导读:理解语言模型的工作原理

本文适合谁

刚开始接触大语言模型、想搞清楚"模型到底在做什么"的开发者。尤其适合直接跳过基础去调 API、遇到奇怪行为却不知道为什么的读者。不需要数学背景,不需要读过第 3-5 章。


改了几个词,输出质量就变了;同一个 Prompt,两个模型表现截然不同;模型一本正经地说出完全错误的内容……这些现象背后都有原因。

本章就是解答这些"为什么"的。读完这章,你用 API 的时候会有一种"我知道背后在发生什么"的感觉,而不是瞎猜。

1.1 大语言模型(LLM)是什么

官方定义(来自 AWS):

A large language model (LLM) is a type of artificial intelligence (AI) program that can recognize and generate text, among other tasks. LLMs are trained on huge sets of data — hence the name "large." LLMs are built on machine learning: specifically, a type of neural network called a transformer model.

大语言模型(LLM)是一种能够识别和生成文本(以及其他任务)的人工智能程序。LLM 在海量数据集上训练——这也是"大"字的由来。LLM 基于机器学习构建,具体来说是一种叫做 Transformer 的神经网络。

一句话理解:LLM 是在海量文本上训练的超大型神经网络,核心任务是预测下一个 Token,在足够大的规模下涌现出理解、推理、生成等能力。

LLM 不是知识数据库,不是规则引擎——它是一个概率模型。给定一段文本,它预测下一个最可能出现的词(Token)。这个看似简单的任务,在数千亿参数的规模下,涌现出了翻译、写代码、回答问题等能力。

1.1.1 LLM 能做什么?

能力 说明 典型应用
文本生成 根据提示生成连贯文本 写作助手、内容创作
问答 基于知识回答问题 智能客服、知识库问答
代码生成 生成和解释代码 GitHub Copilot、编程助手
翻译与摘要 跨语言转换、长文压缩 文档处理、多语言应用
推理 逻辑推断、数学计算 复杂任务分析
工具调用 决定调用哪些工具 AI Agent 的核心能力

1.1.2 为什么 LLM 能做这么多事?

传统 NLP 系统是任务专用的:情感分析模型只能做情感分析,翻译模型只能做翻译。LLM 的突破是通用化——同一个模型,通过不同的 Prompt,可以完成几乎任意文本任务,不需要重新训练。

这种能力来自两个关键创新:Transformer 架构(2017 年)让模型能处理长距离依赖;规模涌现(Scale Emergent Abilities)让模型在参数量超过某个阈值后,突然获得它没被明确训练过的能力。


为什么要学 LLM 基础

很多开发者跳过这章直接调 API,短期内能跑通,但很快会遇到一堵墙:

  • 换了个表达方式,效果差了很多——不知道为什么
  • 模型说出了明显错误的事实——不知道该怎么防
  • Temperature 调来调去,不知道往哪个方向调
  • 上下文长度够用,但模型"忘记"了前面的内容——不知道这是结构性问题
  • Agent 工具调用参数明显不对——不知道该从哪里入手调试

这些问题都有根源。而根源,都在 LLM 的工作原理里。

本章不是培养模型训练工程师,而是帮应用开发者建立"LLM 用户手册"——知道这台机器的工作方式,才能正确使用它。

本章阅读时间:约2小时(共19篇)

路径 A 必读篇目:第 01-07 篇。第 08 篇之后是进阶内容,可以按需阅读。

无数学依赖:本章不需要第 3-5 章(数学/ML/深度学习)的基础,路径 A 学员可直接阅读。

时间有限?快速路线:只读第 01 篇(历史脉络)和第 03 篇(LLM 工作原理),掌握 Token 和上下文窗口这两个核心概念,就能开始调 API 了。


什么是语言模型:从统计模型到 LLM 的演化

统计语言模型(N-gram,1990 年代)

最早的语言模型基于统计规律:给定前 N-1 个词,预测下一个词的概率。"今天天气很"后面接"好"的概率,通过语料库中的词频统计得出。N-gram 简单有效,但窗口大小固定,无法捕捉长距离依赖;词汇量增大时参数爆炸;遇到新词就彻底失效。

神经语言模型(RNN/LSTM,2010 年代)

循环神经网络(RNN)引入了隐藏状态传递序列信息,理论上可以记忆任意长度的历史。LSTM 通过门控机制缓解了梯度消失问题。但 RNN 的硬伤是顺序计算——不能并行化,训练慢,长距离依赖仍然有限。

Transformer 与 GPT 时代(2017 年至今)

2017 年,Google 发布了 Transformer 架构,论文名为《Attention Is All You Need》。自注意力机制让模型能直接计算序列中任意两个位置之间的关系,同时支持高度并行计算——这一下解决了 RNN 的两个核心问题。

2018 年,OpenAI 基于 Transformer 发布 GPT-1,开创了"预训练+微调"范式。2020 年,GPT-3 的 1750 亿参数带来了涌现能力(Emergent Abilities)——规模超过某个阈值后,模型突然会做它没被明确训练过的事。2022 年,InstructGPT 和 ChatGPT 通过 RLHF(基于人类反馈的强化学习)让模型对齐人类意图,LLM 才真正走入大众视野。

大语言模型的本质

根据 AWS 的权威定义,LLM 是"基于大量数据预训练的超大型深度学习模型",使用词嵌入表示文本,训练目标是预测下一个 token。

从技术角度,LLM 是一个极大的概率分布:给定一段文本,预测下一个 Token 的概率。这个简单的预测任务,在足够大的数据和模型规模下,涌现出了理解、推理、翻译、代码生成等能力。

LLM 不是知识数据库,不是规则引擎,是一个在海量文本上训练的概率模型。 幻觉(Hallucination)不可避免,正是因为模型生成的是"看起来合理的下一个 Token",而不是"验证过的事实"。


LLM 与传统 NLP 的本质区别

传统 NLP 系统是任务专用的:情感分析模型只能做情感分析,命名实体识别模型只能识别实体,每个任务需要独立训练独立部署。

LLM 的突破是通用化。同一个模型,通过不同的 Prompt,可以完成翻译、摘要、问答、代码生成、数据提取、角色扮演……任务切换不需要重新训练,只需要改变输入。

另一个关键区别是上下文学习(In-Context Learning)。传统模型需要大量标注数据微调才能适应新任务,LLM 可以通过在 Prompt 里提供几个示例(Few-shot)直接学习新任务模式,不需要梯度更新。这让 Prompt 工程成为一种真实有效的工程能力。

LLM 支持三种适配方式:

  • 零样本(Zero-shot):直接提问,不提供示例
  • 少样本(Few-shot):Prompt 中给几个示例引导输出
  • 微调(Fine-tuning):用特定任务数据继续训练

LLM 的核心概念地图

大语言模型 LLM

架构

训练

推理

关键概念

模型类型

评估

Transformer

自注意力机制

位置编码

MoE混合专家

预训练-海量文本

SFT指令微调

RLHF人类反馈强化学习

DPO直接偏好优化

Token生成

Temperature/TopP采样

KV-Cache

量化与加速

Token与分词

上下文窗口

幻觉问题

Function Calling

Embedding向量化

基础模型-GPT/Claude

推理模型-o1/R1

嵌入模型

多模态模型

MMLU基准

HumanEval

Chatbot Arena

领域专项评估


本章 16 篇文章的学习路径

本章内容分为四个层次:历史脉络、工作原理、应用参数、高级话题。

历史与背景(第 1-2 篇)

01 梳理从 GPT-1 到 2026 年的大模型发展历程,帮助建立时间轴坐标。02 讲从 N-gram 到 Transformer 的语言模型进化史,是理解为什么 Transformer 重要的必要背景。这两篇合在一起,回答"我们是怎么走到今天的"。

工作原理(第 3-5 篇)

03 讲 LLM 工作原理,重点是 Token 和 Transformer 的直觉理解——不是数学推导,而是"它在做什么";文章末尾还介绍了多模态 Token 机制,解释图片是如何以"图像 Token"的形式被 LLM 处理的。04 专门讲自注意力机制,这是 Transformer 最核心的创新,理解它就理解了 LLM 为什么能处理长距离依赖。05 讲分词器(Tokenizer),Token 才是模型的基本单位而非字符或词,这直接影响对 API 费用计算和上下文长度的理解。

这三篇是应用开发者理解 LLM 行为的最核心内容,强烈建议完整阅读。

使用参数与行为(第 6-8、10 篇)

06 讲 Temperature、TopP、TopK 等核心采样参数:这些参数直接控制输出的"随机性",调错了会让 Agent 行为异常。07 讲幻觉问题:幻觉的成因、类型和缓解策略,这是应用开发绕不过去的问题。08 讲主流模型对比(GPT、Claude、DeepSeek 等),帮助做模型选型决策。10 讲 Embedding 向量化原理,RAG 系统的数学基础。

说明:Function Calling 详解(原第 09 篇)已整合到第 9 章《工具使用与 Function Calling》,作为该章的核心文章,与工具链编排、OutputParser 一起构成完整的工具调用知识体系。

工程与高级话题(第 11-16 篇)

11 讲上下文窗口管理:100K 上下文窗口不等于无限,长对话和长文档的处理策略。12 讲训练三阶段(预训练、SFT、RLHF),应用开发者理解模型"为什么这样行动"的必要知识。13 讲推理模型(o1、DeepSeek-R1)的思考机制:为什么推理模型适合复杂任务但不适合简单任务。15 讲采样策略详解,贪心搜索、束搜索、Top-K、Top-P 的区别与应用场景。16 讲模型评估基准,如何读懂 MMLU、HumanEval、Chatbot Arena 等评测数据。

[进阶选读] 架构深度解析(第 14、17-20 篇)

这几篇面向想深入理解 LLM 内部机制的读者,路径 A 的读者可以跳过:14 讲推理优化(KV-Cache、量化、Flash-Attention);17 讲位置编码与 RoPE,理解为什么现代 LLM 能支持超长上下文;18 讲残差连接与 LayerNorm,深层网络稳定训练的工程秘密;19 讲 MoE 混合专家架构,DeepSeek 低成本的技术根源;20 讲注意力机制的数学直觉,Q/K/V 矩阵的具体计算过程。

01-02
历史脉络

03-05
工作原理

06-10
参数与行为

11-16
工程与高级话题


应用开发者需要理解到什么深度

这是一个值得专门回答的问题:学 LLM 基础,要学到什么程度?

需要深入理解的(影响日常开发决策)

  • Token 机制:影响 API 费用估算、上下文长度限制的判断。Token 是模型的基本处理单位,不是字符也不是单词。
  • Temperature 等采样参数:直接控制输出行为,调参是日常工作。知道参数背后的原理,才能知道往哪个方向调。
  • Function Calling:Agent 工具调用的底层,必须清楚其格式和限制。
  • 上下文窗口管理:长对话应用的核心工程挑战。超出窗口的内容对模型来说等于不存在。
  • 幻觉问题:RAG、验证机制的设计前提。不理解幻觉成因,就不知道该在哪里加防线。
  • 模型差异:不同模型在指令遵循、推理、代码、多语言上的能力差异,直接影响选型。

需要理解原理,不需要实现细节的(帮助解释行为,不影响日常开发)

  • 自注意力机制:理解为什么模型能处理长距离依赖,但不需要手推矩阵运算。理解这个,才知道为什么"前面提到的约束"有时会被模型"忽视"。
  • 训练过程(预训练、SFT、RLHF):理解模型为什么对某类指令更敏感,为什么微调能改变格式偏好但不能注入新知识。
  • 推理模型机制:理解什么情况下该用 o1/R1 而非普通对话模型。

可以不深入的(模型研究者的领域)

  • Transformer 的具体数学公式
  • 分布式训练的底层实现
  • 特定硬件优化细节
  • 模型架构的微观设计(注意力头数量、FFN 维度等)

这个边界因人而异。数学背景好的开发者可以读更深;时间有限的开发者可以以"能解释行为"为目标,而非"能重现实现"。


与其他章节的关联

不知道 Token 是什么,就无法理解 API 费用;不理解 Temperature,调参就是乱猜;不清楚上下文窗口,长对话系统就会踩坑。本章知识在 API 调用、Prompt 工程、RAG 和 Agent 开发里随时都会用到。

几个具体的交叉点:

  • Prompt 工程(第 8 章):理解 LLM 本质是"续写",才知道为什么给出具体示例比描述要求更有效;理解幻觉成因,才能设计出减少幻觉的 Prompt 结构。
  • RAG(第 11 章):Embedding 向量化(第 10 篇)是 RAG 检索的基础;幻觉问题(第 7 篇)是 RAG 存在的根本原因之一。
  • Agent 开发(第 12 章):Function Calling(第 9 章)是 Agent 工具调用的底层接口;推理模型机制(第 13 篇)直接影响选哪个模型做规划。

不理解 LLM 工作原理的 Agent 开发者,调 Bug 靠猜,调参靠感觉。这章就是给你一个扎实的底层认知。


本章小结

概念 一句话解释 为什么应用开发者要知道
Token 模型处理文本的基本单位,比词小比字符大 API 计费单位,上下文窗口限制单位
Transformer LLM 的核心神经网络架构,自注意力让任意两词直接交互 理解为什么模型能处理长距离依赖
上下文窗口 模型一次能看到的最大 Token 数 长对话和长文档处理的工程约束
Temperature 控制输出随机性的参数 直接影响模型行为,是最常用的调参旋钮
幻觉 模型自信地生成错误内容 Agent 系统防线设计的前提认知
训练三阶段 预训练→SFT→RLHF,分别学知识/对话/价值观 理解模型为什么有特定的偏好和限制
Embedding 把文本转成数字向量,语义相近的距离近 RAG 系统的数学基础
本页目录