LLM基础导读-理解语言模型的工作原理
> **本文适合谁**
LLM 基础导读:理解语言模型的工作原理
本文适合谁
刚开始接触大语言模型、想搞清楚"模型到底在做什么"的开发者。尤其适合直接跳过基础去调 API、遇到奇怪行为却不知道为什么的读者。不需要数学背景,不需要读过第 3-5 章。
改了几个词,输出质量就变了;同一个 Prompt,两个模型表现截然不同;模型一本正经地说出完全错误的内容……这些现象背后都有原因。
本章就是解答这些"为什么"的。读完这章,你用 API 的时候会有一种"我知道背后在发生什么"的感觉,而不是瞎猜。
1.1 大语言模型(LLM)是什么
官方定义(来自 AWS):
A large language model (LLM) is a type of artificial intelligence (AI) program that can recognize and generate text, among other tasks. LLMs are trained on huge sets of data — hence the name "large." LLMs are built on machine learning: specifically, a type of neural network called a transformer model.
大语言模型(LLM)是一种能够识别和生成文本(以及其他任务)的人工智能程序。LLM 在海量数据集上训练——这也是"大"字的由来。LLM 基于机器学习构建,具体来说是一种叫做 Transformer 的神经网络。
一句话理解:LLM 是在海量文本上训练的超大型神经网络,核心任务是预测下一个 Token,在足够大的规模下涌现出理解、推理、生成等能力。
LLM 不是知识数据库,不是规则引擎——它是一个概率模型。给定一段文本,它预测下一个最可能出现的词(Token)。这个看似简单的任务,在数千亿参数的规模下,涌现出了翻译、写代码、回答问题等能力。
1.1.1 LLM 能做什么?
| 能力 | 说明 | 典型应用 |
|---|---|---|
| 文本生成 | 根据提示生成连贯文本 | 写作助手、内容创作 |
| 问答 | 基于知识回答问题 | 智能客服、知识库问答 |
| 代码生成 | 生成和解释代码 | GitHub Copilot、编程助手 |
| 翻译与摘要 | 跨语言转换、长文压缩 | 文档处理、多语言应用 |
| 推理 | 逻辑推断、数学计算 | 复杂任务分析 |
| 工具调用 | 决定调用哪些工具 | AI Agent 的核心能力 |
1.1.2 为什么 LLM 能做这么多事?
传统 NLP 系统是任务专用的:情感分析模型只能做情感分析,翻译模型只能做翻译。LLM 的突破是通用化——同一个模型,通过不同的 Prompt,可以完成几乎任意文本任务,不需要重新训练。
这种能力来自两个关键创新:Transformer 架构(2017 年)让模型能处理长距离依赖;规模涌现(Scale Emergent Abilities)让模型在参数量超过某个阈值后,突然获得它没被明确训练过的能力。
为什么要学 LLM 基础
很多开发者跳过这章直接调 API,短期内能跑通,但很快会遇到一堵墙:
- 换了个表达方式,效果差了很多——不知道为什么
- 模型说出了明显错误的事实——不知道该怎么防
- Temperature 调来调去,不知道往哪个方向调
- 上下文长度够用,但模型"忘记"了前面的内容——不知道这是结构性问题
- Agent 工具调用参数明显不对——不知道该从哪里入手调试
这些问题都有根源。而根源,都在 LLM 的工作原理里。
本章不是培养模型训练工程师,而是帮应用开发者建立"LLM 用户手册"——知道这台机器的工作方式,才能正确使用它。
本章阅读时间:约2小时(共19篇)
路径 A 必读篇目:第 01-07 篇。第 08 篇之后是进阶内容,可以按需阅读。
无数学依赖:本章不需要第 3-5 章(数学/ML/深度学习)的基础,路径 A 学员可直接阅读。
时间有限?快速路线:只读第 01 篇(历史脉络)和第 03 篇(LLM 工作原理),掌握 Token 和上下文窗口这两个核心概念,就能开始调 API 了。
什么是语言模型:从统计模型到 LLM 的演化
统计语言模型(N-gram,1990 年代)
最早的语言模型基于统计规律:给定前 N-1 个词,预测下一个词的概率。"今天天气很"后面接"好"的概率,通过语料库中的词频统计得出。N-gram 简单有效,但窗口大小固定,无法捕捉长距离依赖;词汇量增大时参数爆炸;遇到新词就彻底失效。
神经语言模型(RNN/LSTM,2010 年代)
循环神经网络(RNN)引入了隐藏状态传递序列信息,理论上可以记忆任意长度的历史。LSTM 通过门控机制缓解了梯度消失问题。但 RNN 的硬伤是顺序计算——不能并行化,训练慢,长距离依赖仍然有限。
Transformer 与 GPT 时代(2017 年至今)
2017 年,Google 发布了 Transformer 架构,论文名为《Attention Is All You Need》。自注意力机制让模型能直接计算序列中任意两个位置之间的关系,同时支持高度并行计算——这一下解决了 RNN 的两个核心问题。
2018 年,OpenAI 基于 Transformer 发布 GPT-1,开创了"预训练+微调"范式。2020 年,GPT-3 的 1750 亿参数带来了涌现能力(Emergent Abilities)——规模超过某个阈值后,模型突然会做它没被明确训练过的事。2022 年,InstructGPT 和 ChatGPT 通过 RLHF(基于人类反馈的强化学习)让模型对齐人类意图,LLM 才真正走入大众视野。
大语言模型的本质
根据 AWS 的权威定义,LLM 是"基于大量数据预训练的超大型深度学习模型",使用词嵌入表示文本,训练目标是预测下一个 token。
从技术角度,LLM 是一个极大的概率分布:给定一段文本,预测下一个 Token 的概率。这个简单的预测任务,在足够大的数据和模型规模下,涌现出了理解、推理、翻译、代码生成等能力。
LLM 不是知识数据库,不是规则引擎,是一个在海量文本上训练的概率模型。 幻觉(Hallucination)不可避免,正是因为模型生成的是"看起来合理的下一个 Token",而不是"验证过的事实"。
LLM 与传统 NLP 的本质区别
传统 NLP 系统是任务专用的:情感分析模型只能做情感分析,命名实体识别模型只能识别实体,每个任务需要独立训练独立部署。
LLM 的突破是通用化。同一个模型,通过不同的 Prompt,可以完成翻译、摘要、问答、代码生成、数据提取、角色扮演……任务切换不需要重新训练,只需要改变输入。
另一个关键区别是上下文学习(In-Context Learning)。传统模型需要大量标注数据微调才能适应新任务,LLM 可以通过在 Prompt 里提供几个示例(Few-shot)直接学习新任务模式,不需要梯度更新。这让 Prompt 工程成为一种真实有效的工程能力。
LLM 支持三种适配方式:
- 零样本(Zero-shot):直接提问,不提供示例
- 少样本(Few-shot):Prompt 中给几个示例引导输出
- 微调(Fine-tuning):用特定任务数据继续训练
LLM 的核心概念地图
本章 16 篇文章的学习路径
本章内容分为四个层次:历史脉络、工作原理、应用参数、高级话题。
历史与背景(第 1-2 篇)
01 梳理从 GPT-1 到 2026 年的大模型发展历程,帮助建立时间轴坐标。02 讲从 N-gram 到 Transformer 的语言模型进化史,是理解为什么 Transformer 重要的必要背景。这两篇合在一起,回答"我们是怎么走到今天的"。
工作原理(第 3-5 篇)
03 讲 LLM 工作原理,重点是 Token 和 Transformer 的直觉理解——不是数学推导,而是"它在做什么";文章末尾还介绍了多模态 Token 机制,解释图片是如何以"图像 Token"的形式被 LLM 处理的。04 专门讲自注意力机制,这是 Transformer 最核心的创新,理解它就理解了 LLM 为什么能处理长距离依赖。05 讲分词器(Tokenizer),Token 才是模型的基本单位而非字符或词,这直接影响对 API 费用计算和上下文长度的理解。
这三篇是应用开发者理解 LLM 行为的最核心内容,强烈建议完整阅读。
使用参数与行为(第 6-8、10 篇)
06 讲 Temperature、TopP、TopK 等核心采样参数:这些参数直接控制输出的"随机性",调错了会让 Agent 行为异常。07 讲幻觉问题:幻觉的成因、类型和缓解策略,这是应用开发绕不过去的问题。08 讲主流模型对比(GPT、Claude、DeepSeek 等),帮助做模型选型决策。10 讲 Embedding 向量化原理,RAG 系统的数学基础。
说明:Function Calling 详解(原第 09 篇)已整合到第 9 章《工具使用与 Function Calling》,作为该章的核心文章,与工具链编排、OutputParser 一起构成完整的工具调用知识体系。
工程与高级话题(第 11-16 篇)
11 讲上下文窗口管理:100K 上下文窗口不等于无限,长对话和长文档的处理策略。12 讲训练三阶段(预训练、SFT、RLHF),应用开发者理解模型"为什么这样行动"的必要知识。13 讲推理模型(o1、DeepSeek-R1)的思考机制:为什么推理模型适合复杂任务但不适合简单任务。15 讲采样策略详解,贪心搜索、束搜索、Top-K、Top-P 的区别与应用场景。16 讲模型评估基准,如何读懂 MMLU、HumanEval、Chatbot Arena 等评测数据。
[进阶选读] 架构深度解析(第 14、17-20 篇)
这几篇面向想深入理解 LLM 内部机制的读者,路径 A 的读者可以跳过:14 讲推理优化(KV-Cache、量化、Flash-Attention);17 讲位置编码与 RoPE,理解为什么现代 LLM 能支持超长上下文;18 讲残差连接与 LayerNorm,深层网络稳定训练的工程秘密;19 讲 MoE 混合专家架构,DeepSeek 低成本的技术根源;20 讲注意力机制的数学直觉,Q/K/V 矩阵的具体计算过程。
应用开发者需要理解到什么深度
这是一个值得专门回答的问题:学 LLM 基础,要学到什么程度?
需要深入理解的(影响日常开发决策)
- Token 机制:影响 API 费用估算、上下文长度限制的判断。Token 是模型的基本处理单位,不是字符也不是单词。
- Temperature 等采样参数:直接控制输出行为,调参是日常工作。知道参数背后的原理,才能知道往哪个方向调。
- Function Calling:Agent 工具调用的底层,必须清楚其格式和限制。
- 上下文窗口管理:长对话应用的核心工程挑战。超出窗口的内容对模型来说等于不存在。
- 幻觉问题:RAG、验证机制的设计前提。不理解幻觉成因,就不知道该在哪里加防线。
- 模型差异:不同模型在指令遵循、推理、代码、多语言上的能力差异,直接影响选型。
需要理解原理,不需要实现细节的(帮助解释行为,不影响日常开发)
- 自注意力机制:理解为什么模型能处理长距离依赖,但不需要手推矩阵运算。理解这个,才知道为什么"前面提到的约束"有时会被模型"忽视"。
- 训练过程(预训练、SFT、RLHF):理解模型为什么对某类指令更敏感,为什么微调能改变格式偏好但不能注入新知识。
- 推理模型机制:理解什么情况下该用 o1/R1 而非普通对话模型。
可以不深入的(模型研究者的领域)
- Transformer 的具体数学公式
- 分布式训练的底层实现
- 特定硬件优化细节
- 模型架构的微观设计(注意力头数量、FFN 维度等)
这个边界因人而异。数学背景好的开发者可以读更深;时间有限的开发者可以以"能解释行为"为目标,而非"能重现实现"。
与其他章节的关联
不知道 Token 是什么,就无法理解 API 费用;不理解 Temperature,调参就是乱猜;不清楚上下文窗口,长对话系统就会踩坑。本章知识在 API 调用、Prompt 工程、RAG 和 Agent 开发里随时都会用到。
几个具体的交叉点:
- Prompt 工程(第 8 章):理解 LLM 本质是"续写",才知道为什么给出具体示例比描述要求更有效;理解幻觉成因,才能设计出减少幻觉的 Prompt 结构。
- RAG(第 11 章):Embedding 向量化(第 10 篇)是 RAG 检索的基础;幻觉问题(第 7 篇)是 RAG 存在的根本原因之一。
- Agent 开发(第 12 章):Function Calling(第 9 章)是 Agent 工具调用的底层接口;推理模型机制(第 13 篇)直接影响选哪个模型做规划。
不理解 LLM 工作原理的 Agent 开发者,调 Bug 靠猜,调参靠感觉。这章就是给你一个扎实的底层认知。
本章小结
| 概念 | 一句话解释 | 为什么应用开发者要知道 |
|---|---|---|
| Token | 模型处理文本的基本单位,比词小比字符大 | API 计费单位,上下文窗口限制单位 |
| Transformer | LLM 的核心神经网络架构,自注意力让任意两词直接交互 | 理解为什么模型能处理长距离依赖 |
| 上下文窗口 | 模型一次能看到的最大 Token 数 | 长对话和长文档处理的工程约束 |
| Temperature | 控制输出随机性的参数 | 直接影响模型行为,是最常用的调参旋钮 |
| 幻觉 | 模型自信地生成错误内容 | Agent 系统防线设计的前提认知 |
| 训练三阶段 | 预训练→SFT→RLHF,分别学知识/对话/价值观 | 理解模型为什么有特定的偏好和限制 |
| Embedding | 把文本转成数字向量,语义相近的距离近 | RAG 系统的数学基础 |