大模型发展历程-从GPT-1到2026
> **本文适合谁**
大模型发展历程:从 GPT-1 到 2026
本文适合谁
想建立大模型时代感的开发者。不需要技术背景,把这篇当成一条时间轴读。读完之后,你会理解为什么 LLM 的能力边界在特定地方,以及接下来技术会往哪里演进。
2022 年 11 月 30 日,ChatGPT 上线。5 天,100 万用户。2 个月,1 亿用户。没有任何互联网产品这么快达到这个数字。
这一刻背后,是从 2017 年的一篇论文开始的技术积累,一步一步走到了今天。理解这条脉络,就能理解为什么 LLM 的能力边界在特定地方,以及接下来技术会往哪里演进。
1.1 2017-2018:奠基期——一切从 Transformer 开始
1.1.1 为什么需要 Transformer:RNN 的根本缺陷
大模型发展时间线(2017–2026),展示各关键节点的技术突破
在 Transformer 出现之前,理解为什么它的出现是革命性的,需要先理解被它替代的那个方案。
2017 年以前,NLP 领域的主流架构是 RNN(循环神经网络)和 LSTM(长短期记忆网络)。这类架构的工作方式是:一个词一个词地顺序读入文本,把前面所有词的信息压缩成一个"记忆向量",再和当前词一起处理。
这个顺序处理的机制带来了两个致命问题。第一个是长距离依赖的衰减:当模型读到第 100 个词时,第 1 个词的信息经过了 99 次压缩和变换,大部分已经丢失。"她把苹果放进了篮子,因为它太重了"——这句话里"它"指的是苹果还是篮子,需要回头比较,但 RNN 在读到"它"时,"苹果"的信息已经被大量稀释。第二个是无法并行:处理第 t 个词时必须先处理完前 t-1 个词,无法发挥现代硬件的并行计算优势。
2017 年,Google 的研究团队发表了《Attention is All You Need》,提出了 Transformer 架构。自注意力机制让每个词直接和序列中所有其他词建立关联,不通过"记忆接力"传递信息。这个设计一次性解决了 RNN 的两个问题:任意两个词之间信息传递距离为 1(不再有衰减),所有位置的计算可以同时进行(天然并行)。
这一改变,打开了规模化的大门。
2018 年,两个重要的模型相继出现。
BERT(Google):双向 Transformer,同时看上下文,预训练后在各类任务上微调。一出来就刷新了 NLP 的十一项基准测试。预训练+微调这套范式,从此成为主流。
GPT-1(OpenAI):单向 Transformer,只向前看,专注于生成。参数 1.17 亿,放在今天这是个小模型,但它奠定了 GPT 系列的路线方向——用海量无标注文本做生成式预训练。
BERT 和 GPT-1 代表了两种不同的思路:一个做理解,一个做生成。后来历史证明,生成这条路走得更远。
1.2 2019-2020:规模化期——更大就是更好
1.2.1 Scaling Law 的核心主张:规模是可预测的
2019 年,GPT-2 发布,参数 15 亿。
OpenAI 当时做了一个罕见的决定:因为"担心被滥用",不完整开源,分阶段发布。不管动机是什么,这件事本身传达了一个信号:这个模型生成的文字,已经接近让人不安的真实程度。
2020 年,GPT-3 出现,参数直接跳到 1750 亿。
GPT-3 的意义不只是"更大的 GPT-2"。它展示了一种叫 Few-shot 的能力:在提示词里给几个例子,模型就能举一反三,完成它从没专门训练过的任务。这个能力的出现,让人们开始重新思考"智能"这件事。
同年,Scaling Law(规模定律)被系统性地提出:在数据量、模型参数、计算量同步扩大的情况下,模型能力会以可预测的方式提升。这给了整个行业一张地图——只要资源够,方向就是对的,继续堆规模。
1.3 2021-2022:对齐期——让模型"听话"
1.3.1 对齐问题的本质:能力和意愿的分离
模型大了,但有个问题:它生成的内容,不一定是用户想要的。
GPT-3 写东西很流畅,但它本质上只是在预测下一个词,它不在乎问题的意图,不在乎输出是否有害,也不在乎是否符合人类的价值观。这就是所谓的"对齐"问题。
对齐问题的根本在于:预训练的训练目标(预测下一个词)和用户实际需要(提供有用、无害、诚实的回答)之间存在根本性的偏差。一个只被训练来"续写文本"的模型,在回答问题时会选择"统计上最可能出现在这个位置的词",而不是"真正有帮助的答案"。这两者大多数时候方向一致,但在关键场景下可能严重背离。
2021 年,Codex 出现,成了 GitHub Copilot 的底层引擎。这是大模型第一次以工具产品的形式进入程序员的日常工作流。
2022 年,InstructGPT 是真正的转折点。OpenAI 引入了 RLHF(基于人类反馈的强化学习):先让标注员写出"理想答案",再让人类对模型的输出打分,用这个信号训练模型。结果是,模型开始变得"有用、无害、诚实"。
这不是小改进,这是模型能不能被普通人用起来的关键一步。没有对齐,GPT-3 是一个令人印象深刻的演示;有了对齐,ChatGPT 变成了一个普通人可以日常使用的工具。
然后就是 2022 年 11 月 30 日,ChatGPT 上线。
1.4 2023:爆发期——开源与竞争同时到来
1.4.1 开源为什么改变了行业格局
ChatGPT 打开了潘多拉的盒子,2023 年变成了一场混战。
3 月,GPT-4 发布。多模态,能看图,推理能力明显提升,在各项专业考试(律师、医生)上的表现接近人类水准。同月,Anthropic 发布 Claude 1,提出"Constitutional AI",用规则约束模型行为,把安全性作为核心卖点。
2 月,Meta 发布 LLaMA。在这之前,能玩大模型的只有科技巨头。LLaMA 一开源,学术界和中小公司突然有了选择。开源的意义不只是"免费"——它意味着任何人都可以在模型权重的基础上做修改、微调、部署,不需要通过 API。社区围绕它做了大量的微调和改进,开源生态的繁荣从这里开始。
7 月,LLaMA 2 正式以更宽松的协议开源,规模更大,效果更好。
国内也没闲着,百度文心一言、阿里通义千问、讯飞星火……一时间"百模大战"。大多数是跟风,质量参差不齐,但这轮竞争加速了国内大模型的基础建设。
1.5 2024:能力跃升期——多模态与推理
1.5.1 o1 的范式意义:推理时计算是新的变量
5 月,GPT-4o 发布,多模态实时对话,速度更快,价格更低。
6 月,Claude 3.5 Sonnet 发布,代码能力超过了 GPT-4o。这在当时是个不小的新闻,Anthropic 开始展现出真正的竞争力。
7 月,LLaMA 3.1 发布,最大版本 405B 参数,开源模型第一次真正接近闭源模型的水平。
9 月,o1 发布,这是一个范式级别的转变。在 o1 之前,提升模型能力的方式主要是训练更大的模型。o1 打开了第三条路:推理时计算扩展(Test-time Compute Scaling)。同一个模型,如果允许它在输出答案之前先进行大量内部"思考",它在数学、代码等需要严密逻辑的任务上能力会出现飞跃式提升。这意味着模型的能力不完全固化在训练权重里,推理过程本身消耗更多计算也可以换来更好的答案。
11 月,Anthropic 发布 MCP 协议(Model Context Protocol),为 AI Agent 与外部工具的连接提供了标准化接口。这个协议对于 Agent 开发的意义,后来越来越清晰。
12 月,DeepSeek 发布 V3,以极低的训练成本(约 558 万美元)训练出了接近 GPT-4o 水平的模型,震惊行业。V3 采用 MoE(Mixture of Experts,混合专家)架构,总参数约 671B,但每次推理激活的参数只有 37B,大幅降低了推理成本。
1.6 2025 上半年:推理模型全面普及
1.6.1 DeepSeek R1:以小博大的破局者
2025 年 1 月,DeepSeek R1 发布,成为这一年最重要的开局事件。
DeepSeek 用大约 600 万美元的训练成本,做出了一个性能媲美 OpenAI o1 的开源推理模型,API 调用成本是 o1 的几十分之一。这件事的影响是多维度的:
- 技术层面:DeepSeek 放弃了 RLHF,改用纯强化学习训练推理能力,证明了推理能力不依赖于大量人工标注。
- 经济层面:打穿了"只有土豪才能训练顶级模型"的假设,整个行业的 API 定价体系被迫重估。
- 地缘层面:在芯片出口管制的背景下,算法效率可以部分抵消算力限制,引发了新一轮讨论。
2025 年,OpenAI 产品线进一步分化:o3-mini、o3 旗舰推理模型(ARC-AGI 测试达到 87.5%)、o4-mini(高性价比推理模型)、GPT-4.1(上下文窗口扩展至 100 万 token)相继发布。
2025 年 2 月,Anthropic 发布 Claude 3.7 Sonnet,引入"扩展思考"(Extended Thinking)模式,在软件工程 benchmark(SWE-bench Verified)上达到 62.3%。
2025 年 4 月,Meta 发布 LLaMA 4 系列,正式拥抱 MoE 架构,最大模型总参数 400B,激活 17B,多模态任务接近 GPT-4o 水平。
1.7 2025 下半年至 2026 初:Agent 与多模态的新格局
1.7.1 从"会思考"到"会行动"
2025 年下半年,行业重心从推理模型本身,转向了如何让模型更有效地调用工具、执行多步骤任务,即 Agent 能力的系统化建设。
MCP 协议的生态快速成熟——从 2024 年 11 月发布到 2025 年中,接入 MCP 的工具数量超过数千个。Google 4 月发布 A2A 协议(Agent to Agent),与 MCP 协议形成互补,构建了跨厂商 Agent 通信标准。
2025 年 8 月,OpenAI 正式发布 GPT-5。此后 GPT-5 系列进入快速迭代节奏,截至 2026 年 3 月,GPT-5.4 是 OpenAI 最新旗舰,新增 tool search 和 Computer Use(计算机操控)工具,Computer Use 能力正式 GA(通用可用)。
1.7.2 MiniMax:RL 规模化驱动的 M2 系列
MiniMax 是截至 2026 年 3 月在代码和 Agent 能力上迭代最快的厂商之一。M2 系列以约每月一个大版本的节奏迭代:
- MiniMax-M2.5(2026 年 2 月):SWE-bench Verified 80.2%,与 Claude Opus 4.6 处于同一梯队,完全开源,推理速度 100 tokens/秒,成本约 $0.30/百万 input tokens。
- MiniMax-M2.7(2026 年 3 月 18 日,最新旗舰):开启模型自我进化——M2.7 在研发过程中被部署为研究型 Agent,自行构建 RL 训练 Harness、运行评测、优化训练流程,形成"模型参与训练自己"的闭环。SWE-Pro 56.22%,GDPval-AA ELO 1495(开源模型最高),具备 Agent Teams(多智能体协作)原生能力。
1.7.3 推理成本的断崖式下降
| 时间 | 模型 | 输入价格($/1M tokens) |
|---|---|---|
| 2023年3月 | GPT-4 | ~$30 |
| 2024年5月 | GPT-4o | ~$5 |
| 2025年1月 | DeepSeek V3 | ~$0.27 |
| 2025年4月 | GPT-4.1 nano | ~$0.10 |
| 2026年3月 | MiniMax M2.5/M2.7 Lightning | ~$0.30(output $2.40) |
这条曲线意味着,原来只有大企业才负担得起的 AI 能力,开始对个人开发者和小型公司全面开放。
1.8 技术演进的完整脉络
1.9 几条清晰的趋势线
规模与效率的再平衡:从 GPT-1 的 1.17 亿参数,到 GPT-3 的 1750 亿,"规模即能力"是这条路线的基本假设。但 DeepSeek 的出现打破了这个简单逻辑——MoE 架构让模型可以拥有万亿级总参数,但每次推理只激活其中很小一部分;算法优化让同等性能所需的算力持续下降。规模还在扩大,但效率成了同等重要的维度。
推理能力的范式转移:o1 出现之前,提升模型能力的主要方式是训练更大的模型。o1 之后,"推理时计算"(test-time compute)成了新的变量——同一个模型,花更多时间思考,能解决更难的问题。到 2026 年,RL 大规模扩展进一步成为新的训练范式:DeepSeek、MiniMax 等在数十万个真实任务环境中做强化学习训练。MiniMax M2.7 更进一步,实现了模型参与自身迭代的闭环,官方称之为"开启递归式自我进化"。
能力阶梯:文本生成 → 指令遵循 → 多模态 → 推理 → 自主行动(Agent)。每个阶段不只是量变,而是解锁了新的使用场景。Agent 是当前这个阶段的核心命题,模型开始从"回答问题"走向"完成任务"。
开源加速:LLaMA 的出现开启了开源追赶,DeepSeek R1 把这条曲线变得更陡。2025 年,开源模型在大多数通用任务上已经接近甚至超过两年前的闭源顶尖模型。开源和闭源之间的差距,从"代差"压缩到了"月差"。
成本断崖:2020 年调用 GPT-3 是奢侈的事,2025 年的 API 成本已经便宜到可以忽略不计。这条成本曲线,直接决定了 AI 能渗透到哪些应用场景。
1.10 小结
| 阶段 | 时间 | 核心突破 | 标志性事件 |
|---|---|---|---|
| 奠基期 | 2017-2018 | Transformer 架构 | 《Attention is All You Need》 |
| 规模化期 | 2019-2020 | Scaling Law | GPT-3 涌现能力 |
| 对齐期 | 2021-2022 | RLHF 人类对齐 | ChatGPT 上线 |
| 爆发期 | 2023 | 开源生态 | LLaMA 开源 |
| 能力跃升期 | 2024 | 推理时计算 | o1 + DeepSeek V3 |
| Agent 化 | 2025-2026 | 自主行动能力 | MCP 协议 + 推理成本断崖 |
从 GPT-1 的 1.17 亿参数到今天,九年时间,"会续写文本"演变成了"能自主完成任务"。这条路比大多数人预期的都走得快。
现在站在 Agent 真正落地的入口——模型在推理,工具在调用,协议在打通,推理成本在下降,整个生态还在快速演化。