深度学习基础导读
> **本章阅读时间**:约1小时(共6篇)
深度学习基础导读:从神经网络到Transformer的完整路径
本章阅读时间:约1小时(共6篇)
从理论到代码,理解深度学习的核心,弄清楚LLM背后的技术基础。
1.1 深度学习是什么
官方定义(来自 AWS):
Deep learning is an artificial intelligence (AI) method that teaches computers to process data in a way inspired by the human brain.
深度学习是一种人工智能方法,以受人脑启发的方式教计算机处理数据。
AWS 进一步说明:
The technology enables models to recognize complex patterns in pictures, text, sounds, and other data to generate accurate insights and predictions, automating tasks typically requiring human intelligence.
该技术使模型能够识别图片、文本、声音和其他数据中的复杂模式,生成准确的洞察和预测,自动化通常需要人类智能的任务。
深度学习 vs 传统机器学习(AWS 原文):
Deep learning excels at processing unstructured data, discovering hidden relationships, enabling unsupervised learning, and handling volatile datasets without requiring manually labeled training data variations.
深度学习擅长处理非结构化数据、发现隐藏关系、支持无监督学习,以及在不需要手动标注训练数据变体的情况下处理多变的数据集。
一句话理解:深度学习是机器学习的子集,使用多层神经网络处理数据——"深度"指的是神经网络的层数多。
1.1.1 深度学习的五大应用领域
| 领域 | 典型应用 |
|---|---|
| 计算机视觉 | 图像识别、目标检测、人脸识别 |
| 语音识别 | 语音助手、实时字幕、语音转文字 |
| 自然语言处理 | 聊天机器人、文档摘要、情感分析 |
| 推荐系统 | 个性化内容和商品推荐 |
| 生成式 AI | 文档创作、代码建议、图像生成 |
1.1.2 深度学习与 LLM 的关系
LLM(大语言模型)是深度学习的具体应用:GPT、Claude、DeepSeek 等都是基于 Transformer 架构(一种深度神经网络)训练的。理解深度学习的基本原理,是理解 LLM 为什么会有幻觉、为什么 Temperature 影响输出的基础。
本章目标
学完本章,你能:
- 理解神经网络的工作原理(加权求和、激活函数、反向传播)
- 用PyTorch写一个神经网络并训练它
- 理解CNN如何处理图像(为什么需要卷积)
- 理解RNN/LSTM如何处理序列数据(以及为什么被Transformer取代)
- 理解Transformer架构(LLM的基础,包括注意力机制)
- 判断自己需要深入学习深度学习到什么程度
本章内容
| 文章 | 核心内容 | 阅读时间 |
|---|---|---|
| 01.神经网络基础 | 感知机、激活函数、前向传播、反向传播 | 约15分钟 |
| 02.PyTorch入门 | 张量(多维Excel表格)、自动求导、训练循环 | 约15分钟 |
| 03.CNN图像识别 | 卷积(滑动放大镜)、池化、层次特征 | 约12分钟 |
| 04.RNN与序列模型 | RNN有记忆的阅读器、LSTM门控机制 | 约13分钟 |
| 05.Transformer架构 | 注意力机制(考试划重点)、多头注意力 | 约15分钟 |
| 06.深度学习与LLM的关系 | 不同角色需要懂多少深度学习 | 约8分钟 |
环境准备
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpu
pip install matplotlib numpy
有GPU(Graphics Processing Unit,图形处理器,因其强大的并行计算能力而成为深度学习训练的主要硬件)的话:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
本章定位
本章是入门级实战。
目标不是让你成为深度学习专家,而是:
- 能看懂深度学习代码
- 理解LLM的技术根基
- 为第16章模型微调打基础
学习路径提示:如果你走的是路径A(Agent应用开发),可以跳过本章,直接从第6章LLM基础开始。本章是**路径B(完整AI工程师)**的必读内容。如果时间有限,可以只读第05篇《Transformer架构详解》和第06篇《深度学习与LLM的关系》,对理解LLM工作原理最有帮助,约23分钟。
本章的学习重点
如果你要从本章选择最值得深读的内容:
最重要:第05篇 Transformer——这是所有LLM(GPT/Claude/Llama等)的基础架构,理解它能让你真正理解大模型在做什么。
次重要:第01篇 神经网络基础——理解神经元、激活函数、前向/反向传播,是理解所有深度学习的基础。
了解即可:第03篇CNN和第04篇RNN——它们是Transformer出现之前的主流方案,理解它们能帮你理解Transformer为什么要那样设计。