课程0基础Agent开发课 / 深度学习基础 / 深度学习基础导读
— 5 min read

深度学习基础导读

> **本章阅读时间**:约1小时(共6篇)

深度学习基础导读:从神经网络到Transformer的完整路径

本章阅读时间:约1小时(共6篇)

从理论到代码,理解深度学习的核心,弄清楚LLM背后的技术基础。


1.1 深度学习是什么

官方定义(来自 AWS):

Deep learning is an artificial intelligence (AI) method that teaches computers to process data in a way inspired by the human brain.

深度学习是一种人工智能方法,以受人脑启发的方式教计算机处理数据。

AWS 进一步说明:

The technology enables models to recognize complex patterns in pictures, text, sounds, and other data to generate accurate insights and predictions, automating tasks typically requiring human intelligence.

该技术使模型能够识别图片、文本、声音和其他数据中的复杂模式,生成准确的洞察和预测,自动化通常需要人类智能的任务。

深度学习 vs 传统机器学习(AWS 原文):

Deep learning excels at processing unstructured data, discovering hidden relationships, enabling unsupervised learning, and handling volatile datasets without requiring manually labeled training data variations.

深度学习擅长处理非结构化数据、发现隐藏关系、支持无监督学习,以及在不需要手动标注训练数据变体的情况下处理多变的数据集。

一句话理解:深度学习是机器学习的子集,使用多层神经网络处理数据——"深度"指的是神经网络的层数多。

1.1.1 深度学习的五大应用领域

领域 典型应用
计算机视觉 图像识别、目标检测、人脸识别
语音识别 语音助手、实时字幕、语音转文字
自然语言处理 聊天机器人、文档摘要、情感分析
推荐系统 个性化内容和商品推荐
生成式 AI 文档创作、代码建议、图像生成

1.1.2 深度学习与 LLM 的关系

LLM(大语言模型)是深度学习的具体应用:GPT、Claude、DeepSeek 等都是基于 Transformer 架构(一种深度神经网络)训练的。理解深度学习的基本原理,是理解 LLM 为什么会有幻觉、为什么 Temperature 影响输出的基础。


本章目标

学完本章,你能:

  • 理解神经网络的工作原理(加权求和、激活函数、反向传播)
  • 用PyTorch写一个神经网络并训练它
  • 理解CNN如何处理图像(为什么需要卷积)
  • 理解RNN/LSTM如何处理序列数据(以及为什么被Transformer取代)
  • 理解Transformer架构(LLM的基础,包括注意力机制)
  • 判断自己需要深入学习深度学习到什么程度

本章内容

文章 核心内容 阅读时间
01.神经网络基础 感知机、激活函数、前向传播、反向传播 约15分钟
02.PyTorch入门 张量(多维Excel表格)、自动求导、训练循环 约15分钟
03.CNN图像识别 卷积(滑动放大镜)、池化、层次特征 约12分钟
04.RNN与序列模型 RNN有记忆的阅读器、LSTM门控机制 约13分钟
05.Transformer架构 注意力机制(考试划重点)、多头注意力 约15分钟
06.深度学习与LLM的关系 不同角色需要懂多少深度学习 约8分钟

环境准备

bash
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpu
pip install matplotlib numpy

有GPU(Graphics Processing Unit,图形处理器,因其强大的并行计算能力而成为深度学习训练的主要硬件)的话:

bash
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118

本章定位

本章是入门级实战

目标不是让你成为深度学习专家,而是:

  1. 能看懂深度学习代码
  2. 理解LLM的技术根基
  3. 为第16章模型微调打基础

学习路径提示:如果你走的是路径A(Agent应用开发),可以跳过本章,直接从第6章LLM基础开始。本章是**路径B(完整AI工程师)**的必读内容。如果时间有限,可以只读第05篇《Transformer架构详解》和第06篇《深度学习与LLM的关系》,对理解LLM工作原理最有帮助,约23分钟。


本章的学习重点

如果你要从本章选择最值得深读的内容:

最重要:第05篇 Transformer——这是所有LLM(GPT/Claude/Llama等)的基础架构,理解它能让你真正理解大模型在做什么。

次重要:第01篇 神经网络基础——理解神经元、激活函数、前向/反向传播,是理解所有深度学习的基础。

了解即可:第03篇CNN和第04篇RNN——它们是Transformer出现之前的主流方案,理解它们能帮你理解Transformer为什么要那样设计。

本页目录