加餐-AWS权威定义速查手册
> **本文适合谁**:读完第1章基础文章后,想要一份"官方版"定义对照表的读者。AWS(亚马逊云服务)是全球最大的云服务商之一,他们整理的 AI 概念定义准确、权威,适合作为参考。
加餐:AWS 权威定义速查手册
本文适合谁:读完第1章基础文章后,想要一份"官方版"定义对照表的读者。AWS(亚马逊云服务)是全球最大的云服务商之一,他们整理的 AI 概念定义准确、权威,适合作为参考。
使用方式:不需要从头到尾读完,当你在课程中遇到某个名词想查官方定义时,来这里找就行。
本文阅读时间:约20分钟(全读);按需查阅随时可用
概念层级关系
AI(人工智能)
└── 机器学习(Machine Learning)
└── 深度学习(Deep Learning)
└── 神经网络(Neural Network)
└── Transformer(转换器)
└── LLM(大语言模型)
├── RAG(检索增强生成)
└── Agent(AI 代理)
1. 机器学习(Machine Learning)
官方定义:
"机器学习是一种无需明确指令即可执行数据分析任务的人工智能。"更完整的表述是:ML 是 AI 的分支,"利用数据和算法使人工智能系统能够以与人类相似的方式进行学习和改进"。
工作原理:机器学习遵循循环流程:
- 数据预处理:清理和转换原始数据,处理缺失值、标准化格式
- 模型训练:算法以迭代方式识别输入与输出间的数学关联,调整参数以减少预测误差
- 模型评估:使用验证集测试泛化能力,衡量准确度
- 优化:通过特征工程和参数调整提升性能
- 部署与监控:持续收集反馈确保模型相关性
主要类型:
- 有监督学习:使用标注数据,适合分类和预测
- 无监督学习:处理未标注数据,发现隐藏模式
- 半监督学习:结合少量标注和大量未标注数据
- 强化学习:通过奖励机制优化决策
- 深度学习:利用人工神经网络处理复杂任务
应用场景:医疗诊断、金融欺诈检测、零售推荐系统、制造业预测性维护、媒体内容个性化、计算机视觉识别等。
概念关系:机器学习是人工智能的子集;深度学习是机器学习的特殊形式,采用神经网络结构;特征工程和 MLOps 是实施机器学习的关键支撑工具。
2. 深度学习(Deep Learning)
官方定义:
"深度学习是一种人工智能(AI)方法,用于教计算机以受人脑启发的方式处理数据。"该方法能够识别复杂的图片、文本、声音等数据模式,生成准确的见解和预测。
工作原理:深度学习通过多层神经网络结构实现:
- 输入层:接收原始数据的节点
- 隐藏层:执行多层级信息处理,"在不同层级处理信息,在接收新信息时调整其行为"
- 输出层:生成预测或生成新数据
以图像分类为例,各层依次识别边缘、纹理、物体特征等,逐层深化理解。
主要应用方向:
- 计算机视觉:图像分类、面部识别、内容审核
- 语音识别:语音转文本、虚拟助手
- 自然语言处理:聊天机器人、文档总结
- 推荐引擎:个性化内容推荐
- 生成式AI:创造新内容
概念关系:深度学习是机器学习的子集,相比传统机器学习,深度学习"可以理解非结构化数据并进行一般观察,而无需手动提取特征"。深度学习技术是现代生成式AI的基础。
3. 神经网络(Neural Network)
官方定义:
"神经网络是一种人工智能(AI)方法,用于教计算机以受人脑启发的方式处理数据。"它属于"机器学习过程,称为深度学习,使用类似于人脑的分层结构中的互连节点或神经元"。
基本架构:
- 输入层:接收外部数据并进行初步处理
- 隐藏层:对前一层输出进行分析和进一步处理(可有多层)
- 输出层:提供最终处理结果
学习机制:通过反向传播算法,"节点将为引发更正确猜测的路径分配更高的权重值,而为引发不正确猜测的节点路径分配更低的权重值"。
主要类型:
- 前馈神经网络:单向数据流
- 卷积神经网络(CNN):执行特定数学函数,适合图像分类
- 深度神经网络:多隐藏层,包含数百万个互联神经元
概念关系:层级关系为 AI → 机器学习 → 深度学习。深度学习是机器学习的子集,相比传统方法,"深度学习网络自行推导特征,并且更独立地学习",能处理非结构化数据。
4. 强化学习(Reinforcement Learning)
官方定义:
"强化学习 (RL) 是一种机器学习 (ML) 技术,可训练软件做出决策以获得最佳结果。它模仿了人类为实现目标所采取的反复试验的学习过程。"
工作原理:
- 代理在环境中采取行动,获得奖励或惩罚反馈
- 算法从每次操作的反馈中学习,识别哪些行为导向目标
- 基于 Markov 决策过程,通过反复试验构建策略规则
- 在"勘探-开采权衡"中做出选择:继续探索或使用已知高奖励行动
主要类型:
- 基于模型的 RL:代理先构建环境内部表示,然后模拟最优行动序列
- 无模型 RL:代理直接在复杂、变化的环境中通过试错学习,为状态-行动对评分
应用场景:个性化营销和推荐系统、云成本优化、金融市场预测和交易策略、自动驾驶汽车训练。
概念关系:与有监督学习不同,RL 无需人工标记数据;与无监督学习不同,RL 有明确的预设目标。强化学习也是训练大型语言模型的核心技术之一(RLHF:基于人类反馈的强化学习)。
5. 大型语言模型(Large Language Model / LLM)
官方定义:
"大型语言模型,也称为 LLM,是基于大量数据进行预训练的超大型深度学习模型。"其核心架构采用转换器(Transformer),由"具有自注意力功能的编码器和解码器组成",能够"从一系列文本中提取含义,并理解其中的单词和短语之间的关系"。
关键机制:
- 词向量表示:使用多维向量(单词嵌入)表示单词,使相似含义的词在向量空间中彼此接近
- 并行处理:转换器"并行处理整个序列",相比循环神经网络大幅缩短训练时间
- 自学机制:通过自监督学习调整模型参数,预测序列中的下一个词
主要组成部分:
- 数十亿个参数的神经网络层
- 编码器(理解含义)与解码器(生成输出)
- 训练数据源(互联网、Common Crawl、维基百科等)
应用场景:文案写作、知识问答、文本分类、代码生成、文档总结、机器翻译。
概念关系:LLM 是深度学习的具体应用;是实现"根据人类语言输入提示生成内容"的基础技术;核心架构是 Transformer。
6. Transformer(转换器)
官方定义:
"转换器是一种将输入序列转换或更改为输出序列的神经网络架构。它们通过学习上下文和跟踪序列组件之间的关系来做到这一点。"
工作原理:转换器采用创新的自注意力机制改进了传统编码器/解码器模式:
- 传统方法:按顺序处理数据,速度慢且容易丢失长距离上下文
- 转换器方式:"使模型能够同时查看序列的不同部分,并确定哪些部分最重要"
- 通过并行计算处理整个序列,大幅减少训练时间
主要组成部分:
- 输入嵌入:将标记转换为数学向量
- 位置编码:添加序列位置信息
- 转换器数据块:包含多头自注意力和前馈神经网络
- 线性层与 Softmax:生成最终概率分布
概念关系:
- vs RNN:转换器并行处理,具有更高的可扩展性,"在很大程度上取代了 RNN"用于 NLP 任务
- vs CNN:CNN 专为图像设计;转换器处理序列数据
- Transformer 是现代 LLM(如 GPT、BERT)的核心架构基础
7. 检索增强生成(Retrieval-Augmented Generation / RAG)
官方定义:
"检索增强生成(RAG)是指对大语言模型输出进行优化,使其能够在生成响应之前引用训练数据来源之外的权威知识库。"这是一种在不重新训练模型的前提下,将新数据引入 LLM 的经济高效方法。
工作原理:
- 创建外部数据:将来自 API、数据库或文档存储库的新数据转换为数字表示形式,存储在向量数据库中
- 检索相关信息:用户查询转换为向量形式,与向量数据库匹配以找到最相关的文档
- 增强 LLM 提示:将检索到的数据添加到用户输入的上下文中,使用提示工程技术优化沟通
- 更新外部数据:通过异步更新或定期批处理维护信息的时效性
主要好处:
- 经济高效:避免重新训练模型的高成本
- 信息更新:可连接实时数据源,保持内容最新
- 可追溯性:输出包含来源引用,增强信任度
- 开发者控制:可灵活调整信息来源和权限设置
概念关系:RAG 与语义搜索互补;依赖向量数据库存储和检索外部知识;是解决 LLM"幻觉"问题和知识截止限制的核心技术方案。
8. AI 代理(AI Agents)
官方定义:
"人工智能 (AI) 代理是一种软件程序,它可以与其环境进行交互,收集数据,并使用这些数据来执行满足预定目标的自主任务。"其核心特点是"人类设定目标,但人工智能代理会独立选择实现这些目标所需的最佳行动"。
工作原理:
- 确定目标:接收用户指令,将其分解为可操作的子任务
- 获取信息:通过 API、互联网或与其他系统交互收集所需数据
- 执行任务:按序完成任务并评估是否实现预定目标
主要类型:
| 类型 | 特点 |
|---|---|
| 简单反射型 | 基于预定义规则运行 |
| 基于模型的反射型 | 评估可能结果和后果 |
| 基于目标的代理 | 比较不同方案选择最优路径 |
| 基于效用的代理 | 最大化用户奖励 |
| 学习代理 | 从过往经验持续改进 |
| 多代理系统 | 多个代理相互协作解决复杂问题 |
架构关键组成部分:基础模型(LLM)、规划模块、内存模块、工具集成、学习和反思机制。
概念关系:AI 代理以 LLM 为核心推理引擎,结合工具调用能力实现自主行动;与简单的 LLM 调用不同,代理能够主动规划、执行多步骤任务并处理环境反馈。
9. 代理式 AI(Agentic AI)
官方定义:
"代理式人工智能是自主的人工智能系统,可以独立行动,以实现预定目标。"与传统软件和传统 AI 不同,代理式 AI "具有主动性,可以在没有持续人工监督的情况下执行复杂的任务。"
工作原理:代理式 AI 通过四大阶段运作:
- 感知阶段:从多种源收集实时数据,摄取结构化、半结构化和非结构化数据
- 推理阶段:由大语言模型驱动,制定行动计划并实时调整
- 行动阶段:直接与第三方应用交互执行子任务
- 学习阶段:利用强化学习技术不断完善行动效果
主要类型:
- 单代理设置:单个 AI 代理按顺序处理所有任务
- 多代理设置:横向多代理(各具专长)或纵向多代理(分层结构)
概念关系:Agentic AI 是 AI Agents 概念的延伸,强调的是系统整体具备自主性的特征;相比传统 AI 需要"提示和分步指导",代理式 AI 体现了目标驱动的自主性。
10. 提示工程(Prompt Engineering)
官方定义:
"提示工程是指引生成式人工智能(生成式 AI)解决方案生成所需输出的过程。"在这个过程中,通过"选择最合适的格式、短语、单词和符号,以指导 AI 与用户进行更有意义的交互。"
工作原理:
- 输入设计:精心构思自然语言提示,为大型语言模型提供明确的指令和背景
- 意图建立:通过有效提示为 AI 建立上下文,帮助其"理解用户的意图"
- 迭代优化:"不断完善提示,直到从人工智能系统中获得所需的结果"
主要技术类型:
- 思维链提示(Chain-of-Thought):分解复杂问题,逐步推理
- 思维树提示(Tree-of-Thought):多路径推理
- 生成式知识提示:先生成事实再补全
- 由易至难提示:子问题递进式解决
- 自我完善提示:迭代修正
概念关系:提示工程是使用 LLM 的基础技能,也是 RAG、Agent 开发中的关键环节。
11. 向量数据库(Vector Databases)
官方定义:
"向量数据库能够将向量存储为高维点并进行检索。这些数据库增加了额外的功能,可以高效、快速地查找 N 维空间中的最近邻。"
核心机制是:嵌入模型将各类数据编码为向量以捕捉语义含义,向量数据库则提供高效检索能力。
工作原理:
- 数据融合:将嵌入模型生成的向量导入数据库
- 索引构建:采用 k-NN 索引,通常利用 HNSW 或 IVF 算法
- 相似度查询:通过余弦等距离函数找到相邻向量
- 结果排序:按相似度对检索结果进行排序
应用场景:视觉搜索、语义搜索与多模态检索、生成式 AI 知识库、推荐系统与对话式搜索。
概念关系:向量数据库是 RAG 系统的核心基础设施,依赖**嵌入(Embeddings)**技术将文本转化为可检索的向量;通过提供外部知识库,解决大型语言模型的"幻觉"问题。
12. 嵌入(Embeddings in Machine Learning)
官方定义:
"嵌入是真实世界对象的数字表示,机器学习和人工智能系统像人类一样使用这些对象来理解复杂的知识领域。"嵌入将复杂的真实世界数据转换成"复杂的数学表示,以捕捉真实世界数据之间的固有属性和关系"。
工作原理:核心机制是将高维数据转化为低维向量表示,简化了机器学习算法对复杂数据的处理。
主要技术:
- 主成分分析(PCA):将复杂数据简化为低维向量
- 奇异值分解(SVD):通过矩阵变换保留语义关系
- Word2Vec:关联单词并创建嵌入空间表示
- BERT:基于转换器的语言模型,可区分单词上下文含义
应用场景:计算机视觉(对象检测和图像识别)、自然语言处理(理解单词上下文和关系)、推荐系统(识别项目间的相似性)。
概念关系:嵌入是向量数据库存储和检索的基本数据单元;神经网络的隐藏层学习自动创建嵌入;嵌入提高 LLM 训练数据质量,支持迁移学习和模型微调。
13. 生成式 AI(Generative AI)
官方定义:
"生成式人工智能是一种可用于创建新的内容和想法(包括对话、故事、图像、视频和音乐)的人工智能。"它能学习人类语言、编程语言、艺术等复杂主题,并重复利用已知知识解决新问题。
工作原理:
- 基础模型训练:在广泛未标记数据上预训练的超大型机器学习模型
- 模式识别:学习数据特征的分布及其关系
- 序列预测:根据前文内容预测下一个项目
- 概率选择:使用概率分布技术选择生成内容
主要技术类型:
- 扩散模型:通过迭代添加/去除噪点生成新数据(如 Stable Diffusion)
- 生成式对抗网络(GAN):生成器与辨别器竞争训练
- 变分自动编码器(VAE):学习紧凑数据表示的潜在空间
- 基于转换器的模型:采用自注意力机制处理序列数据(如 GPT 系列)
概念关系:生成式人工智能是人工智能的子集,专注于生成新内容;LLM 是基础模型的一种,专门处理语言任务;生成式 AI 建立在深度学习技术之上,尤其依赖 Transformer 架构。
14. 计算机视觉(Computer Vision)
官方定义:
"计算机利用计算机视觉这项技术自动识别图像,并准确、高效地描述这些图像。"该技术运用"人工智能和机器学习 (AI/ML) 来准确处理数据,进行对象识别和面部识别,以及分类、推荐、监控和检测"。
工作原理:
- 数据输入:计算机科学家通过输入大量图像信息来训练系统
- 模式识别:机器学习算法识别图像中的常见模式
- 迭代学习:处理数百万张图像后建立识别模式
- 精准预测:利用学到的知识准确识别未知图像
核心技术:
- 深度学习:使用多层神经网络自动处理图像数据
- 卷积神经网络(CNN):通过像素标签和数学运算实现图像分类
- 循环神经网络(RNN):分析视频序列,识别图像间的联系
应用场景:安全监控、工业质检、自动驾驶、农业监测、医疗诊断。
概念关系:计算机视觉是深度学习最重要的应用领域之一,CNN 是其核心技术基础。vs 图像处理:图像处理改变图像(锐化、增强等),而计算机视觉理解图像内容并执行任务。
15. 自然语言处理(Natural Language Processing / NLP)
官方定义:
"自然语言处理(NLP)是一种可让计算机解释、操纵和理解人类语言的技术。"它使组织能够从电子邮件、短信、社交媒体等多种渠道的非结构化文本和语音数据中提取可行的商业见解。
工作原理:NLP 的实现过程包括三个主要阶段:
- 预处理:使用分词、词干处理和删除停用词等技术准备数据
- 训练:利用机器学习模型处理大量预处理数据,提高算法准确性
- 部署和推理:将模型集成到生产环境中,对实时数据进行处理和预测
主要组成部分:
- 分词(Tokenization):将文本切分为词或子词单元
- 词干处理(Stemming):将单词还原为词干形式
- 停用词过滤:去除无意义的高频词
- 词向量/嵌入:将词语转化为数学向量表示
- 语言模型:预测词语序列的概率分布
应用场景:敏感数据保护、客户服务(聊天机器人)、情感分析、文档处理。
概念关系:NLP 是深度学习的核心应用领域之一,Transformer 架构是现代 NLP 的技术基础。LLM 可视为 NLP 发展的最新形态——从规则系统到统计模型,再到神经网络,最终演化为基于 Transformer 的预训练大模型。
16. MLOps(机器学习运维)
官方定义:
"机器学习运维(MLOps)是一组用于自动化和简化机器学习(ML)工作流程和部署的实践。"它整合了 ML 应用程序开发与系统部署运维,在整个机器学习生命周期中实现流程的自动化和标准化。
工作原理:MLOps 遵循完整的生命周期流程:
- 数据准备:从多个来源获取数据,执行聚合、清理和特征工程
- 模型训练与验证:使用数据训练和验证机器学习模型
- 部署:将经过验证的模型部署为预测服务供其他应用访问
- 持续监控与再训练:根据实时数据反馈不断优化模型
四大原则:
- 版本控制:跟踪 ML 资产变更,确保可再现性和可审计性
- 自动化:自动执行管道各阶段,从数据摄取到部署
- 连续X(Continuous X):包括持续集成(CI)、持续交付(CD)、持续训练(CT)和持续监控
- 模型治理:跨团队协作、数据安全和合规性管理
概念关系:MLOps vs DevOps:DevOps 侧重代码交付;MLOps 专为 ML 项目设计,处理"数据收集、模型训练、验证、部署以及持续监控和再训练"的独特挑战。MLOps 是机器学习从实验室走向生产环境的工程化桥梁。
概念索引
| 概念 | 所在章节 | 一句话 |
|---|---|---|
| 机器学习 | 第1章、第4章 | 让机器从数据中学习规律,无需手写规则 |
| 深度学习 | 第1章、第5章 | 机器学习的子集,用多层神经网络自动学特征 |
| 神经网络 | 第1章、第5章 | 模仿大脑神经元连接的数学函数网络 |
| 强化学习 | 第1章 | 通过奖惩反馈学习最优决策,RLHF 训练 LLM 的关键 |
| LLM | 第1章、第6章 | 超大 Transformer,预测下一个词,能力从规模中涌现 |
| Transformer | 第1章、第5章、第6章 | 用注意力机制同时关注所有词,现代 LLM 的基础 |
| RAG | 第1章、第11章 | 让 LLM 先查资料再回答,解决幻觉和知识截止问题 |
| AI Agents | 第1章、第12章 | 自主完成多步骤任务的 AI 程序,本课程核心主题 |
| Agentic AI | 第1章、第12章 | 具备自主性的 AI 系统,AI Agents 的延伸概念 |
| 提示工程 | 第8章 | 设计有效指令引导 LLM 输出的工程方法 |
| 向量数据库 | 第11章 | 存储和检索高维向量的专用数据库,RAG 的基础设施 |
| 嵌入 | 第6章、第11章 | 把文字/图片等转成数字向量,让机器能做语义计算 |
| 生成式AI | 第1章 | 能创造新内容(文字/图像/音频)的 AI 技术总称 |
| 计算机视觉 | 第5章 | 让计算机理解图像内容的技术,CNN 是核心 |
| NLP | 第5章、第6章 | 让计算机理解人类语言的技术,LLM 是最新形态 |
| MLOps | 第17章 | 把 ML 模型稳定部署到生产环境的工程实践 |