课程0基础Agent开发课 / AI伦理与安全 / AI伦理与安全导读
— 4 min read

AI伦理与安全导读

> **本章阅读时间**:约1小时(共4篇)

AI 伦理与安全导读:构建可信、负责任的 AI 系统

本章阅读时间:约1小时(共4篇)

技术越强大,责任越重大。

1.1 AI 伦理与安全是什么

AI 伦理(AI Ethics)是研究 AI 系统设计、开发和部署中道德问题的领域,核心关注:AI 系统是否公平、透明、可问责,以及是否尊重人类价值观和权利。

AI 安全(AI Safety)关注如何确保 AI 系统按预期行为,不产生有害后果,包括:

  • 技术安全:防止 Prompt 注入、数据泄露、模型被滥用
  • 对齐安全:确保 AI 行为符合人类意图和价值观
  • 生产安全:确保 AI 系统在真实环境中稳定、可靠、可控

Anthropic 的核心原则(来自 Anthropic 官方文档):Anthropic 的使命是"负责任地开发和维护先进的 AI,造福人类"。这体现在 Claude 的设计原则中:Helpful(有帮助)、Harmless(无害)、Honest(诚实)——三个原则有时相互冲突,需要在具体场景中权衡。

为什么开发者必须关心这个领域?

AI 伦理和安全不是"哲学家的事"或"安全团队的事"。作为开发者,你的每个设计决策都有伦理影响:训练数据的选择决定模型会学到什么偏见;系统提示的设计决定 AI 的行为边界;数据存储方式决定用户隐私保护程度。

先讲几件真实发生的事

2016 年,微软发布了一个叫 Tay 的 AI 聊天机器人,目标是通过与 Twitter 用户对话来学习人类语言。上线不到 24 小时,就被网络用户"调教"成了散播仇恨言论和歧视性内容的系统,微软被迫紧急下线。

2018 年,亚马逊内部测试发现,他们的 AI 简历筛选系统对女性存在系统性歧视。原因是训练数据来自过去 10 年该公司的招聘历史,历史上大多数技术岗录用的是男性,AI 就学到了这个偏见。这个系统从未公开上线,但如果不是内部测试发现,危害可能很大。

2023 年,一个律师在诉讼中引用了 ChatGPT 给出的案例法规,结果被法官发现那些"案例"根本不存在——是模型生成的看起来真实的虚假信息。律师受到了处分。

这些不是 AI 发展路上的小插曲,而是真实的、有人受伤的问题。而且随着 AI 被用到更多关键场景——医疗诊断、贷款审批、招聘筛选、司法辅助——这些问题的影响只会越来越大。

为什么开发者必须关心伦理与安全

很多技术人员觉得"伦理"是哲学家的事,"安全"是安全团队的事,自己只管写好代码。

这个想法是错的,而且可能在不知情的情况下造成真实的危害。

你做的每个设计决策都有伦理影响

训练数据的选择,决定了模型会学到什么样的偏见。如果训练数据里男性律师比女性律师多,模型可能认为"律师"默认是男性,给出性别歧视的建议。

系统提示的设计,决定了 AI 的行为边界。权限设计不当,AI 可能被诱导说出有害内容,或者泄露系统内部信息。

数据存储方式,决定了用户隐私保护程度。用户对话记录是否加密?保留多久?谁能访问?这些决策都在开发阶段做出。

Agent 的权限范围,决定了可能造成的危害。一个能发邮件、能访问文件的 Agent,如果被恶意注入了指令,能做什么?

你不了解这些问题,就可能在不知情的情况下构建了有害的系统。

本章内容:实用导向,不是说教

本章不是来给你讲大道理的,而是提供可以直接落地的工程实践。

文章 核心问题 阅读时间
01.AI 伦理核心原则 公平性、透明度、隐私——用代码落实这些原则 约20分钟
02.AI 安全攻防 提示注入、越狱、对抗样本——攻击原理和防御代码 约25分钟
03.AI 合规实践 GDPR、PIPL、生成式 AI 管理办法——法规要求和工程实现 约20分钟
04.Agent 安全与对齐 生产 Agent 的安全架构——工具权限、人工兜底、速率限制 约15分钟

开发者实践清单:先看这个

在深入每篇文章之前,先给你一个可以立即检查的清单。如果你正在开发 AI 应用,对照这个清单看看自己做了哪些:

偏见与公平

  • 你的训练数据是否覆盖了不同性别、年龄、地域的用户?
  • 模型在不同用户群体上的准确率差距是否超过 10%?
  • 如果你的系统用于招聘、贷款、医疗决策,是否做过公平性审计?

透明度与可解释性

  • 用户知道他们在和 AI 对话,而不是人工吗?
  • 高风险决策(拒绝贷款、医疗建议)能提供解释依据吗?
  • 如果 AI 出错,你能追溯是什么输入导致了什么输出吗?

隐私保护

  • 发送给 LLM 的内容是否过滤了手机号、身份证号等个人信息?
  • 用户的对话记录是否加密存储,保留期多长?
  • 是否有机制响应用户的"删除我的数据"请求?

安全防护

  • 你的 LLM 应用是否能防御"忽略之前所有指令"类的提示注入?
  • 如果 Agent 能发邮件、访问文件,是否有权限最小化机制?
  • 是否有速率限制防止 Agent 陷入无限循环消耗资源?

合规

  • 如果你的应用面向中国公众,是否了解《生成式 AI 管理办法》的要求?
  • 是否告知用户 AI 可能产生不准确的内容?
  • AI 生成的内容是否有明确标识?

从哪里开始

如果你的应用已经在生产,建议先读 04(Agent 安全),因为错误的 Agent 权限设计可能造成立即的危害。

如果你在设计新应用,从 01 开始,把伦理原则融入架构设计,比事后补救容易得多。

如果你的应用要上线,必须读 03(合规实践),了解监管要求,避免法律风险。

伦理不是可选项,而是可信 AI 系统的基础。

本页目录