AI 的安全、合规与治理
您将学到什么
在本领域中,你将学习 AI 系统特有的安全风险,以及作为组织对 AI 进行管控的治理方法。目标是理解提示注入、模型窃取、数据投毒等攻击手法,以及 IAM、VPC 终端节点、Bedrock Guardrails、SageMaker Role Manager 等防御手段。
要点
- 提示注入 - 通过混入输入中的指令覆盖应用侧的指令(系统提示),使模型做出非预期行为的攻击。旨在绕过模型自身安全策略的手法则称为越狱(jailbreak),二者应加以区分
- 数据投毒 - 在训练数据中混入恶意样本以扭曲模型行为的攻击
- 模型窃取 - 通过向 API 发送大量请求学习其响应,从而复制模型的攻击
- 用 IAM 进行 AI 服务访问控制 - 以最小权限原则管理 Bedrock 或 SageMaker 的使用权限
- VPC 终端节点与私有连接 - 让与 Bedrock 或 SageMaker 的通信不经过互联网
- Bedrock Guardrails - 过滤不当言论、个人信息泄露、特定主题的功能
- SageMaker Role Manager - 可按角色轻松创建针对 SageMaker 资源的 IAM 角色的功能
- AI 治理 - 模型目录、API 调用审计(CloudTrail)、输入输出内容记录(Bedrock 的模型调用日志记录)、合规确认(Audit Manager)
术语与概念
提示注入
在用户输入中混入「忽略此前的指令」之类的命令,覆盖应用侧设定的指令、使模型做出非预期行为的攻击。而借助角色扮演等手段绕过模型自身的安全策略、诱导其生成本应被拒绝的有害输出的手法则称为越狱(jailbreak),二者按突破的对象加以区分。两者都可通过 Bedrock Guardrails、输入过滤、强化系统提示、输出验证等多层防御加以应对。
数据投毒
在训练数据中故意混入有害样本以扭曲模型预测的攻击。例如,在垃圾邮件分类器的训练数据中将垃圾邮件标注为「正常」并混入,就会得到一个漏判真实垃圾邮件的模型。可通过验证数据源、审查训练数据、管理数据来源(lineage)加以应对。
Bedrock Guardrails 的运用
Guardrails 是针对 Bedrock 上生成式 AI 的安全过滤器。可设置主题限制(例如:禁止谈论竞品话题)、内容过滤(暴力、性内容)、个人信息脱敏(自动脱敏 PII)、词语限制(保密词)。它对提示注入的防御也很有效。
通过 VPC 终端节点实现私有连接
将与 Bedrock、SageMaker 等 AWS AI 服务的通信经由 VPC 终端节点(PrivateLink)封闭在私有网络内的架构。由于无需经过互联网,可降低数据泄露风险,也更容易满足企业的合规要求。
AI 使用的审计与治理
Bedrock 或 SageMaker 的 API 调用会被记录到 CloudTrail 中,可事后审计谁在何时调用了哪个模型。不过 CloudTrail 记录的仅限 API 调用的元数据,不包含提示和响应的内容。若希望连内容一并审计,需要启用默认处于关闭状态的 Bedrock 模型调用日志记录,并将其输出到 CloudWatch Logs 或 S3。此外,借助 AWS Audit Manager,还可持续评估对企业内部政策或行业标准(HIPAA、PCI DSS 等)的合规状况。
检验理解程度
用 5 道题检验所学内容