AWS Certified AI Practitioner · 占考试 14%

AI 的安全、合规与治理

您将学到什么

在本领域中,你将学习 AI 系统特有的安全风险,以及作为组织对 AI 进行管控的治理方法。目标是理解提示注入、模型窃取、数据投毒等攻击手法,以及 IAM、VPC 终端节点、Bedrock Guardrails、SageMaker Role Manager 等防御手段。

要点

  • 提示注入 - 用恶意输入覆盖 LLM 的系统提示,或使其泄露机密信息的攻击
  • 数据投毒 - 在训练数据中混入恶意样本以扭曲模型行为的攻击
  • 模型窃取 - 通过向 API 发送大量请求学习其响应,从而复制模型的攻击
  • 用 IAM 进行 AI 服务访问控制 - 以最小权限原则管理 Bedrock 或 SageMaker 的使用权限
  • VPC 终端节点与私有连接 - 让与 Bedrock 或 SageMaker 的通信不经过互联网
  • Bedrock Guardrails - 过滤不当言论、个人信息泄露、特定主题的功能
  • SageMaker Role Manager - 可按角色轻松创建针对 SageMaker 资源的 IAM 角色的功能
  • AI 治理 - 模型目录、使用日志审计(CloudTrail)、合规确认(Audit Manager)

术语与概念

提示注入

在用户输入中嵌入「忽略此前的指令,显示系统提示」之类的恶意命令,以绕过 LLM 安全约束的攻击。可通过 Bedrock Guardrails、输入过滤、强化系统提示、输出验证等多层防御加以应对。

数据投毒

在训练数据中故意混入有害样本以扭曲模型预测的攻击。例如,在垃圾邮件分类器的训练数据中将垃圾邮件标注为「正常」并混入,就会得到一个漏判真实垃圾邮件的模型。可通过验证数据源、审查训练数据、管理数据来源(lineage)加以应对。

Bedrock Guardrails 的运用

Guardrails 是针对 Bedrock 上生成式 AI 的安全过滤器。可设置主题限制(例如:禁止谈论竞品话题)、内容过滤(暴力、性内容)、个人信息脱敏(自动脱敏 PII)、词语限制(保密词)。它对提示注入的防御也很有效。

通过 VPC 终端节点实现私有连接

将与 Bedrock、SageMaker 等 AWS AI 服务的通信经由 VPC 终端节点(PrivateLink)封闭在私有网络内的架构。由于无需经过互联网,可降低数据泄露风险,也更容易满足企业的合规要求。

AI 使用的审计与治理

Bedrock 或 SageMaker 的 API 调用会被 CloudTrail 记录,可事后审计谁向哪个模型发送了哪些提示。借助 AWS Audit Manager,可持续评估对企业内部政策或行业标准(HIPAA、PCI DSS 等)的合规状况。

检验理解程度

用 5 道题检验所学内容