AWS Certified AI Practitioner · 占考试 20%

AI 与 ML 基础

您将学到什么

在本领域中,你将学习人工智能(AI)、机器学习(ML)、深度学习(DL)之间的关系,监督学习、无监督学习与强化学习的区别,以及推进 ML 项目的通用生命周期。这是占 AIF-C01 出题比例 20% 的基础领域,也是后续所有内容的根基。

要点

  • AI ⊃ ML ⊃ DL 的包含关系 - AI 是最宽泛的概念,ML 是 AI 的一种方法,DL 是基于神经网络的一种 ML 方法
  • 监督学习 - 从输入与正确答案(标签)的配对中学习。分为分类(categorical)与回归(numerical)
  • 无监督学习 - 在没有正确标签的情况下发现数据的结构。聚类、降维、异常检测是其代表
  • 强化学习 - 智能体与环境交互,学习使奖励最大化的行为
  • ML 生命周期 - 数据采集 → 预处理 → 训练 → 评估 → 部署 → 监控的循环往复
  • 过拟合(overfitting)- 在训练数据上拟合良好但在测试数据上性能下降的现象。需要采取措施保持泛化性能
  • 推理(inference)- 向已训练的模型输入新数据以获得预测的处理过程。分为实时推理与批量推理

术语与概念

AI、机器学习、深度学习的关系

AI 是泛指「模仿人类智能行为的技术」的宽泛概念。ML 是「从数据中自动学习规则」的一种 AI 方法,DL 是「使用多层神经网络」的一种 ML 方法。生成式 AI 绝大多数都是 DL 的应用。

监督学习与无监督学习

监督学习从带标签的数据中学习,用于图像分类、销售额预测等。无监督学习从无标签数据中发现结构,用于客户分群、异常检测等。半监督学习则介于两者之间。

强化学习(Reinforcement Learning)

智能体(学习者)针对环境选择行为,并以使所获奖励最大化为目标学习策略的方法。它被应用于游戏 AI、机器人控制、推荐优化以及生成式 AI 的 RLHF(基于人类反馈的强化学习)。

过拟合与泛化

过拟合是指对训练数据拟合过度,导致在未知数据上性能下降的现象。可通过增加数据量、正则化、Dropout、交叉验证等方法防止。相反,欠拟合(underfitting)是指模型过于简单,连训练数据都无法学好的状态。

推理(Inference)的方式

实时推理是针对每个 API 请求立即返回预测的方式(例如:聊天机器人)。批量推理是将成批数据集中处理的方式(例如:夜间对全部客户进行购买预测)。实时推理的优点是低延迟,批量推理的优点是处理大量数据时成本效率高。

检验理解程度

用 5 道题检验所学内容