AI 与 ML 基础
您将学到什么
在本领域中,你将学习人工智能(AI)、机器学习(ML)、深度学习(DL)之间的关系,监督学习、无监督学习与强化学习的区别,以及推进 ML 项目的通用生命周期。这是占 AIF-C01 出题比例 20% 的基础领域,也是后续所有内容的根基。
要点
- AI ⊃ ML ⊃ DL 的包含关系 - AI 是最宽泛的概念,ML 是 AI 的一种方法,DL 是基于神经网络的一种 ML 方法
- 监督学习 - 从输入与正确答案(标签)的配对中学习。分为分类(categorical)与回归(numerical)
- 无监督学习 - 在没有正确标签的情况下发现数据的结构。聚类、降维、异常检测是其代表
- 强化学习 - 智能体与环境交互,学习使奖励最大化的行为
- ML 生命周期 - 数据采集 → 预处理 → 训练 → 评估 → 部署 → 监控的循环往复
- 过拟合(overfitting)- 在训练数据上拟合良好但在测试数据上性能下降的现象。需要采取措施保持泛化性能
- 推理(inference)- 向已训练的模型输入新数据以获得预测的处理过程。分为实时推理与批量推理
术语与概念
AI、机器学习、深度学习的关系
AI 是泛指「模仿人类智能行为的技术」的宽泛概念。ML 是「从数据中自动学习规则」的一种 AI 方法,DL 是「使用多层神经网络」的一种 ML 方法。生成式 AI 绝大多数都是 DL 的应用。
强化学习(Reinforcement Learning)
智能体(学习者)针对环境选择行为,并以使所获奖励最大化为目标学习策略的方法。它被应用于游戏 AI、机器人控制、推荐优化以及生成式 AI 的 RLHF(基于人类反馈的强化学习)。
过拟合与泛化
过拟合是指对训练数据拟合过度,导致在未知数据上性能下降的现象。可通过增加数据量、正则化、Dropout、交叉验证等方法防止。相反,欠拟合(underfitting)是指模型过于简单,连训练数据都无法学好的状态。
推理(Inference)的方式
实时推理是针对每个 API 请求立即返回预测的方式(例如:聊天机器人)。批量推理是将成批数据集中处理的方式(例如:夜间对全部客户进行购买预测)。实时推理的优点是低延迟,批量推理的优点是处理大量数据时成本效率高。
检验理解程度
用 5 道题检验所学内容