生成式 AI 基础
您将学到什么
在本领域中,你将学习生成式 AI 的基础模型(Foundation Model)概念,Transformer 与 LLM 的特点,提示工程的基础,Retrieval-Augmented Generation(RAG)、微调等核心技术,以及令牌、上下文窗口、推理参数、嵌入等使用 LLM 时的基本概念。这是占 AIF-C01 出题比例 24% 的高频领域,也是当代 AI 应用的核心主题。
要点
- 基础模型(Foundation Model)- 在大规模数据上预训练、可迁移到多种任务的通用模型
- 大语言模型(LLM)- 处理文本的基础模型。OpenAI、Anthropic、Meta 各家的模型以及 Amazon 的 Nova 是其代表
- Transformer - 使用自注意力机制(self-attention)的架构,是当前 LLM 的标准结构
- 提示工程 - 设计指令文本(提示)以从 LLM 中引出期望输出的技术
- 零样本 / 少样本 - 不给示例 / 给少量示例让 LLM 执行任务的方法
- RAG(Retrieval-Augmented Generation)- 从外部知识库检索相关信息,加入到 LLM 的提示中以提升回答准确性
- 微调与预训练的区别 - 预训练是在大规模数据上从零开始学习,微调是将已有模型针对特定用途进行追加学习
- 幻觉 - LLM 将不符合事实的内容生成得似是而非的现象。可通过 RAG 或验证加以抑制
- 令牌与上下文窗口 - 令牌(token)是 LLM 处理文本的最小单位,上下文窗口是一次能处理的令牌数量上限
- 推理参数 - temperature 或 top-p 越低,输出越确定、越一致;越高,输出越多样、越有创造性
- 嵌入(Embedding)- 用数值向量表示文本语义的方式。与向量数据库结合可实现基于语义的相似度检索
- 生成结果的评估 - 摘要用 ROUGE、翻译用 BLEU 等,将与任务相应的自动评估指标和人工评估结合使用
术语与概念
基础模型(Foundation Model)
在大量通用数据上预训练,并可通过微调或提示应用于多种任务的大规模模型。其用途正在不断扩展,涵盖文本用的 LLM、图像生成、语音、多模态等。在 Bedrock 上可通过 API 使用多种基础模型。
提示工程
通过对提示 LLM 的指令文本进行精心设计,以引出期望输出的技术。包括指定角色(「你是一名医生」)、指定输出格式(「用 JSON 回答」)、提供示例(少样本)、引导逐步思考(Chain-of-Thought)等技巧。
RAG(Retrieval-Augmented Generation)
从外部知识库(企业内部文档、数据库等)检索与问题相关的信息,将这些信息加入 LLM 的提示后再生成回答的方法。它可以弥补 LLM 知识陈旧或不存在的信息,并抑制幻觉。通常与 Bedrock Knowledge Bases 或 Kendra 结合实现。
微调与预训练
预训练(pre-training)是在大规模数据上从零训练基础模型的过程,需要庞大的计算资源。微调是在已预训练的模型上,使用特定领域(法律、医疗等)的少量数据进行追加学习的过程,能够在控制成本的同时提升专业性。
幻觉(Hallucination)
LLM 将训练数据中没有的信息或与事实不符的内容生成得似是而非的现象。其原因在于模型「生成最自然接续的文字」的特性。可通过 RAG 提供依据、用护栏(Guardrails)验证输出、人工审核等方式抑制其影响。
令牌与上下文窗口
令牌(token)是 LLM 处理文本的最小单位,常常被切分得比单词更细,符号或单词的一部分也可能算作 1 个令牌。上下文窗口是模型在一次调用中能处理的令牌数量上限(输入 + 输出)。想处理超出上限的长文档时,惯用做法是先切分为块,再用 RAG 只检索相关部分放入上下文。费用也按令牌数计算,因此它也是成本管理的重要单位。
推理参数(temperature / top-p)
temperature 是调节输出随机性的参数,取值较低(如 0.1)时输出更确定、更一致,取值较高时输出更多样、更有创造性。top-p(nucleus sampling)是按概率从高到低累积、只从累积概率达到阈值之前的候选令牌中进行采样的方法。基本原则是:基于事实的问答设置得低一些,头脑风暴或创作则设置得高一些。
嵌入与向量数据库
嵌入(Embedding)是将文本语义转换为数百到数千维数值向量的表示方式。语义相近的句子在向量空间中的位置也彼此接近,因此可以实现「按语义查找」的相似度检索。把大量文档向量化后存入向量数据库,再快速取出与问题向量相近的内容——这就是 RAG 中检索部分的工作机制。在 AWS 上,OpenSearch 的向量检索等可以作为承载方案。
生成式 AI 模型的评估(ROUGE / BLEU)
生成结果的质量应使用与任务相应的指标来评估。ROUGE 用于评估摘要,衡量生成摘要与参考摘要之间词语的重叠程度;BLEU 用于评估机器翻译,衡量与参考译文的一致程度。不过仅靠自动指标无法完全衡量流畅性和事实性,因此实务中的基本做法是与人工评估结合使用。
检验理解程度
用 5 道题检验所学内容