AWS Certified AI Practitioner - 24% del examen

Fundamentos de la IA generativa

Qué aprenderá

En este dominio se aprenden las técnicas centrales de la IA generativa —el concepto de modelo base (Foundation Model), las características del Transformer y de los LLM, los fundamentos de la ingeniería de prompts, Retrieval-Augmented Generation (RAG) y el ajuste fino—, además de los conceptos básicos para trabajar con los LLM, como los tokens, la ventana de contexto, los parámetros de inferencia y los embeddings. Es un dominio de aparición frecuente que representa el 24 % de las preguntas del AIF-C01 y constituye el tema central del uso moderno de la IA.

Puntos clave

  • Modelo base (Foundation Model): modelo de propósito general preentrenado con grandes volúmenes de datos y reutilizable en diversas tareas
  • Gran modelo de lenguaje (LLM): modelo base que maneja texto. Los modelos de OpenAI, Anthropic y Meta, así como Nova de Amazon, son ejemplos representativos
  • Transformer: arquitectura que utiliza el mecanismo de autoatención (self-attention) y es la estructura estándar de los LLM actuales
  • Ingeniería de prompts: técnica de diseñar las instrucciones (prompts) que extraen del LLM la salida deseada
  • Cero ejemplos / pocos ejemplos: métodos para que el LLM ejecute una tarea sin ejemplos / con unos pocos ejemplos
  • RAG (Retrieval-Augmented Generation): obtiene información relevante de una base de conocimiento externa y la añade al prompt del LLM para mejorar la precisión de las respuestas
  • Diferencia entre ajuste fino y preentrenamiento: el preentrenamiento aprende desde cero con grandes volúmenes de datos, mientras que el ajuste fino entrena adicionalmente un modelo existente para un uso específico
  • Alucinación: el fenómeno por el cual el LLM genera de forma verosímil contenido que no es cierto. Se frena con RAG y con verificación
  • Tokens y ventana de contexto: el token es la unidad mínima de texto que maneja el LLM; la ventana de contexto es el límite del número de tokens que puede procesar de una vez
  • Parámetros de inferencia: cuanto más bajos son temperature y top-p, más determinista y consistente es la salida; cuanto más altos, más diversa y creativa
  • Embedding (incrustación): representación del significado de un texto como un vector numérico. Combinado con una base de datos vectorial, hace posible la búsqueda por similitud semántica
  • Evaluación de los resultados generados: se combinan métricas automáticas acordes a la tarea, como ROUGE para el resumen o BLEU para la traducción, con la evaluación humana

Términos y conceptos

Modelo base (Foundation Model)

Es un modelo de gran escala preentrenado con una gran cantidad de datos de propósito general, que puede aplicarse a diversas tareas mediante ajuste fino o prompts. Sus usos se amplían a los LLM para texto, la generación de imágenes, el audio, lo multimodal, etc. En Bedrock se pueden usar varios modelos base a través de la API.

Ingeniería de prompts

Es la técnica de elaborar las instrucciones que extraen del LLM la salida deseada. Existen técnicas como la asignación de un rol ("eres un médico"), la especificación del formato de salida ("responde en JSON"), la inclusión de ejemplos (pocos ejemplos) y el fomento del razonamiento paso a paso (Chain-of-Thought).

RAG (Retrieval-Augmented Generation)

Es un método que busca, en una base de conocimiento externa (documentos internos, bases de datos, etc.), la información relacionada con la pregunta y la añade al prompt del LLM antes de generar la respuesta. Suple información que el LLM desconoce o que está desactualizada y permite frenar las alucinaciones. Se implementa combinándolo con Bedrock Knowledge Bases o Kendra.

Ajuste fino y preentrenamiento

El preentrenamiento (pre-training) es el proceso de entrenar un modelo base desde cero con grandes volúmenes de datos, que requiere enormes recursos de cómputo. El ajuste fino es el proceso de entrenar adicionalmente un modelo ya preentrenado con una pequeña cantidad de datos de un dominio concreto (derecho, medicina, etc.), lo que permite aumentar la especialización conteniendo los costes.

Alucinación (Hallucination)

Es el fenómeno por el cual el LLM genera de forma verosímil información que no está en los datos de entrenamiento o contenidos que difieren de los hechos. La causa reside en la naturaleza del modelo de generar "el carácter que con más naturalidad parece continuar". Su impacto se reduce aportando fundamentos mediante RAG, verificando la salida con barandillas y con revisión humana.

Tokens y ventana de contexto

El token es la unidad mínima con la que el LLM procesa el texto; a menudo la división es más fina que la palabra, y un signo o un fragmento de palabra también pueden constituir un token. La ventana de contexto es el límite del número de tokens (entrada + salida) que el modelo puede manejar en una sola invocación. Cuando se quiere trabajar con documentos largos que superan ese límite, el procedimiento habitual es dividirlos en fragmentos (chunks) y usar RAG para buscar solo las partes relevantes e incluirlas en el contexto. Como el precio también se calcula en función del número de tokens, es además una unidad importante para la gestión de costes.

Parámetros de inferencia (temperature / top-p)

temperature es el parámetro que ajusta la aleatoriedad de la salida: con valores bajos (por ejemplo, 0,1) la salida es más determinista y consistente, y con valores altos, más diversa y creativa. top-p (nucleus sampling) es una técnica que muestrea solo entre los tokens candidatos de mayor probabilidad, hasta que su probabilidad acumulada alcanza un umbral. La pauta básica es configurar valores bajos para las preguntas y respuestas basadas en hechos, y altos para la lluvia de ideas o la creación.

Embeddings y bases de datos vectoriales

Un embedding (incrustación) es la conversión del significado de un texto en un vector numérico de cientos o miles de dimensiones. Como las frases con significados próximos quedan también próximas en el espacio vectorial, se hace posible una búsqueda por similitud "basada en el significado". El mecanismo de la parte de búsqueda de RAG consiste precisamente en vectorizar una gran cantidad de documentos, almacenarlos en una base de datos vectorial y recuperar con rapidez los más cercanos al vector de la pregunta. En AWS, la búsqueda vectorial de OpenSearch, entre otras opciones, sirve de soporte.

Evaluación de los modelos de IA generativa (ROUGE / BLEU)

La calidad de los resultados generados se evalúa con métricas acordes a la tarea. ROUGE se usa para evaluar resúmenes y mide el solapamiento de palabras entre el resumen generado y un resumen de referencia. BLEU se usa para evaluar la traducción automática y mide el grado de coincidencia con una traducción de referencia. Ahora bien, como las métricas automáticas por sí solas no llegan a medir la fluidez ni la veracidad, la práctica habitual es combinarlas con la evaluación humana.

Compruebe su comprensión

Compruebe lo aprendido con 5 preguntas