El ecosistema de instancias Spot de AWS - Gestión madura de interrupciones que respalda descuentos de hasta el 90%
Las instancias Spot de AWS ofrecen descuentos de hasta el 90% y, con una gestión de interrupciones que combina el aviso de 2 minutos, Spot Placement Score y Capacity Rebalancing, se adoptan incluso en cargas de trabajo de producción. Comparamos las diferencias con Azure Spot VM y GCP Spot VM desde las perspectivas del margen del aviso de interrupción, la gestión de flotas y las estrategias de asignación.
Fundamentos y estructura de descuentos de las instancias Spot
Las instancias Spot de AWS son una opción de compra que permite utilizar la capacidad excedente de EC2 con descuentos de hasta el 90% sobre el precio bajo demanda. Cuando se lanzaron en 2009, el precio funcionaba con un formato de subasta con precios fluctuantes, pero el modelo de precios se revisó en 2017, adoptando un sistema de precios estable basado en la oferta y la demanda. Este cambio mejoró drásticamente la previsibilidad de precios y aceleró la adopción en cargas de trabajo de producción. El descuento real se determina por cada pool de capacidad, es decir, por la combinación de tipo de instancia, región y zona de disponibilidad, y la única cifra que AWS indica oficialmente es el tope de hasta el 90%. Como el nivel varía mucho de un pool a otro, lo práctico es no asumir un descuento concreto en la fase de diseño y comprobar el precio actual de los pools objetivo en el historial de precios Spot. AWS recupera las instancias con un aviso de 2 minutos cuando necesita la capacidad. La frecuencia de interrupción también varía mucho según el tipo de instancia y la región, por lo que una operación estable se consigue eligiendo los pools a partir de las bandas de frecuencia de interrupción que publica Spot Instance Advisor y combinándolo con un diseño que asume la interrupción, como puntos de control y evacuación automática.
La profundidad de las herramientas de gestión de interrupciones
AWS proporciona un conjunto completo de herramientas para gestionar las interrupciones de instancias Spot. La notificación de interrupción del servicio de metadatos de EC2 emite un aviso 2 minutos antes de que se recupere una instancia, dando tiempo a las aplicaciones para un apagado ordenado. La integración con EventBridge permite ejecutar funciones Lambda activadas por notificaciones de interrupción, automatizando la evacuación de trabajos y el guardado de puntos de control. Spot Placement Score evalúa previamente la disponibilidad de una configuración de instancia específica en una región o zona de disponibilidad en una escala de 1 a 10, permitiendo seleccionar ubicaciones con menor riesgo de interrupción de forma planificada. Capacity Rebalancing detecta proactivamente instancias con riesgo elevado de interrupción e inicia automáticamente la migración a nuevas instancias Spot. Estas herramientas funcionando de forma integrada transforman las interrupciones Spot de riesgos operativos en eventos gestionables.
Gestión de flotas y estrategias de diversificación
EC2 Fleet y Spot Fleet son funcionalidades para gestionar flotas que combinan múltiples tipos de instancia, zonas de disponibilidad y opciones de compra. Para Spot, la documentación oficial (a fecha de agosto de 2026) ofrece cinco estrategias de asignación: price-capacity-optimized, capacity-optimized, capacity-optimized-prioritized, diversified y lowest-price. AWS recomienda price-capacity-optimized, que primero acota los pools con mayor holgura de capacidad y después elige el más barato entre ellos, por lo que se convierte en la opción por defecto para muchas cargas de trabajo, como aplicaciones en contenedores sin estado, microservicios, análisis de datos y procesamiento por lotes. Para cargas de trabajo en las que la interrupción resulta costosa, capacity-optimized prioriza la capacidad sobre el precio y capacity-optimized-prioritized respeta además, en la medida de lo posible, el orden de prioridad de los tipos de instancia. En flotas grandes y de larga duración, diversified reparte las instancias de forma uniforme entre todos los pools para diluir el impacto de las variaciones de precio o del agotamiento de capacidad en un único pool. En cambio, lowest-price solo mira el precio y no tiene en cuenta la capacidad, por lo que presenta el mayor riesgo de interrupción y AWS desaconseja su uso. Como lowest-price sigue siendo el valor por defecto en la AWS CLI, la práctica habitual es sobrescribirlo indicando explícitamente price-capacity-optimized. La integración con grupos de Auto Scaling permite lanzar automáticamente instancias de reemplazo cuando se interrumpen las instancias Spot, manteniendo la capacidad de la flota. Las políticas de instancias mixtas permiten especificar la proporción entre On-Demand y Spot, asegurando capacidad base mientras se escala con Spot.
Comparación con Azure Spot VM
Azure Spot VM alcanzó la disponibilidad general en 2020. Aunque iguala a AWS en ofrecer descuentos de hasta el 90%, difiere en la forma de prepararse para las interrupciones y en la granularidad de la gestión de flotas. Las políticas de desalojo de Azure Spot VM ofrecen dos opciones, detener/desasignar o eliminar, y el aviso de desalojo llega 30 segundos antes a través de Scheduled Events. Como el margen es menor que el aviso de 2 minutos de AWS, hay que diseñar para que el drenaje seguro de contenedores o la escritura de puntos de control grandes quepan en 30 segundos. En la gestión de flotas, además de los tradicionales Virtual Machine Scale Sets (VMSS), está disponible Azure Compute Fleet. Según la documentación oficial (a fecha de agosto de 2026), Compute Fleet puede lanzar mediante una única API hasta 10,000 VM (o 100,000 vCPU) por flota repartidas en hasta 3 regiones, mezclando VM Spot y de pago por uso, y permite elegir para Spot y para Standard una estrategia de asignación entre prioridad al precio más bajo, prioridad a la capacidad o una combinación de ambas. También admite el reemplazo automático de las VM Spot desalojadas, la selección de VM basada en atributos y la agrupación de opciones de compra que incluyen Reserved Instances y Savings Plans, de modo que ya es posible montar configuraciones cercanas a EC2 Fleet de AWS. La diferencia está en la granularidad de las estrategias y en los medios de evaluación previa: en el lado de AWS se puede llegar hasta estrategias con prioridades como capacity-optimized-prioritized, y Spot Placement Score permite estimar de antemano la facilidad de obtención de cada configuración de instancias como una puntuación de 1 a 10. La fortaleza de Compute Fleet es manejar la mezcla de opciones de compra en una sola flota, así que cuál resulta más ventajoso depende de si la carga de trabajo necesita precisión en la predicción de interrupciones o la agrupación de opciones de compra.
Comparación con GCP Spot VM
GCP rebautizó sus anteriores Preemptible VM como Spot VM en 2022, eliminando la limitación de tiempo máximo de ejecución de 24 horas. El aviso de interrupción de GCP Spot VM es de 30 segundos, más corto que el aviso de 2 minutos de AWS. Aunque los Managed Instance Groups (MIG) pueden gestionar Spot, no se ofrece un mecanismo para elegir entre estrategias de asignación como el de EC2 Fleet. En cuanto a los descuentos por uso sostenido (SUD), que suelen citarse en el apartado de costos, conviene tener en cuenta que no son un descuento que actúe como respaldo de Spot. Según la documentación oficial (a fecha de agosto de 2026), los SUD se aplican a las vCPU y la memoria de los tipos de máquina N1, N2, N2D, C2, M1 y M2, a los nodos de único inquilino y a las GPU conectadas a máquinas N1, con descuentos de hasta el 30% (hasta el 20% en N2, N2D y C2). Las Spot VM no están entre los recursos elegibles, así que no existe una relación en la que los SUD cubran automáticamente las horas en que no se consigue capacidad Spot. Lo exacto es estimarlos aparte de Spot, como un descuento que se aplica automáticamente a las VM bajo demanda de larga duración. Si se comparan solo los mecanismos de gestión propios de Spot, AWS permite combinar el aviso de interrupción de 2 minutos, la evaluación previa con Spot Placement Score, la migración anticipada con Capacity Rebalancing y cinco estrategias de asignación. En el lado de GCP, el núcleo es el aviso de interrupción de 30 segundos y la recreación mediante MIG, y la evaluación previa de la facilidad de obtención y el control fino de la selección de pools quedan en manos del diseño del usuario.
Resumen
Desde su lanzamiento en 2009, las instancias Spot de AWS han ido acumulando de forma gradual herramientas de gestión de interrupciones, gestión de flotas y estrategias de asignación. La combinación del aviso de interrupción de 2 minutos, Spot Placement Score que expresa la facilidad de obtención con una puntuación de 1 a 10, Capacity Rebalancing que detecta el aumento del riesgo de interrupción y migra de antemano, y cinco estrategias de asignación que incluyen price-capacity-optimized se caracteriza por descomponer en funciones individuales los mecanismos para usar Spot en cargas de trabajo de producción. Azure se apoya en Compute Fleet para mezclar opciones de compra y desplegar en varias regiones, y GCP en Spot VM sin límite de tiempo de ejecución y en la recreación mediante MIG, de modo que, incluso con el mismo descuento de hasta el 90%, las premisas que hay que fijar en el diseño son distintas. La clave para aprovechar el descuento de forma segura es comprender las diferencias entre estas herramientas, comprobar el precio actual y la frecuencia de interrupción de los pools objetivo y diseñar estrategias de diversificación adecuadas.
Referencias (recursos oficiales de AWS)
Las fuentes primarias de esta página son el sitio web y la documentación oficiales de AWS. Consulta las páginas oficiales siguientes para conocer las especificaciones y los precios más recientes.
Si esta página y la documentación oficial difieren, prevalece la documentación oficial.