Optimización de LLMs: Caché KV escalonada en SageMaker HyperPod
Una nueva arquitectura de caché KV escalonada en Amazon SageMaker HyperPod permite optimizar la inferencia de modelos de lenguaje, utilizando almacenamiento distribuido para reducir costos y mejorar los tiempos de respuesta.
Puntos clave:
- Contexto: Redactado por Redacción Orbynex y validado por la mesa editorial.
- Hecho central:Una nueva arquitectura de caché KV escalonada en Amazon SageMaker HyperPod permite optimizar la inferencia de modelos de lenguaje, utilizando almacenamiento distribuido para reducir costos y mejorar los tiempos de respuesta.

La ejecución de modelos de lenguaje de gran tamaño (LLM) a escala enfrenta un dilema técnico persistente: el equilibrio entre el costo de la infraestructura y la latencia. Tradicionalmente, los equipos deben elegir entre invertir en instancias de GPU sobredimensionadas para gestionar la memoria caché de claves y valores (KV cache) o aceptar tiempos de respuesta lentos debido a la recomputación constante de tokens. Este problema se agudiza cuando se despliegan múltiples modelos, como Llama o Qwen, en aplicaciones de generación aumentada por recuperación (RAG) o diálogos multivuelta, donde la memoria limitada de las GPU se convierte en un cuello de botella crítico.
Para mitigar este desafío, una nueva arquitectura de caché KV escalonada en Amazon SageMaker HyperPod propone extender la jerarquía de almacenamiento más allá de la memoria local de la GPU. El diseño implementa tres niveles: L0 (memoria de alto ancho de banda de la GPU), L1 (memoria RAM del host) y L2 (un pool distribuido de NVMe compartido). Esta estructura permite que los bloques de caché, que de otro modo se perderían al agotarse la memoria de la GPU, se conserven y reutilicen entre diferentes réplicas del modelo, mejorando significativamente la eficiencia operativa.
El componente central de esta solución es la integración de Curvine, un sistema de archivos de caché distribuido y ligero. Curvine agrupa las unidades NVMe locales de las instancias en un espacio de nombres único, montado como un volumen persistente compartido en todos los pods de inferencia. Gracias a esta configuración, cuando una réplica genera tokens, los datos de la caché KV se vuelven accesibles para otras réplicas casi instantáneamente. Esto transforma el almacenamiento local de cada nodo en un recurso colectivo, permitiendo que el sistema evite la recomputación de prefijos comunes, como las instrucciones del sistema, que suelen repetirse en cada solicitud.
La eficacia de este sistema se complementa con un enrutamiento inteligente. El operador de inferencia de HyperPod utiliza estrategias de enrutamiento que dirigen las solicitudes a la réplica con mayor probabilidad de poseer los datos en caché, ya sea mediante el seguimiento de prefijos o el estado de la caché KV. Al combinar este enrutamiento con la jerarquía de almacenamiento, el sistema logra reducir drásticamente el tiempo hasta el primer token (TTFT). En pruebas de rendimiento, esta arquitectura ha demostrado mejoras de hasta 2.7 veces en la latencia de respuesta y tasas de acierto de caché cercanas al 100% entre pods.
Este enfoque permite que cargas de trabajo que anteriormente requerían instancias de alto rendimiento, como las P5, puedan ejecutarse en instancias más económicas, como las G6e, optimizando los costos por punto de enlace. La implementación requiere habilitar el almacenamiento escalonado en HyperPod y configurar el operador de inferencia para gestionar los niveles L1 y L2. Al mover la caché fuera de la GPU de manera eficiente, las organizaciones pueden escalar sus aplicaciones de IA sin sacrificar el rendimiento ni incurrir en gastos excesivos de hardware.