Compartir:
Las implementaciones modernas de modelos de lenguaje grande (LLM) enfrentan crecientes desafíos en términos de costos y rendimiento, debido al aumento en el conteo de tokens. Este conteo, relacionado con el número de palabras y tamaño de las imágenes, determina los requisitos computacionales y los costos asociados. A medida que los modelos soportan hasta 10 millones de tokens, los contextos más largos se traducen en mayores gastos por cada solicitud de inferencia. La demanda de contextos extensos se ha intensificado particularmente en sistemas como los de generación aumentada de recuperación (RAG) y agentes de codificación que requieren bases de código y documentación extensas.
Investigaciones en la industria han mostrado que una gran parte del conteo de tokens en las cargas de trabajo de inferencia es repetitiva, con los mismos documentos y fragmentos de texto apareciendo en numerosos prompts. Esto representa una oportunidad para reducir costos y mejorar el rendimiento al almacenar en caché el contenido que se reutiliza frecuentemente.
En respuesta a estos desafíos, Amazon Web Services (AWS) lanzó actualizaciones significativas para el contenedor de Inferencia de Modelos Grandes (LMI). Estas mejoras incluyen un mayor soporte para modelos y capacidades de implementación simplificadas para los clientes que hospedan LLM en AWS, enfocándose en reducir la complejidad operativa y logrando ganancias de rendimiento medibles en las arquitecturas de modelos populares.
Una de las innovaciones más destacadas es el LMCache, un sistema de almacenamiento en caché de clave-valor (KV) de código abierto. LMCache transforma la manera en que se manejan las cargas de trabajo de inferencia de largo contexto, extrayendo y almacenando cachés KV generados por motores LLM modernos. Este enfoque permite compartir cachés entre motores y consultas, mejorando así el rendimiento de inferencia.
A diferencia de los sistemas tradicionales, LMCache no se limita a cachés basados únicamente en prefijos. Reutiliza cachés de texto repetido, identificando tramos de texto comunes y almacenando su caché KV precomputado. Funciona a nivel de fragmento, abarcando memoria GPU, memoria CPU y almacenamiento en disco/remoto con un almacenamiento en caché inteligente.
Pruebas exhaustivas han revelado que LMCache mejora significativamente el rendimiento. Para cargas de trabajo con contextos repetidos, logra reducir el tiempo hasta el primer token al procesar contextos de varios millones de tokens. Las organizaciones pueden configurar la evacuación a la CPU cuando la memoria de la instancia lo permite, o utilizar NVMe para mayor capacidad de caché.
Las características de rendimiento varían según el tamaño del modelo. Los modelos más grandes requieren más memoria por token, lo que agota la capacidad de caché de la GPU más rápidamente, situación en la que LMCache sigue siendo valioso en contextos más cortos.
Con el apoyo de LMCache y otras mejoras como la decodificación especulativa EAGLE, que acelera el proceso prediciendo tokens futuros directamente, las organizaciones pueden experimentar una mejoría notable en el rendimiento de inferencia de sus LLM. Las nuevas versiones del LMI también amplían el soporte para modelos de última generación y capacidades multimodales, permitiendo una implementación y escala más eficientes y reduciendo la complejidad operativa.









