Compartir:
En un avance significativo para la comunidad de inteligencia artificial, se ha introducido una solución innovadora para abordar el desperdicio de capacidad de GPU en modelos de Mixture of Experts (MoE). Las organizaciones y usuarios que implementan múltiples modelos de IA personalizados se enfrentan al desafío de pagar por capacidad de GPU ociosa, sobre todo cuando sus modelos individuales no reciben suficiente tráfico para justificar un punto de computación dedicado. Para mitigar esta problemática, se ha llevado a cabo una colaboración con la comunidad de vLLM, desarrollando una solución eficiente para el servicio de Multi-Low-Rank Adaptation (Multi-LoRA) en modelos de MoE de código abierto como GPT-OSS y Qwen.
Multi-LoRA es una técnica popular para el ajuste fino de modelos. En lugar de volver a entrenar todos los pesos de un modelo, esta técnica congela los pesos originales e inyecta adaptadores entrenables pequeños en las capas del modelo. Durante la inferencia, múltiples modelos personalizados pueden compartir la misma GPU, intercambiando únicamente los adaptadores según la solicitud. Esto permite que, por ejemplo, cinco clientes que utilizan solo el 10% de una GPU dedicada cada uno sean atendidos por una única GPU, transformando así cinco GPUs infrautilizadas en una GPU compartida y eficiente.
La implementación de esta solución se ha integrado en las versiones locales de vLLM a partir de la 0.15.0. Multi-LoRA ahora es compatible con varias familias de modelos MoE, incluyendo GPT-OSS, Qwen3-MoE, DeepSeek y Llama MoE. También se han realizado optimizaciones que benefician el hospedaje de modelos densos como Llama3.3 70B y Qwen3 32B. Gracias a optimizaciones específicas para Amazon, estas mejoras han resultado en un aumento del 19% en Output Tokens Per Second (OTPS) y una reducción del 8% en el Time To First Token (TTFT) para GPT-OSS 20B.
El proceso de optimización comenzó con la identificación de cuellos de botella utilizando herramientas de perfilado como NVIDIA Nsight Systems. Un hallazgo clave fue que el núcleo «fused_moe_lora» presentaba la mayor latencia. Se realizaron diversas mejoras, incluyendo la introducción de lógica de salida anticipada y la implementación de Programmatic Dependent Launch (PDL), superponiendo la ejecución de núcleos. El resultado fue un notable incremento en el rendimiento, alcanzando hasta 171 OTPS y 124 ms TTFT para GPT-OSS 20B en configuraciones optimizadas.
Con la implementación de Multi-LoRA y las mejoras realizadas, el equipo tras esta iniciativa no solo ha logrado una reducción de costos en el uso de GPU, sino que también ha optimizado la eficiencia y la velocidad de respuesta de modelos de IA. Estas innovaciones están disponibles en plataformas como Amazon SageMaker y Amazon Bedrock, permitiendo a los desarrolladores y científicos de datos aprovechar al máximo sus recursos de cómputo.










