Compartir:
La adopción de modelos de lenguaje de gran escala (LLMs) está revolucionando la interacción entre las personas y la tecnología, pero su implementación a gran escala presenta desafíos significativos en términos de latencia, capacidad de procesamiento y costos. Estos desafíos se vuelven aún más evidentes durante eventos de alta demanda como el Amazon Prime Day, donde sistemas como Rufus, un asistente de compras impulsado por inteligencia artificial de Amazon, deben manejar una carga masiva de solicitudes mientras cumplen con estrictos requisitos de velocidad y eficiencia.
Rufus ha sido diseñado para asistir a los consumidores a tomar decisiones de compra informadas, respondiendo a preguntas sobre productos y mejorando la experiencia de compra. Para ofrecer este nivel de servicio, el sistema depende de varios componentes críticos, entre ellos un modelo LLM para generar respuestas y un modelo de planificación de consultas que clasifica y recupera información de manera óptima. La eficiencia de estos sistemas es fundamental, ya que la generación de texto comienza solo cuando el modelo de planificación ha completado su tarea.
Con la proximidad del Prime Day de 2024, Rufus enfrentaba el reto de gestionar millones de consultas por minuto, generando miles de millones de tokens en tiempo real y manteniendo un compromiso de latencia de 300 milisegundos. Esto llevó a un replanteamiento de la implementación de los LLMs a gran escala para superar los cuellos de botella en costo y rendimiento.
Una técnica clave en este proceso fue la implementación de la decodificación paralela, que permite a Rufus generar múltiples tokens simultáneamente, eliminando las ineficiencias del enfoque secuencial tradicional. Durante el evento, el equipo de Rufus logró mejorar el rendimiento utilizando chips de inteligencia artificial de AWS, los cuales no solo duplicaron la velocidad de generación de texto, sino que también redujeron los costos de inferencia en un 50%.
Los resultados fueron notables: Rufus mostró una capacidad de respuesta mejorada que optimizó la experiencia del cliente. La combinación de decodificación paralela y soluciones de AWS permitió un despliegue sencillo y el manejo del tráfico máximo sin comprometer la calidad de las respuestas.
Esta implementación y optimización demuestra el potencial de las soluciones de inteligencia artificial para crear experiencias de compra más fluidas y eficientes. La integración del marco Neuronx-Distributed Inference (NxDI) y los chips de AWS representa un avance significativo en la escalabilidad y viabilidad económica de los LLMs, prometiendo facilitar nuevas oportunidades para aplicaciones futuras en el ámbito de la inteligencia artificial.










