Compartir:
En un avance significativo en el ámbito de la inteligencia artificial, Amazon ha presentado su nuevo asistente de compras impulsado por inteligencia artificial generativa, llamado Rufus. Este desarrollo innovador ya está disponible para millones de usuarios, aunque su implementación a gran escala ha requerido enfrentarse a numerosos desafíos que demandan meticulosa atención.
Rufus se basa en un modelo de lenguaje grande diseñado específicamente para este propósito, lo que implica un enfoque innovador para mantener interacciones de alta calidad, garantizando al mismo tiempo eficiencia en costos y baja latencia.
El equipo de Amazon ha dirigido sus esfuerzos hacia la creación de una solución de inferencia multinodo, utilizando Amazon Trainium y vLLM, una biblioteca de código abierto que facilita una atención eficiente y de alto rendimiento en la entrega de modelos de lenguaje grande. A medida que el modelo de Rufus se ha expandido, también lo ha hecho la necesidad de múltiples instancias de aceleradores, dado que un único chip no puede albergar el modelo completo. Esto ha llevado a los ingenieros a innovar en la fragmentación y distribución del modelo a través de varios nodos, empleando técnicas como el paralelismo tensorial.
Las estrategias adoptadas para mejorar el rendimiento del modelo incluyen la maximización del uso de recursos de computación y memoria en múltiples nodos, sin comprometer la latencia. Además, se ha diseñado una infraestructura de inferencia multinodo que facilita la comunicación rápida entre nodos, asegurando una sólida integración de los componentes distribuidos.
La solución implementada por Amazon consiste en una arquitectura de inferencia multinodo que emplea un modelo de líder/seguidor. En este esquema, el nodo líder se encarga de la programación de solicitudes y la orquestación, mientras que los nodos seguidores ejecutan los cálculos del modelo de forma distribuida. Esta configuración permite a cada nodo operar de manera coherente y eficiente, beneficiando al sistema en su conjunto.
Gracias a esta estrategia de despliegue, Amazon ha logrado manejar solicitudes a gran escala de manera eficaz. El diseño también favorece la colocación de nodos según la topología de red, lo que minimiza la latencia. Con esta infraestructura, Amazon ha lanzado un modelo más grande que funciona en decenas de miles de chips Trainium, ampliando su capacidad para ofrecer una experiencia de compra innovadora y mejorando notablemente la interacción de los usuarios.
Con estos desarrollos, Amazon sigue afianzando su posición en el campo de la inteligencia artificial, permitiendo que Rufus proporcione un servicio de preguntas y respuestas en tiempo real, siempre disponible para sus clientes.










