Optimiza los tiempos de respuesta de la IA conversacional en aplicaciones empresariales con la API de streaming de Amazon Bedrock y AWS AppSync

Elena Digital López

Las empresas están acelerando la adopción de modelos de lenguaje de gran escala (LLMs) a través de Amazon Bedrock, un servicio totalmente gestionado que ofrece modelos de inteligencia artificial de alta calidad de proveedores como AI21 Labs, Anthropic, Cohere, Meta, Mistral AI, Stability AI y Amazon. Este servicio promete mantener la seguridad, privacidad y un enfoque en una inteligencia artificial responsable, lo cual es crucial en entornos empresariales.

Uno de los principales desafíos para las organizaciones que implementan IA conversacional es el tiempo de respuesta de las consultas complejas. Aunque las API suelen ser rápidas para preguntas básicas, las consultas más complicadas que requieren lógica avanzada pueden tardar en procesarse, afectando negativamente la experiencia del usuario. Este problema se agrava en industrias reguladas, donde la seguridad es prioritaria. Por ejemplo, una compañía financiera global con más de 1.5 billones de dólares en activos enfrentó esta dificultad, buscando una solución que equilibrara seguridad y velocidad.

Para resolver este dilema, AWS AppSync surge como la solución ideal. Este servicio permite a los desarrolladores crear APIs GraphQL en tiempo real, utilizando suscripciones combinadas con los puntos finales de streaming de Amazon Bedrock para entregar respuestas de manera incremental. La estrategia se centra en mantener la seguridad al tiempo que optimiza la experiencia del usuario mediante la entrega rápida de información.

El flujo de trabajo inicia de forma asíncrona con AWS AppSync y utiliza AWS Lambda para interactuar con la API de Amazon Bedrock. A medida que el modelo de lenguaje genera información, esta se transmite en tiempo real al usuario, asegurando una comunicación eficiente y fluida.

La arquitectura de esta solución implica varios pasos para asegurar que al usuario le lleguen respuestas en tiempo real. Desde que se carga la aplicación, se establece una conexión eficaz para la comunicación. Una vez que el usuario realiza una consulta, una función GraphQL publica un evento en Amazon SNS y confirma la solicitud. Acto seguido, una función Lambda gestiona la interacción con Amazon Bedrock para obtener respuestas rápidas que se envían al usuario de inmediato.

La implementación de esta tecnología ha mostrado una notable mejora en los tiempos de respuesta. Una empresa del sector financiero reportó una reducción significativa, pasando de 10 segundos a tan solo entre 2 y 3 segundos para consultas complejas, mejorando así la interacción con el usuario y reduciendo las tasas de abandono.

Las empresas que adopten esta estrategia podrán mejorar significativamente sus aplicaciones, logrando un compromiso más sólido y eficiente con sus clientes, al tiempo que se mantiene el cumplimiento de estrictos estándares de seguridad y privacidad.

Scroll al inicio