Implementación de Modelos de Reconocimiento de Voz NIM en Amazon SageMaker con Hosting NVIDIA

Elena Digital López

Las organizaciones actuales enfrentan el reto de procesar enormes volúmenes de datos de audio provenientes de diversas fuentes como llamadas de clientes, grabaciones de reuniones, podcasts y mensajes de voz. El reconocimiento automático de habla (ASR, por sus siglas en inglés) es crucial en este contexto, ya que convierte el habla en texto, posibilitando un análisis más detallado. No obstante, el ASR a gran escala requiere recursos computacionales considerables y es costoso. Aquí es donde Amazon SageMaker AI y su capacidad de inferencia asíncrona marcan la diferencia.

La implementación de modelos avanzados de ASR, como los modelos Parakeet de NVIDIA en SageMaker AI, mediante puntos finales asíncronos, permite gestionar eficientemente archivos de audio grandes y cargas de trabajo por lotes. La inferencia asíncrona procesa solicitudes prolongadas en segundo plano, facilitando la entrega de resultados posteriormente y permitiendo el escalado automático que se ajusta a cero en ausencia de trabajo, lo que ayuda a gestionar picos de demanda sin interrumpir otras tareas.

La suite de tecnologías de inteligencia artificial de voz de NVIDIA se caracteriza por su alto rendimiento y eficiencia en implementación. El modelo Parakeet ASR se destaca por su capacidad de reconocimiento de voz avanzado, logrando una gran precisión y bajos índices de error por palabra. Esta tecnología utiliza un codificador Fast Conformer, lo que le permite un procesamiento 2.4 veces más rápido que los Conformers estándar, sin perder precisión.

Además, el NIM de NVIDIA ofrece un conjunto de microservicios acelerados por GPU para construir aplicaciones personalizables de AI de voz, soportando más de 36 idiomas. Estos modelos son ideales para aplicaciones como servicios al cliente, centros de contacto, accesibilidad, y flujos de trabajo empresariales globales.

La implementación de esta tecnología en Amazon SageMaker AI facilita una arquitectura de inferencia asíncrona adaptada a cargas de trabajo de ASR y resumido. Los componentes clave incluyen la ingestión de datos mediante la subida de archivos de audio a Amazon S3, el procesamiento de eventos a través de Amazon SNS y el seguimiento en tiempo real del estado de trabajo mediante Amazon DynamoDB.

Este flujo de trabajo impulsado por eventos activa funciones de Lambda al cargar archivos de audio, posibilitando el análisis de metadatos y la creación de registros de invocación. Una vez transcrito el contenido con éxito, es enviado a modelos de lenguaje de Amazon Bedrock para generar resúmenes. El sistema maneja eficazmente los errores y puede reiniciar el procesamiento ante fallos temporales.

Esta solución tiene múltiples aplicaciones prácticas, como el análisis del servicio al cliente, la transcripción y resumido de reuniones, y la generación de documentación legal y de cumplimiento normativo. La infraestructura de NVIDIA, combinada con los servicios gestionados de AWS, ofrece un sistema automatizado y escalable para el procesamiento de contenido de audio, permitiendo a las organizaciones enfocarse en extraer valor empresarial sin preocuparse por la complejidad de la infraestructura.

Scroll al inicio