Automatización de la Creación de Notas Informativas con Amazon Bedrock

Elena Digital López

Las empresas de diversos sectores enfrentan actualmente un reto significativo al convertir grabaciones de reuniones o presentaciones en documentos bien estructurados. Crear material a partir de estas sesiones implica un trabajo manual considerable, como revisar grabaciones, identificar cambios de diapositivas, transcribir el contenido verbal, capturar y organizar imágenes, sincronizar elementos visuales con notas del ponente y dar formato al contenido. Estos desafíos pueden afectar tanto la productividad como la capacidad de escalar, especialmente al manejar numerosas grabaciones de presentaciones, sesiones de conferencias o material educativo.

Para facilitar este complejo proceso, se ha desarrollado una solución automatizada y sin servidor. Mediante el uso de la automatización de datos de Amazon Bedrock para el análisis de video, es posible transformar grabaciones de seminarios web en minutas completas. Esta implementación permite no solo transcribir diálogos y detectar cambios de diapositivas, sino también utilizar modelos de base de Amazon Bedrock para perfeccionar las transcripciones. Todo esto se orquesta a través de funciones personalizadas de AWS Lambda y AWS Step Functions.

La automatización de datos de Amazon Bedrock emplea inteligencia artificial generativa para convertir datos multimodales, como imágenes y videos, en formatos estructurados y personalizables. Esto incluye la creación de resúmenes de escenas en vídeos y la detección de contenido explícito. La solución facilita la extracción de segmentos de audio y diversos planos de vídeos.

El proceso inicia al subir un video a Amazon Simple Storage Service (S3), lo cual desencadena una notificación de evento mediante Amazon EventBridge, comenzando así el procesamiento del video. Amazon Bedrock Data Automation inicia una serie de transformaciones para identificar cambios, y al finalizar esto, se sincronizan las palabras habladas con las imágenes visuales. Posteriormente, se genera un proceso paralelo que crea capturas de pantalla de las diapositivas y refina las transcripciones, corrigiendo errores y eliminando disfluencias del habla.

Finalmente, las minutas se generan utilizando la biblioteca Python-PPTX, que combina las transcripciones refinadas con las imágenes obtenidas. Los materiales resultantes se almacenan en Amazon S3, listos para su distribución. Esta innovadora solución no solo reduce drásticamente el esfuerzo manual necesario en la creación de materiales, sino que también mejora la integración y escalabilidad para organizaciones de distintos tamaños y sectores.

Scroll al inicio