Compartir:
Las organizaciones están aumentando su adopción de modelos de base para cargas de trabajo de inteligencia artificial y aprendizaje automático, lo que hace que la gestión eficiente de operaciones de inferencia a gran escala sea esencial. Amazon Bedrock ha surgido como una plataforma popular para implementar dos patrones generales de inferencia: en tiempo real y por lotes. Especialmente, la inferencia por lotes resulta útil para procesar grandes volúmenes de datos cuando el tiempo no es un factor crítico.
El enfoque de inferencia por lotes de Amazon Bedrock es económicamente ventajoso, ya que ofrece un descuento del 50% en comparación con el procesamiento bajo demanda. Esto la convierte en la opción perfecta para cargas de trabajo de alto volumen que no requieren resultados inmediatos. No obstante, implementar la inferencia por lotes a gran escala presenta ciertos desafíos, como gestionar el formato de entrada, orquestar ejecuciones concurrentes y manejar tareas de postprocesamiento.
Recientemente, se presentó una nueva solución que facilita el flujo de trabajo de la inferencia por lotes, proporcionando así un sistema altamente escalable. Esta solución permite manejar las necesidades de inferencia por lotes para modelos de base, como la generación de embeddings para millones de documentos o la evaluación de grandes conjuntos de datos.
La implementación se divide en tres fases: preprocesamiento de datos, ejecución de inferencias en paralelo y postprocesamiento de resultados. Utilizando un simple input de configuración, el sistema de AWS Step Functions se encarga de preparar los datos, lanzar trabajos en paralelo y organizar el postprocesamiento. Un ejemplo destacado es el análisis de 2.2 millones de filas del conjunto de datos SimpleCoT, diseñado para entrenar el razonamiento «chain-of-thought» en modelos de lenguaje.
La arquitectura por lotes de Amazon utiliza componentes escalables y sin servidor, siendo los inputs de trabajo archivos JSONL almacenados en un bucket de Amazon S3. Step Functions coordina trabajos de larga duración, mientras que Amazon DynamoDB mantiene un inventario del estado de cada trabajo. Durante la ejecución, es fundamental que el proceso esté bien organizado y que las salidas se integren con los datos de entrada originales.
Esta solución permite a las empresas explorar una arquitectura sin servidor para el procesamiento por lotes a gran escala. Esto no solo facilita la generación de datos sintéticos, sino también la obtención eficiente de etiquetas de datos. Está disponible en un repositorio de GitHub, esperando ser adaptada a las necesidades específicas de cada desarrollador.









