Compartir:
En el ámbito del entrenamiento de modelos de inteligencia artificial, Amazon ha dado un paso revolucionario con su reciente innovación en Amazon SageMaker HyperPod, el entrenamiento sin puntos de control. Esta tecnología promete abordar las ineficiencias y altos costos que los métodos de recuperación tradicionales, basados en puntos de control, han generado para modelos que manejan billones de parámetros. La magnitud creciente de estos modelos, junto con la expansión de los clústeres de entrenamiento que emplean miles de aceleradores, ha hecho que incluso las interrupciones más mínimas causen costos y retrasos significativos.
El nuevo enfoque de Amazon ha transformado la gestión de fallos durante el entrenamiento, permitiendo una recuperación de estado entre pares y reduciendo el tiempo de recuperación hasta en un 93%. Esto se traduce en una recuperación que antes tomaba entre 15 y 30 minutos, ahora posible en menos de 2 minutos. Además, al incrementar la eficiencia, los clústeres que emplean miles de aceleradores de inteligencia artificial logran una producción efectiva del 95%.
Este sistema introduce el concepto de «goodput», que mide el trabajo útil realizado por un sistema de entrenamiento de inteligencia artificial en contraste con su capacidad máxima teórica. En contextos tradicionales, las caídas del sistema y sus costosos tiempos de recuperación disminuyen el «goodput» significativamente, lo que puede implicar pérdidas millonarias anuales.
El método convencional exige guardar periódicamente el estado de entrenamiento a través de puntos de control, y ante un fallo, reiniciar desde el último registro. Este procedimiento es complejo y largo, ya que un error en un GPU o un fallo de hardware puede suspender todo el clúster de entrenamiento, ocasionando largas inactividades.
La propuesta de Amazon, por otro lado, elimina estos obstáculos al permitir que, ante fallos, el sistema recupere rápidamente el estado mediante pares sanos. Esto evita las operaciones de almacenamiento y los reinicios complejos. Los componentes del sistema trabajan de manera conjunta para ofrecer una recuperación automática y eficiente, eliminando la necesidad de intervención humana.
Este prometedor enfoque ha sido probado exitosamente en diferentes configuraciones de clúster, con resultados que destacan una impresionante reducción en tiempos de inactividad y una mejoría directa en el «goodput». Amazon demuestra que es posible alcanzar más del 95% de «goodput» en clústeres con miles de aceleradores de inteligencia artificial, lo que implica una optimización significativa del proceso de entrenamiento.
Conforme la industria de la inteligencia artificial sigue evolucionando, esta tecnología y enfoque innovador apuntan a una mejor optimización de los procesos de producción y la disminución de costos, haciendo del entrenamiento de modelos un proceso más eficiente y menos susceptible a interrupciones.









