Compartir:
Las organizaciones expanden sus infraestructuras de inteligencia artificial con desafíos significativos al entrenar modelos de billones de parámetros. El dilema es bien conocido: disminuir el tiempo de entrenamiento a un costo elevado o abaratar costes, pero con tiempos extendidos. Una técnica comúnmente empleada para optimizar este proceso es el «checkpointing», que reduce los tiempos de recuperación pero aumenta considerablemente los costes de almacenamiento.
Durante el entrenamiento del modelo Meta Llama 3, se observó que fallos acontecían cada tres horas, siendo las GPUs las responsables del 60% de estos problemas. Otros inconvenientes se debieron a redes, CPUs y discos. Estas interrupciones no solo incrementan costos y prolongan la llegada al mercado, sino que también pueden resultar en días de progreso perdidos. Aunque los checkpoints frecuentes pueden saturar redes y sobrecargar el almacenamiento, hallar un equilibrio es crucial.
Para mitigar estos problemas, AWS ha lanzado el «checkpointing» en capas gestionadas en Amazon SageMaker HyperPod, diseñado para escalar y acelerar el desarrollo de modelos de IA generativa. La solución utiliza memoria de CPU para almacenar checkpoints de alto rendimiento, replicando automáticamente datos en nodos adyacentes para mayor fiabilidad. SageMaker HyperPod no solo identifica y reemplaza automáticamente nodos problemáticos para reanudar el entrenamiento, sino que también optimiza las estrategias de «checkpointing» para mejorar el rendimiento.
Esta función ha sido probada en clústeres de entrenamiento distribuidos con hasta 15,000 GPUs, logrando salvar checkpoints en segundos. Su implementación, compatible con scripts de entrenamiento de PyTorch, no requiere experiencia técnica avanzada y puede integrarse fácilmente.
Además, el «checkpointing» en capas gestionadas permite configurar la frecuencia y políticas de retención para almacenamiento en memoria y persistente, usando Amazon S3 como respaldo. Esta tecnología mejora la recuperación y optimiza la gestión de checkpoints en comparación con métodos tradicionales. Al escribir checkpoints frecuentemente en memoria y copiar menos frecuentemente a Amazon S3, la combinación de «managed tiered checkpointing» y SageMaker HyperPod promete mantener alto rendimiento incluso en entornos propensos a fallas. vía: AWS machine learning blog.










