Compartir:
En 2024, el Ministerio de Economía, Comercio e Industria de Japón dio inicio a un ambicioso programa denominado Generative AI Accelerator Challenge (GENIAC), diseñado para impulsar el desarrollo de la inteligencia artificial generativa en el país. Este programa brinda a las empresas locales no solo financiación y asesoramiento, sino también acceso a recursos computacionales masivos, fundamentales para la creación y entrenamiento de modelos de inteligencia artificial avanzada. En este contexto, Amazon Web Services (AWS) fue el proveedor de nube seleccionado para la segunda fase del programa, ofreciendo infraestructura y apoyo técnico a 12 organizaciones participantes.
A pesar de que, en teoría, el desafío parecía centrarse en la provisión de un abundante número de GPUs y chips Trainium para estimular la innovación, la realidad demostró ser más compleja. AWS rápidamente comprendió que disponer de más de mil aceleradores era solo el principio, ya que el verdadero reto se encontraba en la creación de un sistema realmente confiable y en superar las dificultades inherentes al entrenamiento distribuido.
Durante la segunda fase del programa GENIAC, los participantes implementaron exitosamente 127 instancias de Amazon EC2 P5, equipadas con GPU NVIDIA H100 TensorCore, y 24 instancias de Amazon EC2 Trn1, que utilizan servidores AWS Trainium, en un solo día. En los seis meses siguientes, se entrenaron varios modelos de gran escala, destacándose proyectos como Stockmark-2-100B-Instruct-beta y Llama 3.1 Shisa V2 405B.
La experiencia reveló la importancia de contar con equipos multidisciplinarios para llevar a cabo una iniciativa de aprendizaje automático a gran escala. AWS formó un equipo virtual que integraba expertos de distintas áreas, como arquitectos de soluciones y equipos de servicio, lo cual facilitó un intercambio eficiente de información y soporte con los clientes.
La comunicación estructurada también jugó un papel crucial. Se estableció un canal interno en Slack para coordinar el programa, lo que permitió resolver problemas rápidamente y fomentar un ambiente colaborativo. Los documentos de seguimiento detallados por cliente ayudaron a clarificar los requisitos técnicos y las configuraciones necesarias, y las reuniones semanales permitieron compartir lecciones y mejorar el enfoque de participación continuamente.
Otra lección importante fue la creación de arquitecturas de referencia. AWS diseñó plantillas y automatizaciones validadas para desplegar entornos con mínima fricción, facilitando a los equipos el proceso de configuración. Estas arquitecturas de referencia, que incluyen soluciones como AWS ParallelCluster y SageMaker HyperPod, cubrieron todo el stack técnico necesario.
El programa GENIAC ha evidenciado que entrenar modelos fundamentales a gran escala es un desafío organizativo. Gracias al soporte estructurado y a una estrecha colaboración, un pequeño grupo de participantes pudo manejar grandes cargas de trabajo en la nube con éxito. Al finalizar la segunda fase, se celebró un evento técnico en Tokio para preparar a los desarrolladores para la próxima etapa, marcando un avance significativo en la inteligencia artificial generativa. AWS continúa comprometido con el desarrollo de estas tecnologías a nivel global.










