Compartir:
Amazon Web Services (AWS) ha lanzado una nueva funcionalidad para mejorar la gestión de recursos en Amazon SageMaker, enfocándose en la asignación granular de cuotas de computación y memoria. Esta herramienta, implementada a través de la gobernanza de tareas de SageMaker HyperPod, busca optimizar el uso de los clústeres en el servicio Amazon Elastic Kubernetes Service (EKS).
Con esta innovación, los clientes pueden establecer límites claros en los recursos computacionales usados por diferentes usuarios y equipos, asegurándose de que ningún grupo acapare los recursos del clúster. Esta función es vital en contextos donde el presupuesto es una limitación, permitiendo una distribución justa de recursos de computación entre varios proyectos.
La gobernanza de tareas de HyperPod ofrece la capacidad de asignar recursos específicos, como GPU, vCPU y memoria de vCPU, permitiendo adaptarse a las necesidades y estrategias de cada equipo. Los administradores ahora pueden realizar asignaciones de GPU según el tipo de instancia, además de establecer cuotas de CPU y memoria para un control preciso. También pueden definir prioridades para gestionar el uso de recursos no utilizados.
Daniel Xu, Director de Producto en Snorkel AI, destacó cómo esta funcionalidad es crucial para maximizar la eficiencia de los clústeres, especialmente en experimentos complejos de inteligencia artificial. Según Xu, la capacidad de controlar el acceso a recursos avanzados, como las GPUs de última generación, es esencial para optimizar el rendimiento.
La implementación sigue un proceso conocido de creación de asignaciones de recursos, donde los administradores pueden definir políticas a través de la consola de gestión de AWS. Esto es especialmente beneficioso para los equipos que trabajan con modelos de inteligencia artificial, ya que una gestión eficiente de recursos puede mejorar significativamente los resultados.
Amazon SageMaker HyperPod ahora admite tanto instancias basadas en CPU y GPU como hardware AWS Neuron. Esta flexibilidad permite una gestión precisa de los recursos, respondiendo a la diversidad de necesidades en el ámbito del aprendizaje automático. Con estas mejoras, AWS reafirma su liderazgo en la optimización de infraestructuras para inteligencia artificial, facilitando el acceso a recursos esenciales sin malgasto.










