Compartir:
El equipo de Inteligencia Artificial de Salesforce ha dado un paso significativo en la optimización de su proceso de despliegue de modelos de lenguaje grande (LLMs) al implementar Amazon Bedrock Custom Model Import. Tradicionalmente, la gestión de la infraestructura exigía prolongados esfuerzos que involucraban meses de optimización de instancias y configuraciones, lo que incrementaba tanto el tiempo como los costos operativos debido a las reservas de capacidad de GPU. Sin embargo, el cambio a Amazon Bedrock ha permitido al equipo concentrarse más en el desarrollo de modelos y en la lógica empresarial, reduciendo así la carga operativa.
La integración con Amazon Bedrock se planificó cuidadosamente para asegurar que las cargas de trabajo productivas no se vieran interrumpidas. Gracias a ello, Salesforce logró mantener sus API y las interfaces de servicio sin alteraciones, permitiendo un despliegue sin tiempo de inactividad. Además, al aprovechar la capacidad sin servidor de Amazon Bedrock, la empresa pudo conservar su inversión en infraestructura existente.
Durante la fase de implementación, se mejoró el proceso de entrega de modelos registrando estos mediante el API de Amazon Bedrock Custom Model Import tras guardar los artefactos en un bucket de Amazon S3. Este procedimiento ha reducido el tiempo de despliegue a aproximadamente una hora, aumentando la eficiencia gracias a la pre-carga de modelos de Amazon Bedrock, lo que evita la necesidad de descargar pesos al iniciar el contenedor.
Salesforce llevó a cabo pruebas de carga que confirmaron la capacidad de escalabilidad de Amazon Bedrock. Los resultados mostraron una latencia un 44% menor en niveles bajos de concurrencia, manteniendo un rendimiento consistente incluso bajo cargas pesadas. La capacidad de autoescalado asegura que el servicio puede responder eficazmente a las variaciones de carga en tiempo real.
Desde el punto de vista operativo, Salesforce ha logrado reducir en un 30% el tiempo necesario para iterar y desplegar modelos, así como un ahorro de costos de hasta el 40% gracias a la flexibilidad del modelo de pago por uso. Esto ha sido especialmente beneficioso en entornos de desarrollo donde los recursos de GPU únicamente son necesarios durante períodos activos.
El proceso ha resaltado la importancia de validar la compatibilidad del modelo antes del despliegue y considerar el impacto de los tiempos de inicio en modelos de mayor tamaño. Para aquellos interesados en simplificar el despliegue de modelos de lenguaje a gran escala, el caso de Salesforce proporciona un marco claro para enfrentar desafíos operativos y de costo sin comprometer el rendimiento.










