Ponte en Contacto
 Duración 21 horas

Temario del curso

Introducción al escalado de Ollama

  • Arquitectura de Ollama y consideraciones para el escalado
  • Cuellos de botella comunes en despliegues multiusuario
  • Mejores prácticas para la preparación de la infraestructura

Asignación de recursos y optimización de GPU

  • Estrategias eficientes de utilización de CPU/GPU
  • Consideraciones de memoria y ancho de banda
  • Restricciones de recursos a nivel de contenedor

Despliegue con contenedores y Kubernetes

  • Contenedorización de Ollama con Docker
  • Ejecución de Ollama en clústeres de Kubernetes
  • Balanceo de carga y descubrimiento de servicios

Autoscaling y Batching

  • Diseño de políticas de autoscaling para Ollama
  • Técnicas de inferencia por lotes para la optimización del rendimiento
  • Compensación entre latencia y rendimiento

Optimización de latencia

  • Perfilado del rendimiento de la inferencia
  • Estrategias de caché y calentamiento de modelos
  • Reducción de la sobrecarga de E/S y comunicación

Monitoreo y Observabilidad

  • Integración de Prometheus para métricas
  • Creación de tableros con Grafana
  • Alertas y respuesta a incidentes para la infraestructura de Ollama

Gestión de costos y estrategias de escalado

  • Asignación de GPU con conciencia de costos
  • Consideraciones para el despliegue en la nube frente a las instalaciones propias
  • Estrategias para un escalado sostenible

Resumen y próximos pasos

Requerimientos

  • Experiencia en administración de sistemas Linux
  • Comprensión de la contenedorización y orquestación
  • Conocimiento del despliegue de modelos de aprendizaje automático

Audiencia

  • Ingenieros DevOps
  • Equipos de infraestructura de IA (ML)
  • Ingenieros de confiabilidad de sitios (SRE)

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas