Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 14 horas
Temario del curso
Introducción al AIOps predictivo
- Visión general de la analítica predictiva en operaciones de TI
- Fuentes de datos para la predicción (logs, métricas, eventos)
- Conceptos clave en predicción de series de tiempo y patrones de anomalías
Diseño de modelos de predicción de incidentes
- Etiquetado de incidentes históricos y comportamiento del sistema
- Selección y entrenamiento de modelos (p. ej., LSTM, Random Forest, AutoML)
- Evaluación del rendimiento del modelo y manejo de falsos positivos
Recopilación de datos e ingeniería de características
- Ingesta y alineación de datos de logs y métricas como entrada para el modelo
- Extracción de características de datos estructurados y no estructurados
- Manejo de ruido y datos faltantes en pipelines operativos
Automatización del análisis de causa raíz (RCA)
- Correlación basada en grafos de servicios e infraestructura
- Uso de ML para inferir causas raíz probables a partir de cadenas de eventos
- Visualización de RCA mediante tableros conscientes de la topología
Remediación y automatización de flujos de trabajo
- Integración con plataformas de automatización (p. ej., Ansible, Rundeck)
- Activación de reversos, reinicios o redirección de tráfico
- Auditoría y documentación de intervenciones automatizadas
Escalado de pipelines inteligentes de AIOps
- MLOps para observabilidad: reentrenamiento y versionado de modelos
- Ejecución de predicciones en tiempo real a través de nodos distribuidos
- Mejores prácticas para el despliegue de AIOps en entornos de producción
Casos de estudio y aplicaciones prácticas
- Análisis de datos reales de incidentes utilizando modelos de AIOps predictivos
- Despliegue de pipelines de RCA con datos sintéticos y de producción
- Revisión de casos de uso de la industria: fallas en la nube, inestabilidad de microservicios, degradaciones de red
Resumen y siguientes pasos
Requerimientos
- Experiencia con sistemas de monitoreo como Prometheus o ELK
- Conocimiento práctico de Python y fundamentos de aprendizaje automático
- Familiaridad con flujos de trabajo de gestión de incidentes
Público objetivo
- Ingenieros de confiabilidad de sitios senior (SRE)
- Arquitectos de automatización de TI
- Líderes de plataformas DevOps y de observabilidad