Ponte en Contacto
 Duración 14 horas

Temario del curso

Diseño de una arquitectura abierta de AIOps

  • Visión general de los componentes clave en las pipelines de AIOps abiertas
  • Flujo de datos desde la ingesta hasta el alertamiento
  • Comparación de herramientas y estrategia de integración

Recopilación y agregación de datos

  • Ingesta de datos de series temporales con Prometheus
  • Captura de registros con Logstash y Beats
  • Normalización de datos para la correlación entre fuentes

Construcción de paneles de observabilidad

  • Visualización de métricas con Grafana
  • Creación de paneles de Kibana para el análisis de registros
  • Uso de consultas de Elasticsearch para extraer información operativa

Detección de anomalías y predicción de incidentes

  • Exportación de datos de observabilidad a pipelines de Python
  • Entrenamiento de modelos de ML para la detección de valores atípicos y la previsión
  • Despliegue de modelos para inferencia en vivo en la pipeline de observabilidad

Alertamiento y automatización con herramientas abiertas

  • Creación de reglas de alertamiento de Prometheus y enrutamiento de Alertmanager
  • Activación de scripts o flujos de trabajo de API para la respuesta automática
  • Uso de herramientas de orquestación de código abierto (por ejemplo, Ansible, Rundeck)

Consideraciones de integración y escalabilidad

  • Gestión de la ingesta de alto volumen y la retención a largo plazo
  • Seguridad y control de acceso en stacks de código abierto
  • Escalado de cada capa de manera independiente: ingesta, procesamiento, alertamiento

Aplicaciones del mundo real y extensiones

  • Estudios de caso: ajuste de rendimiento, prevención de caídas y optimización de costos
  • Extensión de pipelines con herramientas de trazado o gráficos de servicios
  • Buenas prácticas para ejecutar y mantener AIOps en producción

Resumen y próximos pasos

Requerimientos

  • Experiencia con herramientas de observabilidad como Prometheus o ELK.
  • Conocimientos prácticos de Python y fundamentos de aprendizaje automático.
  • Comprensión de las operaciones de TI y los flujos de trabajo de alertamiento.

Público objetivo

  • Ingenieros de confiabilidad de sitios (SRE) de nivel avanzado.
  • Ingenieros de datos que trabajan en operaciones.
  • Líderes de plataformas DevOps y arquitectos de infraestructura.

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas