Ponte en Contacto

Temario del curso

El panorama de la observabilidad impulsada por IA

  • De los paneles de control a las conversaciones: el cambio hacia una observabilidad aumentada por IA.
  • Capacidades de LLM relevantes para la observabilidad: resumimiento, razonamiento y coincidencia de patrones.
  • Patrones de arquitectura: integrar IA en pilas de observabilidad existentes.

Consultas de telemetría en lenguaje natural

  • De texto a PromQL: traducción de lenguaje natural a consultas de monitoreo.
  • Consultas en lenguaje natural para almacenes de registros de Elasticsearch, OpenSearch y Loki.
  • Generación de SQL a partir de lenguaje natural para telemetría estructurada.
  • Desarrollo de un agente asistente de consultas con uso de herramientas y conciencia contextual.

Análisis de registros potenciado por LLM

  • Analización y estructuración automatizada de registros con LLM.
  • Detección de anomalías en flujos de registros utilizando similitud de incrustaciones (embeddings).
  • Agrupación de registros y descubrimiento de patrones a gran escala.
  • Generación de explicaciones legibles por humanos a partir de secuencias de registros en crudo.

Alertas inteligentes y enriquecimiento de incidentes

  • Correlación y deduplicación de alertas con comprensión semántica.
  • Recopilación automatizada de contexto de incidentes a partir de manuales de operación (runbooks), incidentes pasados y documentación.
  • Ruteo inteligente de alertas basado en la comprensión del contenido y la experiencia del equipo.
  • Reducción de la fatiga de alertas mediante reducción de ruido impulsada por IA.

Análisis de la causa raíz asistido por IA

  • Generación de hipótesis a partir de la correlación de telemetría multiorigen.
  • Cadenas de evidencias: conexión de síntomas entre métricas, registros y rastreo (traces).
  • Resolución guiada de problemas con sesiones de diagnóstico interactivo con IA.
  • Desarrollo de un agente de análisis de la causa raíz con investigación progresiva.

Respuesta automatizada a incidentes y comunicación

  • Generación de resúmenes de incidentes y actualizaciones de estado a partir de telemetría.
  • Borrado automatizado de análisis póstumo (postmortem) con reconstrucción de la línea de tiempo.
  • Comunicación con las partes interesadas adaptada a audiencias técnicas y ejecutivas.
  • Sugerencia de manuales de operación (runbooks) y recomendaciones de remediación automatizada.

Máquinas de aprendizaje para la observabilidad

  • Predicción de series temporales para la planificación de capacidad y predicción de anomalías.
  • Modelos base para la detección de anomalías sin ejemplos previos (zero-shot) en métricas.
  • Mapeo de dependencias de servicios basado en incrustaciones (embeddings) y descubrimiento de topología.
  • Entrenamiento e implementación de modelos ligeros de máquinas de aprendizaje junto con las tuberías de observabilidad.

Implementación en producción y ética

  • Consideraciones de latencia y costo para la observabilidad en tiempo real con IA.
  • Privacidad de datos: asegurar que los LLM no filtren telemetría sensible.
  • Supervisión humana: cuándo el diagnóstico de IA requiere validación por operadores.
  • Medición del impacto: MTTD, MTTR y métricas de la experiencia de guardia (on-call).

Requerimientos

  • Experiencia con herramientas de observabilidad como Prometheus, Grafana, Datadog o OpenTelemetry.
  • Conocimientos sobre gestión de registros y conceptos de métricas.
  • Scripting básico en Python para el procesamiento de datos.

Público objetivo

  • Ingenieros de SRE y observabilidad que adoptan herramientas mejoradas con IA.
  • Ingenieros de plataforma que desarrollan tuberías de monitoreo de próxima generación.
  • Líderes de DevOps que evalúan la integración de LLM en los flujos de trabajo de gestión de incidentes.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas