Ponte en Contacto

Temario del curso

1. Introducción a la Difusión Estable Avanzada

  • Objetivos del curso y ruta de aprendizaje
  • Revisión de los modelos de difusión
  • Visión general de la arquitectura de Difusión Estable
  • Modelos de Difusión Latente (LDMs)
  • Evolución de los modelos de Difusión Estable (SD 1.x, SDXL y arquitecturas más recientes)
  • Casos de uso empresarial y aplicaciones

2. Fundamentos del Aprendizaje Profundo para Modelos de Difusión

  • Fundamentos del proceso de difusión
  • Difusión hacia adelante y hacia atrás
  • Predicción de ruido
  • Arquitectura U-Net de desruido
  • Autoencoders Variacionales (VAE)
  • Encoder de texto CLIP
  • Mecanismos de atención cruzada

3. Comprensión de la Arquitectura de Difusión Estable

  • Componentes de la tubería (pipeline)
  • Proceso de codificación de texto
  • Representación en el espacio latente
  • Algoritmos del programador de pasos (scheduler)
  • Métodos de muestreo
  • Flujo de trabajo de decodificación de imágenes

4. Ingeniería de Prompts Avanzada

  • Estructura y sintaxis del prompt
  • Prompts positivos y negativos
  • Ponderación de prompts
  • Énfasis en tokens
  • Interpolación de prompts
  • Estrategias de optimización de prompts
  • Generación de imágenes reproducibles

5. Técnicas Avanzadas de Generación de Imágenes

  • Generación de imagen a imagen
  • Pintura interna (Inpainting)
  • Pintura externa (Outpainting)
  • Generación de alta resolución
  • Refinamiento en múltiples etapas
  • Generación de imágenes por lotes
  • Randomización controlada usando semillas (seeds)

6. Generación Condicional de Imágenes

  • Arquitectura ControlNet
  • Generación guiada por poses
  • Generación guiada por profundidad
  • Condicionamiento mediante detección de bordes
  • Orientación por segmentación
  • Condicionamiento con imágenes de referencia
  • Flujos de trabajo Multi-ControlNet

7. LoRA, DreamBooth y Ajuste Fino de Modelos

  • Conceptos de aprendizaje por transferencia
  • Fundamentos de LoRA
  • Entrenamiento con DreamBooth
  • Inversión textual
  • Embebidos personalizados
  • Conjuntos de datos para ajuste fino
  • Evaluación de modelos personalizados

8. Entrenamiento Avanzado de Modelos

  • Preparación del conjunto de datos
  • Aumento de datos
  • Generación de descripciones (captions)
  • Tuberías de entrenamiento
  • Entrenamiento distribuido
  • Entrenamiento con precisión mixta
  • Gestión de puntos de control (checkpoints)

9. Optimización de Hiperparámetros

  • Selección de la tasa de aprendizaje
  • Optimización del tamaño del lote
  • Selección del programador (scheduler)
  • Optimización del CFG Scale
  • Pasos de muestreo
  • Técnicas de regularización
  • Métricas de evaluación del modelo

10. Optimización del Rendimiento

  • Optimización de GPU
  • Optimización CUDA
  • Atención eficiente en memoria
  • Optimización con xFormers
  • Técnicas de cuantización
  • Inferencia FP16 y BF16
  • Lotes eficientes

11. Escalamiento de Cargas de Trabajo con Difusión Estable

  • Entrenamiento con múltiples GPUs
  • Inferencia distribuida
  • Gestión de conjuntos de datos a gran escala
  • Despliegue de GPU en la nube
  • Estrategias de servicio de modelos
  • Evaluación comparativa del rendimiento

12. Integración de Difusión Estable con Frameworks de Aprendizaje Profundo

  • Hugging Face Diffusers
  • Integración con PyTorch
  • Interoperabilidad con TensorFlow
  • RONNX Runtime
  • Optimización con TensorRT
  • Biblioteca Accelerate
  • Personalización de tuberías (pipelines)

13. Construcción de Tuberías de Producción

  • Desarrollo de API
  • Servicios de inferencia por lotes
  • Automatización de flujos de trabajo
  • Generación basada en colas
  • Versionado de modelos
  • Estrategias de despliegue en producción

14. Mejora de la Calidad de Imagen

  • Técnicas de escalado hacia arriba (upscaling)
  • Super-resolución
  • Restauración facial
  • Reducción de artefactos
  • Flujos de trabajo de refinamiento de imágenes
  • Tuberías de postprocesamiento

15. IA Responsable y Seguridad del Modelo

  • Sesgo en los modelos generativos
  • Generación ética de imágenes
  • Consideraciones de derechos de autor
  • Divulgación de contenido generado por IA
  • Filtros de seguridad
  • Modulación de prompts
  • Prácticas de despliegue responsable

16. Solución de Problemas y Depuración

  • Diagnóstico de fallos en la generación
  • Resolución de errores CUDA
  • Problemas de gestión de memoria
  • Mejora de la consistencia de las imágenes
  • Depuración de tuberías personalizadas
  • Solución de problemas de rendimiento

17. Monitoreo y Evaluación del Modelo

  • Medición de la calidad de generación
  • Evaluación comparativa de modelos (benchmarking)
  • Comparación de puntos de control
  • Registro de experimentos
  • Rastreo de experimentos
  • Reproducibilidad del modelo

18. Aplicaciones Avanzadas

  • Visualización en diseño de productos
  • Generación de contenido para marketing
  • Diseño de personajes
  • Visualización arquitectónica
  • Investigación en imagen médica
  • Visualización científica
  • Flujos de trabajo creativos con IA

19. Integración de Difusión Estable con Otros Modelos de IA

  • Modelos de Lenguaje Grande (LLMs)
  • Modelos Visión-Lenguaje (VLMs)
  • Subtitulado de imágenes
  • Generación Aumentada por Recuperación (RAG) para sistemas multimodales
  • Flujos de trabajo de agentes de IA
  • Orquestación de múltiples modelos

20. Mejores Prácticas para el Despliegue Empresarial

  • Planificación de infraestructura
  • Gestión de recursos GPU
  • Consideraciones de seguridad
  • Gobernanza de modelos
  • CI/CD para modelos de IA
  • Mantenimiento y actualizaciones

21. Taller Práctico y Resumen

  • Construcción de una tubería completa de generación de imágenes
  • Ajuste fino de un modelo personalizado de Difusión Estable
  • Creación de un flujo de trabajo de generación automatizado
  • Ejercicios de optimización de rendimiento
  • Evaluación y comparación de modelos
  • Repaso de los conceptos clave
  • Preguntas y respuestas
  • Siguientes pasos y recursos adicionales de aprendizaje

Requerimientos

  • Buen entendimiento de los conceptos y arquitecturas del aprendizaje profundo
  • Familiaridad con Difusión Estable y la generación de imágenes a partir de texto
  • Experiencia con PyTorch y programación en Python

Audiencia

  • Científicos de datos e ingenieros de aprendizaje automático
  • Investigadores en aprendizaje profundo
  • Expertos en visión por computadora.<
 21 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas