Temario del curso
Introducción, Objetivos y Estrategia de Migración
- Objetivos del curso, alineación con el perfil del participante y criterios de éxito.
- Enfoques de migración a alto nivel y consideraciones de riesgos.
- Configuración de espacios de trabajo, repositorios y conjuntos de datos de laboratorio.
Día 1 — Fundamentos de Migración y Arquitectura
- Conceptos de Lakehouse, visión general de Delta Lake y arquitectura de Databricks.
- Diferencias entre SMP y MPP e implicaciones para la migración.
- Diseño Medallion (Bronce → Plata → Oro) y visión general de Unity Catalog.
Laboratorio Día 1 — Traducción de un Procedimiento Almacenado
- Migración práctica de un procedimiento almacenado de ejemplo a un notebook.
- Traducción de tablas temporales y cursores a transformaciones de DataFrame.
- Validación y comparación con la salida original.
Día 2 — Delta Lake Avanzado y Carga Incremental
- Transacciones ACID, registros de compromiso, versionado y viaje en el tiempo.
- Auto Loader, patrones MERGE INTO, operaciones de actualización e inserción (upserts) y evolución de esquema.
- OPTIMIZE, VACUUM, Z-ORDER, particionado y ajuste de almacenamiento.
Laboratorio Día 2 — Ingestión Incremental y Optimización
- Implementación de ingestión con Auto Loader y flujos de trabajo de MERGE.
- Aplicación de OPTIMIZE, Z-ORDER y VACUUM; validación de resultados.
- Medición de mejoras en el rendimiento de lectura y escritura.
Día 3 — SQL en Databricks, Rendimiento y Depuración
- Funcionalidades de SQL analítico: funciones de ventana, funciones de orden superior, manejo de JSON/arrays.
- Lectura de la interfaz de usuario de Spark (Spark UI), DAGs, mezclas (shuffles), etapas, tareas y diagnóstico de cuellos de botella.
- Patrones de ajuste de consultas: uniones de difusión (broadcast joins), pistas (hints), caché y reducción de desbordamiento (spill).
Laboratorio Día 3 — Refactorización de SQL y Ajuste de Rendimiento
- Refactorización de un proceso SQL pesado en SQL de Spark optimizado.
- Uso de trazas de Spark UI para identificar y corregir problemas de sesgo (skew) y mezclas (shuffle).
- Benchmark antes/después y documentación de los pasos de ajuste.
Día 4 — PySpark Táctico: Reemplazo de Lógica Procedimental
- Modelo de ejecución de Spark: controlador (driver), ejecutores (executors), evaluación perezosa y estrategias de particionado.
- Transformación de bucles y cursores en operaciones vectorizadas de DataFrame.
- Modularización, UDFs/UDFs de pandas, widgets y bibliotecas reutilizables.
Laboratorio Día 4 — Refactorización de Scripts Procedimentales
- Refactorización de un script ETL procedimental en notebooks de PySpark modulares.
- Introducción a parametrización, pruebas de estilo unidad y funciones reutilizables.
- Revisión de código y aplicación de la lista de verificación de mejores prácticas.
Día 5 — Orquestación, Pipeline de Extremo a Extremo y Mejores Prácticas
- Databricks Workflows: diseño de trabajos, dependencias de tareas, disparadores y manejo de errores.
- Diseño de pipelines Medallion incrementales con reglas de calidad y validación de esquemas.
- Integración con Git (GitHub/Azure DevOps), CI y estrategias de pruebas para lógica de PySpark.
Laboratorio Día 5 — Construcción de un Pipeline de Extremo a Extremo Completo
- Ensamblaje de un pipeline Bronce → Plata → Oro orquestado con Workflows.
- Implementación de registros (logging), auditoría, reintentos y validaciones automatizadas.
- Ejecución del pipeline completo, validación de salidas y preparación de notas de implementación.
Operacionalización, Gobernanza y Listo para Producción
- Mejores prácticas de gobernanza, linaje y controles de acceso de Unity Catalog.
- Costos, dimensionamiento de clústeres, escalado automático (autoscaling) y patrones de concurrencia de trabajos.
- Listas de verificación de implementación, estrategias de reversión (rollback) y creación de manuales de operaciones (runbooks).
Revisión Final, Transferencia de Conocimiento y Próximos Pasos
- Presentaciones de los participantes sobre el trabajo de migración y lecciones aprendidas.
- Análisis de brechas, actividades de seguimiento recomendadas y entrega de materiales de capacitación.
- Referencias, rutas de aprendizaje adicionales y opciones de soporte.
Requerimientos
- Comprensión de conceptos de ingeniería de datos.
- Experiencia con SQL y procedimientos almacenados (Synapse / SQL Server).
- Familiaridad con conceptos de orquestación ETL (ADF o similares).
Audiencia
- Gerentes de tecnología con experiencia en ingeniería de datos.
- Ingenieros de datos que están migrando lógica OLAP procedimental a patrones de Lakehouse.
- Ingenieros de plataforma responsables de la adopción de Databricks.
Reseñas (1)
Todos los temas que abarca, aunque muchos fueron muy rápidos, nos da una idea de lo que necesitaremos ahondar. Además me gustó que pudimos hacer practicas, aunque insisto, creo que el curso amerita mas.