Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Conceptos y métricas de rendimiento
- Latencia, rendimiento (throughput), consumo energético y utilización de recursos.
- Cuellos de botella a nivel de sistema vs. a nivel de modelo.
- Perfilado para inferencia frente a entrenamiento.
Perfilado en Huawei Ascend
- Uso del Profiler de CANN y MindInsight.
- Diagnóstico de kernels y operadores.
- Patrones de descarga (offload) y mapeo de memoria.
Perfilado en GPU Biren
- Funciones de monitoreo de rendimiento del SDK de Biren.
- Fusión de kernels, alineación de memoria y colas de ejecución.
- Perfilado consciente del consumo energético y la temperatura.
Perfilado en Cambricon MLU
- Herramientas de rendimiento BANGPy y Neuware.
- Visibilidad a nivel de kernel e interpretación de registros.
- Integración del profiler de MLU con frameworks de implementación.
Optimización a nivel de grafo y modelo
- Estrategias de poda de grafos y cuantización.
- Fusión de operadores y reestructuración del grafo computacional.
- Estandarización del tamaño de entrada y afinamiento por lotes (batch).
Optimización de memoria y kernels
- Optimización del diseño y reutilización de la memoria.
- Gestión eficiente de búferes entre diferentes conjuntos de chips.
- Técnicas de afinamiento a nivel de kernel específicas para cada plataforma.
Mejores prácticas multiplataforma
- Portabilidad del rendimiento: estrategias de abstracción.
- Construcción de pipelines de afinamiento compartidos para entornos multichip.
- Ejemplo: afinamiento de un modelo de detección de objetos en Ascend, Biren y MLU.
Resumen y próximos pasos
Requerimientos
- Experiencia trabajando con pipelines de entrenamiento o implementación de modelos de IA.
- Comprensión de los principios de cómputo de GPU/MLU y optimización de modelos.
- Conocimiento básico de herramientas y métricas de perfilado de rendimiento.
Público objetivo
- Ingenieros de rendimiento.
- Equipos de infraestructura de aprendizaje automático (machine learning).
- Arquitectos de sistemas de IA.
21 Horas