Contacta con nosotros

Temario del curso

Introducción a EXO y agrupamiento de IA local

  • Panorama general del marco EXO y el ecosistema exo-explore.
  • Comparación entre inferencia centralizada en la nube e inferencia local distribuida.
  • Arquitectura: descubrimiento de dispositivos libp2p, backend MLX, tablero de control y capas de API.
  • Requisitos de hardware: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, almacenamiento compartido.

Instalación de EXO en macOS

  • Configuración de Xcode, Metal Toolchain y prerequisitos de macOS.
  • Instalación de uv, Node.js y el entorno Rust nightly.
  • Instalación de la bifurcación especificada de macmon para monitoreo en Apple Silicon.
  • Clonación del repositorio y construcción del tablero de control con npm.
  • Ejecución de EXO desde el código fuente y verificación del tablero localhost:52415.

Instalación de EXO en Linux

  • Instalación de dependencias mediante apt o Homebrew en Linux.
  • Configuración de uv, Node.js 18+ y Rust nightly.
  • Construcción del tablero y ejecución de EXO en modo exclusivo de CPU.
  • Estructura de directorios: rutas XDG Base Directory para configuración, datos, caché y registros.

Descubrimiento automático de dispositivos y formación de clúster

  • Comprensión del auto-descubrimiento basado en libp2p a través de redes locales.
  • Configuración de nombres personalizados con EXO_LIBP2P_NAMESPACE para aislamiento del clúster.
  • Verificación de la membresía del nodo en la vista del clúster del tablero.
  • Gestión de fallos de descubrimiento y problemas de segmentación de red.

Habilitación de RDMA sobre Thunderbolt 5

  • Arquitectura de RDMA y la afirmación de reducción del 99% en latencia.
  • Habilitación de RDMA en el modo de recuperación de macOS con rdma_ctl.
  • Requisitos de cableado y restricciones de topología de puertos en Mac Studio.
  • Igualdad de versiones de macOS en todos los nodos del clúster.
  • Resolución de problemas de descubrimiento de RDMA y configuración DHCP.

Implementación de modelos avanzados

  • Uso del tablero para cargar y fragmentar modelos DeepSeek v3.1, Qwen3-235B y la familia Llama.
  • Visualización de asignaciones de instancias mediante el endpoint /instance/previews de la API.
  • Creación de instancias de modelo con fragmentación por pipeline o paralelismo tensorial.
  • Configuración de tarjetas de modelos personalizados desde el hub HuggingFace.

Monitoreo y resolución de problemas

  • Lectura de registros EXO y comprensión del rastreo distribuido.
  • Interpretación del estado del clúster en la vista del tablero.
  • Diagnóstico de fallos de nodos trabajadores y comportamiento de reconexión.
  • Uso de EXO_TRACING_ENABLED para análisis de cuellos de botella de rendimiento.

Mantenimiento del clúster y actualizaciones

  • Actualización de los binarios EXO y procedimientos de reconstrucción del tablero.
  • Migración de cachés de modelos y gestión de modelos predescargados sobre NFS.
  • Eliminación ordenada de nodos y reequilibrio de cargas de trabajo.

Requerimientos

  • Comprensión de los fundamentos de redes (IP, subredes, firewalls).
  • Experiencia con la administración por línea de comandos en macOS o Linux.
  • Conocimiento sobre gestión de paquetes de Python (pip/uv) y herramientas de Node.js.

Público objetivo

  • Administradores de sistemas.
  • Ingenieros de DevOps.
  • Arquitectos de infraestructura de IA responsables del despliegue local de LLMs en instalaciones propias.
 21 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas