Contacta con nosotros

Temario del curso

Introducción a la IA Multimodal

  • Descripción general de la IA multimodal y sus aplicaciones en el mundo real.
  • Desafíos en la integración de datos de texto, imagen y audio.
  • Investigaciones y avances más recientes.

Procesamiento de Datos e Ingeniería de Características

  • Manejo de conjuntos de datos de texto, imagen y audio.
  • Técnicas de preprocesamiento para el aprendizaje multimodal.
  • Estrategias de extracción de características y fusión de datos.

Construcción de Modelos Multimodales con PyTorch y Hugging Face

  • Introducción a PyTorch para el aprendizaje multimodal.
  • Uso de los Transformadores de Hugging Face para tareas de PLN (Procesamiento de Lenguaje Natural) y visión por computadora.
  • Combinación de diferentes modalidades en un único modelo de IA unificado.

Implementación de la Fusión de Voz, Visión y Texto

  • Integración de OpenAI Whisper para el reconocimiento de voz.
  • Aplicación de DeepSeek-Vision para el procesamiento de imágenes.
  • Técnicas de fusión para el aprendizaje cross-modal (entrecruzado).

Entrenamiento y Optimización de Modelos de IA Multimodal

  • Estrategias de entrenamiento de modelos para la IA multimodal.
  • Técnicas de optimización y ajuste de hiperparámetros.
  • Abordaje del sesgo y mejora de la generalización del modelo.

Despliegue de IA Multimodal en Aplicaciones del Mundo Real

  • Exportación de modelos para uso en producción.
  • Despliegue de modelos de IA en plataformas en la nube.
  • Monitoreo del rendimiento y mantenimiento del modelo.

Temas Avanzados y Tendencias Futuras

  • Aprendizaje cero (zero-shot) y de pocos ejemplos (few-shot) en la IA multimodal.
  • Consideraciones éticas y desarrollo responsable de la IA.
  • Tendencias emergentes en la investigación de la IA multimodal.

Resumen y Próximos Pasos

Requerimientos

  • Sólido entendimiento de los conceptos de aprendizaje automático y aprendizaje profundo.
  • Experiencia con frameworks de IA como PyTorch o TensorFlow.
  • Familiaridad con el procesamiento de datos de texto, imagen y audio.

Público objetivo

  • Desarrolladores de IA.
  • Ingenieros de aprendizaje automático.
  • Investigadores.
 21 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas