Contacta con nosotros

Temario del curso

Introducción a los modelos de lenguaje y visión

  • Visión general de los VLMs y su papel en la inteligencia artificial multimodal.
  • Arquitecturas populares: CLIP, Flamingo, BLIP, etc.
  • Casos de uso: búsqueda, generación de descripciones, sistemas autónomos, análisis de contenido.

Preparación del entorno de ajuste fino

  • Configuración de OpenCLIP y otras bibliotecas de VLMs.
  • Formatos de datos para pares de imagen-texto.
  • Pipelines de preprocesamiento para entradas visuales y de lenguaje.

Ajuste fino de CLIP y modelos similares

  • Pérdida contrastiva y espacios de incrustación conjuntos.
  • Práctica: ajuste fino de CLIP en conjuntos de datos personalizados.
  • Manejo de datos específicos del dominio y multilingües.

Técnicas avanzadas de ajuste fino

  • Uso de LoRA y métodos basados en adaptadores para mejorar la eficiencia.
  • Ajuste de prompts e inyección visual de prompts.
  • Compensaciones entre evaluación con cero ejemplos (zero-shot) y ajuste fino.

Evaluación y establecimiento de referencias

  • Métricas para VLMs: precisión de recuperación, BLEU, CIDEr, recall.
  • Diagnósticos de alineación visual-texto.
  • Visualización de espacios de incrustación y casos de mala clasificación.

Despliegue y uso en aplicaciones reales

  • Exportación de modelos para inferencia (TorchScript, ONNX).
  • Integración de VLMs en pipelines o APIs.
  • Consideraciones de recursos y escalabilidad del modelo.

Casos de estudio y escenarios aplicados

  • Análisis de medios y moderación de contenido.
  • Búsqueda y recuperación en comercio electrónico y bibliotecas digitales.
  • Interacción multimodal en robótica y sistemas autónomos.

Resumen y próximos pasos

Requerimientos

  • Conocimientos sobre aprendizaje profundo aplicado a la visión por computadora y al procesamiento de lenguaje natural (NLP).
  • Experiencia con PyTorch y modelos basados en transformadores.
  • Conocimiento de las arquitecturas de modelos multimodales.

Público objetivo

  • Ingenieros de visión por computadora.
  • Desarrolladores de inteligencia artificial (IA).
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas