Contacta con nosotros

Temario del curso

Introducción a los Modelos Multimodales Mistral

  • Vista general de Mistral Medium y capacidades multimodales
  • Modelos de OCR/documento y casos de uso
  • Integración con ecosistemas de código abierto

Pipelines de OCR y Visión

  • Fundamentos de OCR con modelos Mistral
  • Procesamiento previo de imágenes y documentos escaneados
  • Extracción de texto estructurado de imágenes

Comprensión de Documentos

  • Diseño de pipelines de PLN para documentos
  • Reconocimiento de entidades, resumen y clasificación
  • Vinculación cruzada entre datos de texto y visión

Aplicaciones de Búsqueda y Conocimiento

  • Sistemas de búsqueda de visión-texto
  • Construcción de búsquedas semánticas con salidas de OCR
  • Repositorios empresariales de documentos

Aplicaciones Asistentes e Interactivas

  • Diseño de UI para asistentes multimodales
  • Aplicaciones de accesibilidad (por ejemplo, visión a texto)
  • Herramientas de productividad del mundo real

Rendimiento y Optimización

  • Escala de pipelines multimodales
  • Ajuste del rendimiento de inferencia
  • evaluación de compensaciones entre precisión y eficiencia

Casos de Estudio y Direcciones Futuras

  • Aplicaciones industriales de la IA multimodal
  • Tendencias de investigación en OCR e IA para documentos
  • Consideraciones de IA responsable en tareas de visión-texto

Resumen y Próximos Pasos

Requerimientos

  • Comprensión de los conceptos de procesamiento del lenguaje natural (PLN)
  • Experiencia con Python y marcos de trabajo de ML
  • Familiaridad con los fundamentos de visión por computadora

Público Objetivo

  • Equipos de producto
  • Investigadores de ML
  • Ingenieros de ML aplicados
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas