Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a los Modelos Multimodales Mistral
- Vista general de Mistral Medium y capacidades multimodales
- Modelos de OCR/documento y casos de uso
- Integración con ecosistemas de código abierto
Pipelines de OCR y Visión
- Fundamentos de OCR con modelos Mistral
- Procesamiento previo de imágenes y documentos escaneados
- Extracción de texto estructurado de imágenes
Comprensión de Documentos
- Diseño de pipelines de PLN para documentos
- Reconocimiento de entidades, resumen y clasificación
- Vinculación cruzada entre datos de texto y visión
Aplicaciones de Búsqueda y Conocimiento
- Sistemas de búsqueda de visión-texto
- Construcción de búsquedas semánticas con salidas de OCR
- Repositorios empresariales de documentos
Aplicaciones Asistentes e Interactivas
- Diseño de UI para asistentes multimodales
- Aplicaciones de accesibilidad (por ejemplo, visión a texto)
- Herramientas de productividad del mundo real
Rendimiento y Optimización
- Escala de pipelines multimodales
- Ajuste del rendimiento de inferencia
- evaluación de compensaciones entre precisión y eficiencia
Casos de Estudio y Direcciones Futuras
- Aplicaciones industriales de la IA multimodal
- Tendencias de investigación en OCR e IA para documentos
- Consideraciones de IA responsable en tareas de visión-texto
Resumen y Próximos Pasos
Requerimientos
- Comprensión de los conceptos de procesamiento del lenguaje natural (PLN)
- Experiencia con Python y marcos de trabajo de ML
- Familiaridad con los fundamentos de visión por computadora
Público Objetivo
- Equipos de producto
- Investigadores de ML
- Ingenieros de ML aplicados
14 Horas