Ajuste fino con aprendizaje por refuerzo mediante retroalimentación humana (RLHF)
El aprendizaje por refuerzo mediante retroalimentación humana (RLHF) es un método de vanguardia utilizado para ajustar modelos como ChatGPT y otros sistemas de inteligencia artificial de primer nivel.
Esta formación en vivo impartida por un instructor (en línea o presencial) está dirigida a ingenieros de machine learning e investigadores de IA de nivel avanzado que desean aplicar RLHF para ajustar grandes modelos de IA con el fin de obtener un mejor rendimiento, seguridad y alineación.
Al finalizar esta formación, los participantes podrán:
- Comprender los fundamentos teóricos del RLHF y por qué es esencial en el desarrollo moderno de IA.
- Implementar modelos de recompensa basados en retroalimentación humana para guiar los procesos de aprendizaje por refuerzo.
- Ajustar grandes modelos de lenguaje utilizando técnicas de RLHF para alinear las salidas con las preferencias humanas.
- Aplicar las mejores prácticas para escalar flujos de trabajo de RLHF hacia sistemas de IA de grado de producción.
Formato del curso
- Clase interactiva y discusión.
- Muchos ejercicios y práctica.
- Implementación práctica en un entorno de laboratorio en vivo.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para coordinar los detalles.
Temario del curso
Introducción al aprendizaje por refuerzo mediante retroalimentación humana (RLHF)
- ¿Qué es el RLHF y por qué es importante?
- Comparación con métodos de ajuste fino supervisado.
- Aplicaciones del RLHF en sistemas modernos de IA.
Modelado de recompensas con retroalimentación humana
- Recopilación y estructuración de la retroalimentación humana.
- Construcción y entrenamiento de modelos de recompensa.
- Evaluación de la efectividad de los modelos de recompensa.
Entrenamiento con Optimización de Política Próxima (PPO)
- Visión general de los algoritmos PPO para RLHF.
- Implementación de PPO con modelos de recompensa.
- Ajuste fino iterativo y seguro de los modelos.
Ajuste fino práctico de modelos de lenguaje
- Preparación de conjuntos de datos para flujos de trabajo de RLHF.
- Ajuste fino práctico de un LLM pequeño mediante RLHF.
- Desafíos y estrategias de mitigación.
Escalar el RLHF a sistemas de producción
- Consideraciones de infraestructura y capacidad de cómputo.
- Control de calidad y bucles de retroalimentación continua.
- Mejores prácticas para implementación y mantenimiento.
Consideraciones éticas y mitigación del sesgo
- Abordaje de riesgos éticos en la retroalimentación humana.
- Estrategias de detección y corrección del sesgo.
- Asegurar la alineación y salidas seguras.
Casos de estudio y ejemplos del mundo real
- Caso de estudio: Ajuste fino de ChatGPT con RLHF.
- Otros despliegues exitosos de RLHF.
- Lecciones aprendidas e ideas clave de la industria.
Resumen y próximos pasos
Requerimientos
- Comprensión de los fundamentos del aprendizaje supervisado y el aprendizaje por refuerzo.
- Experiencia con ajuste fino de modelos y arquitecturas de redes neuronales.
- Conocimiento del lenguaje de programación Python y frameworks de aprendizaje profundo (por ejemplo, TensorFlow, PyTorch).
Público objetivo
- Ingenieros de machine learning.
- Investigadores de IA.
Los cursos públicos requieren más de 5 participantes.
Ajuste fino con aprendizaje por refuerzo mediante retroalimentación humana (RLHF) - Reserva
Ajuste fino con aprendizaje por refuerzo mediante retroalimentación humana (RLHF) - Consulta
Ajuste fino con aprendizaje por refuerzo mediante retroalimentación humana (RLHF) - Solicitud de consultoría
Próximos cursos
Cursos Relacionados
Ajuste fino avanzado y gestión de prompts en Vertex AI
14 HorasVertex AI ofrece herramientas avanzadas para el ajuste fino de modelos grandes y la gestión de prompts, lo que permite a los desarrolladores y equipos de datos optimizar la precisión de los modelos, agilizar los flujos de trabajo de iteración y garantizar un rigor evaluativo mediante bibliotecas y servicios integrados.
Esta formación en vivo impartida por instructores (en línea o presencial) está dirigida a profesionales de nivel intermedio a avanzado que deseen mejorar el rendimiento y la fiabilidad de las aplicaciones de IA generativa utilizando ajuste fino supervisado, versionado de prompts y servicios de evaluación en Vertex AI.
Al finalizar esta formación, los participantes serán capaces de:
- Aplicar técnicas de ajuste fino supervisado a los modelos Gemini en Vertex AI.
- Implementar flujos de trabajo de gestión de prompts que incluyan versionado y pruebas.
- Aprovechar las bibliotecas de evaluación para establecer líneas base y optimizar el rendimiento de la IA.
- Desplegar y monitorear modelos mejorados en entornos de producción.
Formato del curso
- Clase interactiva y debate.
- Laboratorios prácticos con herramientas de ajuste fino y gestión de prompts en Vertex AI.
- Estudios de caso sobre optimización de modelos empresariales.
Opciones de personalización del curso
- Para solicitar una formación personalizada para este curso, contáctenos para coordinar los detalles.
Técnicas Avanzadas en Aprendizaje por Transferencia
14 HorasEsta formación en vivo impartida por un instructor en Peru (en línea o presencial) está dirigida a profesionales avanzados en aprendizaje automático que deseen dominar técnicas de vanguardia en aprendizaje por transferencia y aplicarlas a problemas complejos del mundo real.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender conceptos y metodologías avanzadas en aprendizaje por transferencia.
- Implementar técnicas de adaptación específica del dominio para modelos preentrenados.
- Aplicar el aprendizaje continuo para gestionar tareas y conjuntos de datos en evolución.
- Domino el ajuste fino multitarea para mejorar el rendimiento del modelo a través de diferentes tareas.
Aprendizaje Continuo y Estrategias de Actualización de Modelos para Modelos Ajustados
14 HorasEsta formación en vivo impartida por un instructor en Peru (en línea o presencial) está dirigida a ingenieros de mantenimiento de IA de nivel avanzado y profesionales de MLOps que deseen implementar pipelines robustos de aprendizaje continuo y estrategias de actualización eficaces para modelos desplegados y ajustados.
Al finalizar esta formación, los participantes podrán:
- Diseñar e implementar flujos de trabajo de aprendizaje continuo para modelos desplegados.
- Minimizar el olvido catastrófico mediante una gestión adecuada del entrenamiento y la memoria.
- Automatizar la monitorización y los disparadores de actualización basados en la deriva del modelo o cambios en los datos.
- Integrar estrategias de actualización de modelos en las pipelines CI/CD y MLOps existentes.
Despliegue de Modelos Ajustados en Producción
21 HorasEsta formación en vivo, impartida por un instructor en Peru (en línea o presencial), está dirigida a profesionales de nivel avanzado que desean desplegar modelos ajustados de manera fiable y eficiente.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender los desafíos asociados al despliegue de modelos ajustados en producción.
- Contenedorizar e implementar modelos utilizando herramientas como Docker y Kubernetes.
- Implementar sistemas de monitoreo y registro de actividades (logging) para los modelos desplegados.
- Optimizar los modelos para reducir la latencia y mejorar la escalabilidad en escenarios del mundo real.
Ajuste Fino Específico del Dominio para Finanzas
21 HorasEsta capacitación en vivo impartida por un instructor en Peru (en línea o presencial) está dirigida a profesionales de nivel intermedio que desean adquirir habilidades prácticas para personalizar modelos de IA para tareas financieras críticas.
Al finalizar esta capacitación, los participantes podrán:
- Comprender los fundamentos del ajuste fino para aplicaciones financieras.
- Aprovechar modelos preentrenados para tareas específicas del dominio en finanzas.
- Aplicar técnicas para la detección de fraude, evaluación de riesgos y generación de asesoría financiera.
- Garantizar el cumplimiento de regulaciones financieras como GDPR y SOX.
- Implementar prácticas de seguridad de datos e IA ética en aplicaciones financieras.
Ajuste Fino de Modelos y Modelos de Lenguaje Grande (LLM)
14 HorasEsta capacitación en vivo con instructor en Peru (en línea o presencial) está dirigida a profesionales de nivel intermedio a avanzado que deseen personalizar modelos preentrenados para tareas y conjuntos de datos específicos.
Al finalizar esta capacitación, los participantes podrán:
- Comprender los principios del ajuste fino y sus aplicaciones.
- Preparar conjuntos de datos para el ajuste fino de modelos preentrenados.
- Aplicar ajuste fino a grandes modelos de lenguaje (LLM) para tareas de PNL.
- Optimizar el rendimiento del modelo y abordar los desafíos comunes.
Fine-tuning eficiente con Adaptación de Bajo Rango (LoRA)
14 HorasEsta formación en vivo, impartida por un instructor, en Peru (en línea o presencial), está dirigida a desarrolladores y profesionales de la IA de nivel intermedio que desean implementar estrategias de fine-tuning para modelos grandes sin necesidad de recursos computacionales extensos.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender los principios de la Adaptación de Bajo Rango (LoRA).
- Implementar LoRA para realizar un fine-tuning eficiente de modelos grandes.
- Optimizar el fine-tuning para entornos con recursos limitados.
- Evaluar e implementar modelos ajustados con LoRA en aplicaciones prácticas.
Ajuste fino de modelos multimodales
28 HorasEsta formación en vivo dirigida por un instructor en Peru (en línea o presencial) está dirigida a profesionales de nivel avanzado que desean dominar el ajuste fino de modelos multimodales para soluciones de inteligencia artificial innovadoras.
Al finalizar esta formación, los participantes podrán:
- Comprender la arquitectura de modelos multimodales como CLIP y Flamingo.
- Preparar y preprocesar conjuntos de datos multimodales de manera efectiva.
- Ajustar finamente los modelos multimodales para tareas específicas.
- Optimizar los modelos para aplicaciones del mundo real y mejorar su rendimiento.
Ajuste Fino para Procesamiento del Lenguaje Natural (NLP)
21 HorasEste entrenamiento en vivo impartido por un instructor en Peru (en línea o presencial) está dirigido a profesionales de nivel intermedio que desean mejorar sus proyectos de PLN mediante el ajuste fino efectivo de modelos lingüísticos preentrenados.
Al finalizar este entrenamiento, los participantes podrán:
- Comprender los fundamentos del ajuste fino para tareas de PLN.
- Ajustar finamente modelos preentrenados como GPT, BERT y T5 para aplicaciones específicas de PLN.
- Optimizar hiperparámetros para mejorar el rendimiento del modelo.
- Evaluar e implementar modelos ajustados en escenarios del mundo real.
Ajuste fino de IA para Servicios Financieros: Predicción de Riesgos y Detección de Fraude
14 HorasEsta formación en vivo dirigida por instructores en Peru (en línea o presencial) está dirigida a científicos de datos e ingenieros de IA de nivel avanzado en el sector financiero que desean ajustar modelos para aplicaciones como la puntuación de crédito, la detección de fraude y la modelización de riesgos utilizando datos financieros específicos del dominio.
Al finalizar esta formación, los participantes serán capaces de:
- Ajustar modelos de IA en conjuntos de datos financieros para mejorar la predicción de fraude y riesgos.
- Aplicar técnicas como el aprendizaje por transferencia, LoRA y regularización para mejorar la eficiencia del modelo.
- Integrar consideraciones de cumplimiento financiero en el flujo de trabajo de modelización de IA.
- Desplegar modelos ajustados para su uso en producción en plataformas de servicios financieros.
Ajuste fino de IA para la atención médica: Diagnóstico médico y análisis predictivo
14 HorasEsta formación en vivo, impartida por un instructor, en <ubicación> (en línea o presencial), está dirigida a desarrolladores de IA médica y científicos de datos de nivel intermedio a avanzado que deseen ajustar modelos para el diagnóstico clínico, la predicción de enfermedades y la proyección de resultados del paciente, utilizando datos médicos estructurados y no estructurados.
Al finalizar esta formación, los participantes podrán:
- Ajustar modelos de IA en conjuntos de datos de atención médica, incluyendo historiales médicos electrónicos (EMR), imágenes y datos de series temporales.
- Aplicar aprendizaje por transferencia, adaptación de dominio y compresión de modelos en contextos médicos.
- Abordar la privacidad, los sesgos y el cumplimiento normativo en el desarrollo de modelos.
- Implementar y monitorear modelos ajustados en entornos reales de atención médica.
Ajuste fino de modelos LLM de DeepSeek para crear modelos de IA personalizados
21 HorasEsta formación en vivo, impartida por un instructor en Peru (en línea o presencial), está dirigida a investigadores de IA de nivel avanzado, ingenieros de aprendizaje automático y desarrolladores que deseen ajustar finamente los modelos LLM de DeepSeek para crear aplicaciones de IA especializadas adaptadas a industrias, dominios o necesidades empresariales específicas.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender la arquitectura y las capacidades de los modelos DeepSeek, incluidos DeepSeek-R1 y DeepSeek-V3.
- Preparar conjuntos de datos y preprocesar la información para el ajuste fino.
- Ajustar finamente DeepSeek LLM para aplicaciones específicas del dominio.
- Optimizar e implementar modelos ajustados de manera eficiente.
Ajuste fino de la IA de defensa para sistemas autónomos y vigilancia
14 HorasEste entrenamiento en vivo con instructor en Peru (en línea o presencial) está dirigido a ingenieros de IA de defensa de nivel avanzado y desarrolladores de tecnología militar que desean ajustar modelos de aprendizaje profundo para su uso en vehículos autónomos, drones y sistemas de vigilancia, cumpliendo con estrictos estándares de seguridad y confiabilidad.
Al finalizar este entrenamiento, los participantes serán capaces de:
- Ajustar modelos de visión por computadora y fusión de sensores para tareas de vigilancia y apuntado.
- Adaptar sistemas de IA autónomos a entornos en cambio y perfiles de misión.
- Implementar mecanismos robustos de validación y seguridad en los flujos de trabajo del modelo.
- Asegurar el cumplimiento con los estándares específicos de defensa, seguridad y protección.
Ajuste fino de modelos de IA jurídica: Revisión de contratos e investigación legal
14 HorasEsta formación en vivo con instructor en Peru (en línea o presencial) está dirigida a ingenieros de tecnología jurídica y desarrolladores de IA de nivel intermedio que deseen realizar ajustes finos en modelos de lenguaje para tareas como el análisis de contratos, la extracción de cláusulas y la investigación legal automatizada en entornos de servicios legales.
Al finalizar esta formación, los participantes serán capaces de:
- Preparar y limpiar documentos legales para realizar ajustes finos en modelos de PLN.
- Aplicar estrategias de ajuste fino para mejorar la precisión del modelo en tareas legales.
- Implementar modelos que asistan en la revisión, clasificación e investigación de contratos.
- Garantizar el cumplimiento normativo, la auditoría y la trazabilidad de los resultados de la IA en contextos legales.
Ajuste Fino de Modelos de Lenguaje Grandes Utilizando QLoRA
14 HorasEsta formación en vivo, impartida por un instructor en Peru (en línea o presencial), está dirigida a ingenieros de aprendizaje automático de nivel intermedio a avanzado, desarrolladores de IA y científicos de datos que deseen aprender a utilizar QLoRA para ajustar finamente modelos grandes de manera eficiente, adaptándolos a tareas específicas y personalizaciones.
Al finalizar esta formación, los participantes serán capaces de:
- Comprender la teoría detrás de QLoRA y las técnicas de cuantificación para LLM.
- Implementar QLoRA en el ajuste fino de modelos de lenguaje grandes para aplicaciones de dominio específico.
- Optimizar el rendimiento del ajuste fino con recursos computacionales limitados utilizando cuantificación.
- Desplegar y evaluar los modelos ajustados finamente en aplicaciones del mundo real de manera eficiente.