Temario del curso
Día 1: Construir la Base — Ingesta, Búsqueda, Recuperación
Módulo 1: El Panorama del Ingeniero Legal
- Objetivos de aprendizaje: comprender el rol, dónde encaja la IA en el trabajo legal y los dos riesgos que atraviesan todo.
- Temas
-
- El rol del ingeniero legal y por qué se está contratando ahora mismo.
- Dónde encaja la IA: eDiscovery, revisión, contratos, investigación, investigaciones; el modelo EDRM en términos simples.
- Construir vs. comprar.
- Los dos riesgos que atraviesan todo: confidencialidad/privilegio y defensibilidad.
Módulo 2: Los Datos Legales son Desordenados — Ingesta y Extracción
- Objetivos de aprendizaje: manejar la realidad de los datos legales a escala.
- Temas
- Más de 1.400 tipos de archivos, correos electrónicos y PST, papel escaneado, archivos de carga (.dat/.opt); metadatos incrustados relevantes.
- Extracción de texto (Tika), OCR y desduplicación como elección.
- Laboratorio: Ingesta con FreeEed — construir una canalización de ingestión sobre un conjunto deliberadamente desordenado de documentos (correo/PST, escaneos, archivos de carga).
Módulo 3: Búsqueda y Recuperación — la Base Fundamental
- Objetivos de aprendizaje: construir la primitiva central de eDiscovery: encontrar cualquier cosa dentro de todo.
- Temas: búsqueda y indexación de texto completo (Solr/Lucene); relevancia, metadatos y filtrado por fecha; búsqueda en contenido OCRizado.
- Laboratorio: Búsqueda de eDiscovery — indexar un corpus y realizar búsquedas reales estilo eDiscovery, incluyendo dentro de escaneos OCRizados.
Módulo 4: RAG para Documentos Legales — con Citas
- Objetivos de aprendizaje: construir RAG sobre documentos legales que cite sus fuentes.
- Temas
- Por qué la recuperación, no el ajuste fino, para material sensible: el modelo nunca "absorbe" los documentos.
- Agrupamiento (chunking), incrustaciones (embeddings) y, sobre todo, citas/proveniencia.
- Resumen de múltiples documentos e hilos de conversación.
- Laboratorio: RAG Legal con Citas — construir un sistema de preguntas y respuestas mediante RAG sobre un conjunto de documentos que responda con citas de fuente.
Día 2: Hacerlo Privado, Defendible y Listo para Desplegar
Módulo 5: Privacidad, Privilegio y Servicio Local — la Trampa del Privilegio
- Objetivos de aprendizaje: mantener los datos legales locales y poder certificarlo.
- Temas
- Hacia dónde van realmente los datos cuando tocan un servicio de IA en la nube.
- Renuncia al privilegio, deber de competencia y el espectro de "privacidad" (contractual vs. físico).
- Morgan v. V2X y por qué lo local es defendible ante tribunales.
- Servicio de modelos locales (Ollama/vLLM) y monitoreo del tráfico saliente.
- Laboratorio: Modelo Local + Prueba de Egress — ejecutar un modelo local de extremo a extremo y probar, mediante monitoreo, que ningún dato salió.
Módulo 6: Revisión de IA Defendible
- Objetivos de aprendizaje: medir y documentar una revisión de IA para que sea válida legalmente.
- Temas
- Las métricas válidas ante tribunales: recall, elusion, precisión, validación de ground truth; TAR/aprendizaje activo.
- Transparencia (¿por qué codificó este documento?) y reproducibilidad: fijar el modelo, configurar ajustes fijos y registrar todo.
- El "instantáneo del caso defendible" que permite a alguien volver a ejecutar tu revisión un año después y obtener el mismo resultado.
- Laboratorio: Revisión Defendible — medir una revisión de IA contra una ground truth ciega y producir un paquete de reproducibilidad.
Módulo 7: Desplegarlo — Flujo de Trabajo, Despliegue Privado y Gobernanza
- Objetivos de aprendizaje: ensamblar las piezas en un flujo de trabajo, desplegarlo privadamente y puntuarlo.
- Temas
- Un flujo de trabajo legal multi-etapa (ingesta → búsqueda → resumen → revisión → producción) con intervención humana.
- Eseniales para despliegue privado/en infraestructura propia (containerización; mantener los datos en las instalaciones).
- Gobernanza de IA para lo legal brevemente, y puntuación del sistema con SAIS-100 (la Escalera de Elefante Puntuación Segura de IA).
- Laboratorio: Puntuar y Empaquetar — conectar un flujo de trabajo multi-etapa, puntuarlo con SAIS-100 y empaquetarlo para despliegue privado.
Proyecto Final (integrado a lo largo del Día 2)
- Construir una aplicación de IA legal privada y defendible de extremo a extremo: ingerir un corpus desordenado, buscarlo, responder preguntas sobre él con citas usando un modelo local, medir una revisión defendible y empaquetarla para despliegue privado.
- Los participantes se van con un proyecto portafolio que representa el trabajo real de un ingeniero legal.
Día 3 Opcional / Módulos Avanzados (entregable como día 3 o serie modular)
- Investigaciones: Entidades, Relaciones y Líneas de Tiempo — extraer personas/organizaciones/fechas, reconstruir hilos de correo electrónico, construir cronologías, mapear casi-duplicados y linaje documental. Laboratorio: construir una línea de tiempo y vista entidad-relación.
- Flujos de Trabajo Agentes y Multi-Etapa (profundización) — orquestación más rica, análisis contractual, síntesis multi-documento, uso de herramientas y guardrails como principio de diseño. Laboratorio: construir un flujo de trabajo multi-etapa con un punto de control humano.
- Despliegue a Gran Escala — despliegue en infraestructura propia y appliance, procesamiento distribuido para grandes volúmenes, entornos regulados (CJIS, gobierno, educación superior), dimensionamiento de hardware. Laboratorio: containerizar y escalar un trabajo de procesamiento entre trabajadores.
- Gobernanza y Cumplimiento Profundo — el panorama de la regulación de IA (+100 leyes estatales estadounidenses sobre IA, Ley de IA de la UE), requisitos de auditoría y una auditoría completa de gobernanza SAIS-100. Laboratorio: auditar un sistema de IA legal contra una lista de verificación de gobernanza/defensibilidad.
Requerimientos
- Comodidad con Python y APIs básicas.
- Útil: familiaridad con LLMs a nivel de usuario (no se requiere experiencia previa en Machine Learning; construimos el modelo mental necesario).
- No se necesita antecedentes legales: los conceptos jurídicos necesarios se enseñan en contexto.
Público Objetivo
- Ingenieros de software o IA que transicionan hacia la tecnología legal.
- Ingenieros de empresas de tecnología legal que necesitan profundidad en el dominio jurídico.
- Profesionales técnicos del ámbito legal, eDiscovery o gobernanza de información que desean construir, no solo comprar.
- Cualquier persona orientada al rol de "ingeniero legal" o "ingeniero de IA legal".
Reseñas (2)
La práctica estuvo muy interactiva y aplicable al negocio.
Jorge Boscan - Chevron Global Technology Services Company
Curso - Advanced GitHub Copilot & AI for Projects and Infrastructure
Adquirí conocimientos sobre la biblioteca Streamlit de Python y, con seguridad, intentaré utilizarla para mejorar las aplicaciones de mi equipo que se desarrollan en R Shiny.
Michal Maj - XL Catlin Services SE (AXA XL)
Curso - GitHub Copilot for Developers
Traducción Automática