Caso Georgia: medio millón de documentos en 16 horas
Una demanda colectiva en EE.UU., 500,000 PDFs escaneados y plazos de juzgado encima. Cómo un equipo de 4 los convirtió en una base de datos consultable.
El caso que nadie podía revisar
En 2025, un despacho legal en Estados Unidos llevaba una demanda colectiva de cadetes de policía en Georgia. Para sustentar el caso necesitaban revisar los expedientes laborales de miles de cadetes: cartas de oferta, recibos de nómina, formas fiscales W-2, hojas de tiempo y expedientes de ingreso. Medio millón de documentos. Todos PDFs escaneados.
El problema no era solo el volumen. Los plazos del juzgado eran cortos, y revisar 500,000 documentos a mano no era viable en ningún plazo razonable. Necesitaban a alguien que supiera extraer datos de documentos escaneados y pudiera dedicarle muchas horas, ya.
El proyecto nos llegó por un referido. Veníamos de construir la extracción automática de pólizas para Inssuria, así que el problema nos era conocido: documentos escaneados, información muy específica que extraer y cero margen para inventar datos.
Lo que construimos
Un mes de trabajo con un equipo de 4 personas. El pipeline:
- Organización. Los expedientes venían agrupados por generación de la academia: 15 generaciones en total.
- Clasificación automática. Cada PDF se identifica por tipo de documento sin intervención humana.
- Extracción especializada. Un extractor por tipo, porque una hoja de tiempo no se lee igual que una forma fiscal: OCR más modelos de lenguaje afinados a los campos de cada documento.
- Entrega como datos, no como otro PDF. Todo terminó en una base de datos SQL montada en la infraestructura del cliente. Su equipo construyó encima un dashboard para explorar la información.
Una vez construida la infraestructura, procesar el medio millón de documentos tomó 16 horas.
La precisión, y cómo la medimos
En un contexto legal, un monto o una fecha mal extraídos pueden costar caro. Por eso no reportamos precisión de sensación: diseñamos una evaluación por muestreo estadístico, con una muestra estratificada por tipo de documento y miles de registros revisados a mano contra el documento original.
Resultado: 98% de precisión, y cada dato extraído se puede rastrear al documento del que salió, para que la última palabra siempre la tenga un humano.
El punto
Este proyecto no fue “ahorrar tiempo de captura”. Con los plazos del juzgado, revisar medio millón de documentos a mano era imposible: no había equipo humano que pudiera. La automatización no hizo el trabajo más rápido. Hizo posible un trabajo que no se podía hacer.