Publicada
Las claves

A pesar de que los procesos de transformación digital hayan revolucionado la operativa de las grandes compañías en los últimos años, muchas de ellas todavía se encuentran con un problema que, además de suponer un verdadero quebradero de cabeza, hasta la llegada de la inteligencia artificial generativa no ha encontrado una solución fiable y automatizada: gran parte de su dato -desde facturas y albaranes, pasando por contratos y expedientes complejos- todavía habita en documentos no estructurados, especialmente en PDF.

De hecho, aún encontramos empresas que tienen hasta el 90% de la información deslocalizada en estas instancias, según estadísticas que maneja Anyformat. Por fortuna, decíamos, la IA generativa está cerrando la brecha y poniendo orden en el caos.

Al menos, esta es la premisa con la que opera esta startup madrileña, cofundada en 2024 y dirigida por el ingeniero industrial de formación Juan Huguet. El directivo es consciente, tal y como explica a DISRUPTORES – EL ESPAÑOL, de que el PDF sigue siendo muy importante a nivel corporativo “porque tiene un valor casi contractual”, pero está pensado para que sea difícil de modificar, leer y digitalizar.

Por otra parte, las organizaciones también manejan documentos mucho más específicos como manuales de instrucciones, de fabricación o expedientes. “Esta complejidad ha sido prácticamente inmanejable hasta el día de hoy. La cantidad de tiempo que se ha perdido procesando de forma manual estos textos supone, tras la llegada de nuevas tecnologías, un potencial de retorno de inversión enorme”.

Anyformat, que se define como una empresa de automatización documental, ha logrado la ‘última milla’ del alivio a esta carga burocrática: combinar técnicas de OCR (Reconocimiento Óptico de Caracteres), visión por máquina, machine learning y agentes de IA para leer los documentos, extraer información, cruzarla con los sistemas internos de las compañías y ejecutar procesos.

Además, ha desarrollado un método de trazabilidad y validación que permite conocer el origen de cada dato y asignarle un nivel de confianza. Si este no alcanza un umbral mínimo, pasa automáticamente a la supervisión humana, de modo que el proceso no elimina por completo la intervención de las personas.

“Hasta ahora, las tecnologías actuaban como piezas desconectadas. Pero los agentes de IA han permitido completar el puzle. Por eso, somos capaces de absorber los casos más difíciles”, defiende el emprendedor.

De una conversación con amigos a levantar 3,8 millones de euros

Como toda buena startup, explica Huguet, la semilla de Anyformat surge de la frustración ante una problemática -la avalancha de documentos tradicionales- y una conversación entre amigos “con unas cervezas de por medio”.

“Nos encontramos en un momento en el que los primeros modelos de IA generativa ya estaban siendo capaces de entender el lenguaje natural de forma contextual”, recuerda. “Y nos dimos cuenta de que esta tecnología iba a cambiar completamente el escenario: lo que antes era un problema científico -cómo entrenar un modelo de machine learning específico para un dataset no estructurado- se había convertido en un reto de ingeniería.

Juan Huguet, CEO y cofundador Anyformat. DISRUPTORES

De este modo, el equipo, actualmente conformado por 13 personas y que ya llevaba tiempo trabajando en proyectos de extracción de datos de documentos y clasificación de noticias, se hizo la pregunta clave: “¿Podemos centralizar este proceso en una sola plataforma, comercializarla y ahorrar este proceso a muchas empresas?” La respuesta ahora es más que obvia: Anyformat ha recaudado unos 3,8 millones de euros en rondas de financiación, su solución ha atravesado a prácticamente todos los verticales del tejido económico -con grandes clientes como la aerolínea Iberia- y ya ha traspasado fronteras europeas.

En concreto, ha llegado a Singapur, donde ha encauzado un proyecto con su Gobierno que ha supuesto todo un desafío: “Te puedes imaginar. Sus medidas y requisitos de seguridad son muy exigentes, sobre todo, en lo referente a la protección del dato. Lo que esto nos dice es que se ha abierto una tendencia en el mercado: buscar alternativas en Europa a las empresas de IA nativas norteamericanas que se parecen a Anyformat”.

Una industria tradicional ante una nueva oportunidad

En definitiva, Anyformat no ha hecho otra cosa que resolver un efecto bastante curioso en el mercado de Intelligent Document Processing que, “Lleva 40 años funcionando, pero haciéndolo mal”.

En esencia, no ha tenido éxito porque sus tasas de acierto han sido muy bajas, en opinión de Huguet. No en vano, el emprendedor cree que esto ha creado un caldo de cultivo muy especial.

"La cantidad de tiempo que se ha perdido procesando de forma manual los documentos supone ahora un potencial de retorno de inversión enorme"

“No solo estamos creando un negocio nuevo gracias al potencial de la IA generativa para aquellos documentos que no se podían procesar, sino que también está habiendo un proceso de revisión del legacy para ver cómo se puede adaptar a estas oleadas tecnológicas”.

De hecho, asevera, los mejores resultados se están viendo en organizaciones que ya tiraban de estas herramientas, pero que necesitan adaptación.

A esta ventaja competitiva, se suma, como subrayaba anteriormente, su ADN europeo. En este sentido, Huguet cree que la regulación, y los requisitos de soberanía y protección del dato, juegan en favor de Anyformat. “Al final, las compañías siempre van a priorizar proveedores tecnológicos que entiendan sus particularidades a nivel de país y de cercanía, y no a los que están a 10.000 kilómetros”.

“Nosotros -prosigue- vemos que la normativa nos da incluso una responsabilidad tecnológica con respecto a jugadores americanos que no tendríamos si no hubiésemos nacido en el Viejo Continente”.

IA sí, pero con supervisión humana

Para Huguet, otro de los puntales del éxito de la startup pasa por la inversión y la garantía de que la plataforma no comete las típicas alucinaciones de la inteligencia artificial ni que no se cometan errores durante el proceso. De ahí, su sistema de trazabilidad y validación de desarrollo propio.

Por ello, el juicio humano nunca queda sustituido por la automatización por completo. “El dato que vive en un PDF es muy sensible que afecta a todos los procesos que dependen de él”, desarrolla. “Un fallo al principio de la cadena no lo solucionas con tecnología, sino con revalidación y asegurándote que lo que has hecho está bien”.

“El dato que vive en un PDF es muy sensible que afecta a todos los procesos que dependen de él”

De este modo, indica, la metodología otorga a los agentes de inteligencia artificial la capacidad de trazar hasta la fuente: de dónde sale exactamente el dato, en qué punto del documento -párrafo, frase o palabras-, e incluso en qué imágenes y tablas.

“Hemos entrenado un sistema basándonos en la señal que nos dan los modelos, contrastada con el juicio humano, para saber que cuando nuestro modelo dice que un dato tiene, por ejemplo, un 10% de probabilidad de ser incorrecto, ese dato es incorrecto aproximadamente el 10% de las veces”.

Esta señal combina tres acciones; la capacidad de entender de dónde viene el dato, la información sobre su procedencia y la confianza que tiene el modelo en que ese dato sea el correcto.

Así, dice el emprendedor: “Si tienes un caso extremadamente sensible, con la necesidad de que esté correcto al 99%, todo lo que esté por debajo de ese umbral pasa a revisión humana”, concluye.