AIDA
10/7/2026

Extraction de données sans modèle, de 2012 à l'IA générative

Moduli e documenti con layout diversi su una scrivania

L'extraction de données sans modèle est la raison d'être d'AIDA : notre plateforme d'intelligent document processing (IDP) est née en 2012, dix ans avant ChatGPT, pour lire les données des documents en apprenant de l'utilisateur en un clic, au lieu d'exiger des modèles construits à la main. Aujourd'hui, l'IA générative renforce ce moteur, qui reste le socle de tout le produit.

Lorsque vous choisissez aujourd'hui un logiciel IDP, vous vous retrouvez souvent face à deux types d'offres. D'un côté, les plateformes historiques, nées sur l'extraction basée sur des modèles. De l'autre, les startups des trois dernières années, qui confient tout à un LLM (grand modèle de langage) et présentent des démos convaincantes sur la première facture. AIDA vient d'une voie différente, et la connaître aide à comprendre ce qui se passe après la démo, quand entrent en jeu des milliers de documents réels.

Qu'était l'extraction de données basée sur des modèles ?

L'extraction basée sur des modèles décrit à l'avance l'emplacement de chaque donnée sur une mise en page donnée : on dessine des zones ou on écrit des règles qui recherchent des mots-clés et des positions relatives, puis le logiciel applique cette description aux documents entrants.

En 2012, le marché de la capture de données était dominé par ABBYY et Kofax (aujourd'hui Tungsten Automation), avec des plateformes puissantes construites sur ce principe. Dans ABBYY FlexiCapture, la structure des documents à mise en page variable se décrit avec un programme dédié, FlexiLayout Studio ; dans Kofax Transformation Modules, les projets d'extraction se préparent et se testent dans Project Builder, pour lequel il existe des formations spécifiques.

Ceux qui ont suivi un projet de capture documentaire à cette époque se souviennent bien de ses limites :

  • la configuration exigeait des techniciens spécialisés, des logiciels et des formations dédiés, avant même de traiter le premier document ;
  • chaque nouveau fournisseur avec une mise en page différente impliquait un nouveau modèle ou de nouvelles règles à écrire ;
  • avec les documents non structurés, comme les courriers ou les actes d'un cabinet d'avocats, le modèle n'avait aucun point fixe auquel s'accrocher, car la donnée pouvait se trouver dans n'importe quelle phrase du texte ;
  • apprentissage et production étaient des processus séparés : le projet se préparait dans un environnement de conception, était publié en production, et chaque modification refaisait le même parcours ;
  • une mise en page qui changeait même légèrement pouvait compromettre l'extraction, jusqu'à ce que quelqu'un mette à jour le modèle.

Comment fonctionne l'extraction de données sans modèle d'AIDA ?

AIDA apprend de l'utilisateur pendant qu'il travaille : pour lui apprendre un champ, il suffit de sélectionner la propriété et de cliquer sur la valeur dans le document. Un clic sur un seul document, et dès lors AIDA sait quoi chercher dans les documents suivants du même type.

Dans AIDA, le type de document ne dépend pas de l'aspect graphique, mais uniquement des données que vous souhaitez extraire. Une facture fournisseur reste une facture fournisseur, qu'elle provienne du fournisseur A ou du fournisseur B avec une mise en page complètement différente.

Lorsque vous validez le premier document avec une nouvelle mise en page, AIDA apprend à le lire ; lorsqu'arrive un autre document avec une mise en page identique ou similaire, elle le reconnaît d'elle-même. Personne n'a besoin de dessiner un modèle, de lui donner un nom ou d'indiquer lequel utiliser pour chaque document, même quand les fournisseurs se comptent par centaines.

De nombreuses solutions reconnaissent une liste fixe de champs standard, comme le fournisseur, le numéro, la date et les montants d'une facture. Les propriétés intelligentes d'AIDA reconnaissent depuis toujours les dates, les numéros de TVA, les IBAN et d'autres valeurs courantes sans apprentissage, mais les données qui comptent pour une entreprise sont souvent ailleurs : le numéro d'affaire, le centre de coûts, l'immatriculation du véhicule, le code POD (point de livraison) d'une facture d'énergie. AIDA les apprend aussi, en un clic, sur n'importe quel type de document, et avec AIDA Boost elle les trouve dès le premier.

Les propriétés intelligentes et l'apprentissage en un clic ne dépendent pas d'un LLM : ils reposent sur une analyse minutieuse de la structure du document, que nous développons depuis 2012. L'algorithme d'AIDA reproduit la façon dont une personne reconnaît un document et en repère les informations clés. Cette approche est unique sur le marché et constitue la base solide qu'AIDA Boost renforce, sans la remplacer.

La différence la plus profonde par rapport aux systèmes de l'époque est que apprentissage et production ne font qu'un. L'opérateur ouvre un document en attente, contrôle les valeurs proposées, clique sur celles qui manquent ou sont à corriger, puis valide. La validation archive le document ou l'envoie vers la destination choisie et, du même geste, consolide ce qu'AIDA a appris. Nul besoin d'un environnement de conception séparé ni d'un consultant pour republier le projet.

En 2012, c'était une approche disruptive, et la raison pour laquelle elle fonctionne n'a pas changé : celui qui connaît vraiment les documents, c'est celui qui les traite chaque jour, pas celui qui configure le logiciel. AIDA place l'apprentissage entre les mains de cette personne, sans code et sans formation spécialisée. C'était du human in the loop bien avant que l'IA générative ne rende l'expression courante.

Lorsque les résultats sont stables, une règle d'automatisation peut valider les documents toute seule, tandis qu'AIDA surligne en jaune les valeurs anormales à vérifier. Vous trouverez tous les détails sur la page consacrée à l'extraction automatique des données avec AIDA.

Pourquoi l'IA générative seule ne suffit-elle pas en gestion documentaire ?

Un LLM lit bien un document même jamais vu, mais à lui seul il ne garantit pas des résultats reproductibles, il ne retient souvent pas les corrections et ne sait rien des archives, des doublons ou des relations entre documents. Ce sont les limites qui apparaissent lorsqu'une plateforme née uniquement sur l'IA générative passe de la démo à la production :

  • le même document traité deux fois peut donner des réponses différentes, et un LLM qui ne trouve pas une donnée a tendance à combler le vide avec une valeur plausible ;
  • une correction de l'utilisateur ne vaut souvent que pour ce document : pour ne pas la répéter, il faut réécrire le prompt ou réentraîner un modèle ;
  • les coûts et les délais de traitement augmentent avec chaque page soumise au LLM ;
  • extraire du texte n'est qu'un début, car une entreprise doit aussi classer, renommer et archiver les documents, détecter les doublons, rapprocher commande, bon de livraison et facture, et tout conserver selon des règles précises.

Ce dernier point est le plus difficile à combler. Le savoir-faire de la gestion documentaire n'arrive pas avec un LLM : il se construit au fil d'années de travail aux côtés des personnes qui gèrent réellement les documents.

Qu'apporte AIDA Boost à l'extraction des données ?

Aujourd'hui, presque tout le monde promet l'extraction des données, et les offres se ressemblent jusqu'à ce que l'on regarde ce qui arrive aux documents réels. AIDA Boost est la manière dont l'IA générative renforce le moteur d'AIDA, et la différence se voit dans ce que vous trouvez déjà prêt en ouvrant un document :

  • les lignes des tableaux, comme les références articles, les quantités et les lots d'un bon de livraison, arrivent déjà structurées, sans configurer de colonnes ;
  • toutes les propriétés, y compris celles propres à votre entreprise, sont extraites dès le premier document : une extraction zero-shot, sans apprentissage, qui s'ajoute à celle apprise de l'utilisateur ;
  • AIDA comprend ce que demande une propriété et peut regrouper en une seule valeur plusieurs informations liées du document ;
  • AIDA Boost apprend des corrections : lorsque vous rectifiez une valeur d'un clic, elle en tient compte dans les documents suivants, en combinant l'apprentissage d'AIDA et la flexibilité de l'IA générative ;
  • lorsque les documents changent, le travail de contrôle et de correction est réduit au minimum.

Le résultat est une extraction qui va au-delà des champs standard, sur n'importe quel type de document, avec une configuration qui se fait depuis l'interface en quelques clics.

La différence pèse surtout sur les documents non structurés, comme la correspondance et les actes qu'un cabinet d'avocats reçoit chaque jour (nous en parlons dans l'article sur l'innovation juridique avec AIDA). Le moteur Hybrid-AI d'AIDA lit le texte et en extrait la partie adverse, le numéro de procédure ou la date d'audience, même à partir de documents jamais vus auparavant. Les valeurs anormales restent surlignées pour le contrôle, et si une donnée doit être corrigée, un clic suffit pour qu'AIDA l'apprenne, même sur un courrier.

Les agents IA d'AIDA partent de là : ils travaillent sur des documents déjà classés, lus, vérifiés et reliés entre eux, et calculent des totaux exacts sur l'ensemble des archives, si bien que le LLM n'a jamais à deviner les données manquantes.

Modèles, IA générative seule et AIDA : le comparatif

Aspect Extraction basée sur des modèles IA générative seule AIDA
Configuration initiale Modèles et règles définis par des spécialistes avec un logiciel dédié Prompt ou aucune configuration Types de documents et propriétés choisis depuis l'interface, sans code
Nouvelle mise en page d'un fournisseur Nouveau modèle ou nouvelles règles Lue par le LLM Apprise dès la première validation et reconnue automatiquement, tout au plus un clic sur les valeurs
Documents non structurés (courriers, actes) Presque impossibles à décrire Lus par le LLM, avec des résultats qui peuvent varier Lus dès le premier document, avec les anomalies mises en évidence
Apprentissage Séparé de la production Corrections via des agents, coûteuses en tokens et souvent non mémorisées Se fait pendant la validation des documents
Résultats Stables tant que la mise en page ne change pas Peuvent varier d'un traitement à l'autre Cohérents, avec les anomalies mises en évidence
Gestion documentaire Souvent confiée à d'autres produits Souvent limitée à l'extraction De bout en bout : tâches personnelles et agentiques, archives, doublons et relations entre documents inclus

Trente ans d'expérience, le rythme d'une startup

AIDA est née de l'expérience trentenaire de notre équipe en gestion documentaire, des systèmes de GED des années 1990 à la numérisation avec des multifonctions dans chaque bureau, une histoire que Giorgio, notre CEO, raconte dans l'interview sur l'évolution de la gestion documentaire. Cette expérience se retrouve dans les fonctions qu'une entreprise utilise chaque jour, au-delà de l'extraction :

  • une archive documentaire avec un espace illimité dans chaque formule et une recherche sur le texte et sur les données extraites ;
  • la détection des doublons à partir du contenu ou des champs extraits, avec la possibilité d'en bloquer la validation ;
  • les relations entre documents, pour retrouver ensemble la commande, le bon de livraison et la facture d'une même opération ;
  • des dizaines de formats de fichiers pris en charge et convertis en PDF ;
  • AIDA Pay, qui, à partir du document approuvé, envoie au client la demande de paiement avec un lien ou un QR code et rapproche l'encaissement automatiquement ;
  • des automatisations et des destinations qui acheminent les données vers les systèmes où elles sont utiles.

Les startups nées avec l'IA générative partent d'un LLM et tentent de construire la gestion documentaire autour. AIDA a suivi le chemin inverse : elle a d'abord compris comment les entreprises travaillent avec leurs documents, puis construit un moteur qui apprend des personnes, et aujourd'hui elle le renforce avec l'IA générative.

Forte de cette expérience, AIDA évolue au rythme d'une startup : au cours de la dernière année, son journal des modifications compte plus de 350 mises à jour. Parmi elles figurent AIDA 20.0, qui a introduit l'IA agentique, ainsi qu'AIDA 20.5, AIDA Match pour le rapprochement des documents et la nouvelle AIDA Mobile 7.0. En 2025, AIDA a reçu le prix « One to watch: Product of the Year » aux Document Manager Awards.

Questions fréquentes

Qu'est-ce que l'extraction de données sans modèle ?

C'est une méthode d'extraction qui n'exige pas de décrire à l'avance l'emplacement des données pour chaque mise en page. Dans AIDA, le type de document définit seulement quelles données extraire, et le moteur apprend où les trouver à partir des documents validés par les utilisateurs, en reconnaissant de lui-même chaque nouvelle mise en page.

AIDA nécessite-t-elle un apprentissage avant de démarrer ?

Non. Les propriétés intelligentes reconnaissent les dates, les numéros de TVA, les IBAN et d'autres valeurs courantes sans apprentissage, et avec AIDA Boost toutes les propriétés sont extraites dès le premier document. Si une valeur doit être corrigée, un clic suffit lors du contrôle habituel des documents, et AIDA l'apprend.

AIDA utilise-t-elle l'IA générative ?

Oui. AIDA dispose d'un moteur Hybrid-AI : l'analyse du document et l'apprentissage à partir de l'utilisateur, que nous développons depuis 2012, fonctionnent conjointement avec l'IA générative d'AIDA Boost. Les agents IA l'utilisent pour rechercher, calculer et agir sur les documents, toujours à partir de données vérifiées par les utilisateurs.

Faut-il un développeur pour configurer AIDA ?

Non. Types de documents, propriétés, automatisations et destinations se paramètrent depuis l'interface en quelques clics. Les API restent disponibles pour les équipes qui souhaitent intégrer AIDA à leurs propres systèmes, mais elles ne sont pas nécessaires.

Pour voir comment AIDA apprend de vos documents, découvrez l'extraction de données d'AIDA ou réservez une démo avec vos propres documents réels.

Fulvio Molinengo - CTO
Fulvio Molinengo
CTO
 Arrière