Datenextraktion ohne Templates, von 2012 zur generativen KI

Die Datenextraktion ohne Templates ist der Grund, warum es AIDA gibt: unsere Plattform für Intelligent Document Processing (IDP) entstand 2012, zehn Jahre vor ChatGPT, um Daten aus Dokumenten zu lesen und dabei per Klick vom Nutzer zu lernen, statt von Hand erstellte Vorlagen zu verlangen. Heute verstärkt generative KI diese Engine, die weiterhin das Fundament des gesamten Produkts bildet.
Wer heute eine IDP-Software auswählt, hat meist zwei Arten von Angeboten vor sich. Auf der einen Seite stehen die etablierten Plattformen, die auf templatebasierter Extraktion aufbauen. Auf der anderen Seite stehen die Start-ups der letzten drei Jahre, die alles einem Sprachmodell überlassen und mit der ersten Rechnung überzeugende Demos zeigen. AIDA kommt aus einer anderen Richtung, und wer diesen Weg kennt, versteht besser, was nach der Demo passiert, wenn Tausende echte Dokumente ins Spiel kommen.
Was war die templatebasierte Datenextraktion?
Bei der templatebasierten Extraktion wird vorab beschrieben, wo sich jede Angabe in einem bestimmten Dokumentlayout befindet: man zeichnet Zonen ein oder schreibt Regeln, die nach Schlüsselwörtern und relativen Positionen suchen, und die Software wendet diese Beschreibung dann auf die eingehenden Dokumente an.
2012 wurde der Markt für Data Capture von ABBYY und Kofax (heute Tungsten Automation) angeführt, mit leistungsstarken Plattformen, die auf diesem Prinzip beruhten. In ABBYY FlexiCapture wird die Struktur von Dokumenten mit variablem Layout in einem eigenen Programm beschrieben, FlexiLayout Studio; in Kofax Transformation Modules werden Extraktionsprojekte im Project Builder vorbereitet und getestet, für den es eigene Schulungen gibt.
Wer in jenen Jahren ein Projekt zur Dokumentenerfassung betreut hat, erinnert sich gut an die Grenzen:
- die Konfiguration erforderte spezialisierte Techniker, eigene Software und Schulungen, noch bevor das erste Dokument verarbeitet wurde;
- jeder neue Lieferant mit einem anderen Layout bedeutete ein neues Template oder neue Regeln;
- bei unstrukturierten Dokumenten wie Briefen oder Schriftsätzen einer Anwaltskanzlei fand das Template keine festen Anhaltspunkte, weil die gesuchte Angabe in jedem beliebigen Satz des Textes stehen konnte;
- Training und Produktion waren getrennte Prozesse: das Projekt wurde in einer Designumgebung vorbereitet, in die Produktion übernommen, und jede Änderung durchlief denselben Zyklus;
- schon eine kleine Layoutänderung konnte die Extraktion beeinträchtigen, bis jemand das Template aktualisierte.
Wie funktioniert die Datenextraktion ohne Templates von AIDA?
AIDA lernt vom Nutzer, während er arbeitet: um AIDA ein Feld beizubringen, genügt es, die Eigenschaft auszuwählen und im Dokument auf den Wert zu klicken. Ein Klick in einem einzigen Dokument, und ab diesem Moment weiß AIDA, wonach in den folgenden Dokumenten desselben Typs zu suchen ist.
Bei AIDA hängt der Dokumenttyp nicht vom grafischen Erscheinungsbild ab, sondern nur von den Daten, die Sie extrahieren möchten. Eine Eingangsrechnung bleibt eine Eingangsrechnung, ob sie von Lieferant A kommt oder von Lieferant B mit einem völlig anderen Layout.
Wenn Sie das erste Dokument mit einem neuen Layout bestätigen, lernt AIDA, es zu lesen; kommt ein weiteres Dokument mit gleichem oder ähnlichem Layout, erkennt AIDA es selbstständig. Niemand muss ein Template zeichnen, ihm einen Namen geben oder festlegen, welches für welches Dokument gilt, selbst bei Hunderten von Lieferanten.
Viele Lösungen erkennen eine feste Liste von Standardfeldern, etwa Lieferant, Nummer, Datum und Beträge einer Rechnung. Die intelligenten Eigenschaften von AIDA erkennen seit jeher Datumsangaben, USt-IdNr., IBAN und andere gängige Werte ohne Training, doch die Daten, auf die es in einem Unternehmen ankommt, sind oft andere: die Auftragsnummer, die Kostenstelle, das Kennzeichen eines Fahrzeugs, die Zählpunktnummer (POD) auf einer Energierechnung. AIDA lernt auch diese, mit einem Klick, bei jedem Dokumenttyp, und mit AIDA Boost findet AIDA sie schon ab dem ersten Dokument.
Die intelligenten Eigenschaften und das Lernen per Klick hängen nicht von einem Sprachmodell ab: sie beruhen auf einer detaillierten Analyse der Dokumentstruktur, die wir seit 2012 entwickeln. Der Algorithmus von AIDA bildet nach, wie ein Mensch ein Dokument erkennt und dessen Schlüsselinformationen findet. Dieser Ansatz ist einzigartig auf dem Markt und bildet die solide Basis, die AIDA Boost verstärkt, ohne sie zu ersetzen.
Der tiefgreifendste Unterschied zu den damaligen Systemen besteht darin, dass Training und Produktion zusammenfallen. Der Sachbearbeiter öffnet ein wartendes Dokument, prüft die vorgeschlagenen Werte, klickt auf fehlende oder zu korrigierende Werte und bestätigt. Die Bestätigung archiviert das Dokument oder sendet es an das gewählte Zielsystem und festigt im selben Schritt, was AIDA gelernt hat. Es braucht weder eine separate Designumgebung noch einen Berater, der das Projekt neu veröffentlicht.
2012 war das ein disruptiver Ansatz, und der Grund, warum er funktioniert, ist derselbe geblieben: wer die Dokumente wirklich kennt, ist die Person, die täglich mit ihnen arbeitet, nicht diejenige, die die Software konfiguriert. AIDA legt das Lernen in die Hände dieser Person, ohne Code und ohne Spezialschulung. Das war Human in the Loop, lange bevor generative KI den Begriff populär machte.
Sobald die Ergebnisse stabil sind, kann eine Automatisierungsregel die Dokumente selbstständig bestätigen, während AIDA auffällige Werte zur Prüfung gelb hervorhebt. Details finden Sie auf der Seite zur automatischen Datenextraktion mit AIDA.
Warum reicht generative KI allein im Dokumentenmanagement nicht aus?
Ein Sprachmodell liest auch ein nie gesehenes Dokument gut, garantiert allein aber keine reproduzierbaren Ergebnisse, merkt sich Korrekturen oft nicht und weiß nichts über Archive, Duplikate oder Beziehungen zwischen Dokumenten. Diese Grenzen zeigen sich, wenn eine rein auf generativer KI aufgebaute Plattform von der Demo in die Produktion wechselt:
- dasselbe Dokument kann bei zweimaliger Verarbeitung unterschiedliche Antworten liefern, und ein Modell, das eine Angabe nicht findet, neigt dazu, die Lücke mit einem plausiblen Wert zu füllen;
- eine Korrektur des Nutzers gilt oft nur für dieses eine Dokument: um sie nicht wiederholen zu müssen, muss man den Prompt umschreiben oder ein Modell neu trainieren;
- Kosten und Verarbeitungszeiten steigen mit jeder Seite, die an das Modell übergeben wird;
- Text zu extrahieren ist nur der Anfang, denn ein Unternehmen muss Dokumente auch klassifizieren, umbenennen und archivieren, Duplikate erkennen, Bestellung, Lieferschein und Rechnung miteinander verknüpfen und alles nach genauen Regeln aufbewahren.
Dieser letzte Punkt ist am schwersten aufzuholen. Das Know-how im Dokumentenmanagement kommt nicht zusammen mit einem Sprachmodell: es entsteht in jahrelanger Arbeit an der Seite der Menschen, die Dokumente tatsächlich bearbeiten.
Was ergänzt AIDA Boost bei der Datenextraktion?
Datenextraktion versprechen heute fast alle, und ein Angebot gleicht dem anderen, bis man sich ansieht, was mit echten Dokumenten passiert. AIDA Boost ist die Art, wie generative KI die Engine von AIDA verstärkt, und der Unterschied zeigt sich in dem, was Sie bereits vorfinden, wenn Sie ein Dokument öffnen:
- Tabellenzeilen wie Artikelnummern, Mengen und Chargen eines Lieferscheins kommen bereits strukturiert an, ohne dass Spalten konfiguriert werden müssen;
- alle Eigenschaften, auch die unternehmensspezifischen, werden ab dem ersten Dokument extrahiert: eine Zero-Shot-Extraktion ohne Training, die zur vom Nutzer gelernten Extraktion hinzukommt;
- AIDA versteht, was eine Eigenschaft verlangt, und kann mehrere zusammengehörige Informationen des Dokuments zu einem einzigen Wert zusammenführen;
- AIDA Boost lernt aus Korrekturen: wenn Sie einen Wert mit einem Klick korrigieren, berücksichtigt AIDA Boost dies in den folgenden Dokumenten und verbindet so das Lernen von AIDA mit der Flexibilität generativer KI;
- wenn sich Dokumente ändern, reduziert sich der Aufwand für Prüfung und Korrektur auf ein Minimum.
Das Ergebnis ist eine Extraktion, die über Standardfelder hinausgeht, bei jedem Dokumenttyp, mit einer Konfiguration, die sich in wenigen Klicks über die Oberfläche erledigen lässt.
Besonders ins Gewicht fällt der Unterschied bei unstrukturierten Dokumenten wie der Korrespondenz und den Schriftsätzen, die eine Anwaltskanzlei täglich erhält (mehr dazu im Artikel über Legal Innovation mit AIDA). Die Hybrid-AI-Engine von AIDA liest den Text und extrahiert daraus die Gegenpartei, das Aktenzeichen des Verfahrens oder den Verhandlungstermin, auch aus noch nie gesehenen Dokumenten. Auffällige Werte bleiben zur Prüfung hervorgehoben, und muss eine Angabe korrigiert werden, genügt ein Klick, damit AIDA sie lernt, auch bei einem Brief.
Die KI-Agenten von AIDA setzen genau hier an: sie arbeiten mit Dokumenten, die bereits klassifiziert, gelesen, geprüft und miteinander verknüpft sind, und berechnen exakte Summen über das gesamte Archiv, sodass das Modell fehlende Daten nie erraten muss.
Templates, reine generative KI und AIDA im Vergleich
| Aspekt | Templatebasierte Extraktion | Nur generative KI | AIDA |
|---|---|---|---|
| Ersteinrichtung | Templates und Regeln, von Spezialisten mit eigener Software definiert | Prompt oder keine Konfiguration | Dokumenttypen und Eigenschaften über die Oberfläche gewählt, ohne Code |
| Neues Layout eines Lieferanten | Neues Template oder neue Regeln | Vom Modell gelesen | Bei der ersten Bestätigung gelernt und automatisch erkannt, höchstens ein Klick auf die Werte |
| Unstrukturierte Dokumente (Briefe, Schriftsätze) | Kaum zu beschreiben | Vom Modell gelesen, mit schwankenden Ergebnissen | Ab dem ersten Dokument gelesen, mit hervorgehobenen Auffälligkeiten |
| Training | Von der Produktion getrennt | Korrekturen über Agenten, kostspielig beim Token-Verbrauch und oft nicht gespeichert | Erfolgt beim Bestätigen der Dokumente |
| Ergebnisse | Stabil, solange sich das Layout nicht ändert | Können zwischen zwei Verarbeitungen variieren | Konsistent, mit hervorgehobenen Auffälligkeiten |
| Dokumentenmanagement | Oft anderen Produkten überlassen | Oft auf die Extraktion beschränkt | End2End: persönliche und agentische Aufgaben, Archiv, Duplikate und Beziehungen zwischen Dokumenten inklusive |
Dreißig Jahre Erfahrung, das Tempo eines Start-ups
AIDA geht auf die dreißigjährige Erfahrung unseres Teams im Dokumentenmanagement zurück, von den ECM-Systemen der Neunzigerjahre bis zur Digitalisierung mit Multifunktionsgeräten in jedem Büro, eine Geschichte, die Giorgio, unser CEO, im Interview zur Entwicklung des Dokumentenmanagements erzählt. Diese Erfahrung zeigt sich in den Funktionen, die ein Unternehmen neben der Extraktion täglich nutzt:
- ein Dokumentenarchiv mit unbegrenztem Speicherplatz in jedem Tarif und Suche im Text und in den extrahierten Daten;
- die Duplikaterkennung anhand des Inhalts oder der extrahierten Felder, mit der Möglichkeit, die Validierung von Duplikaten zu sperren;
- die Beziehungen zwischen Dokumenten, um Bestellung, Lieferschein und Rechnung desselben Vorgangs gemeinsam wiederzufinden;
- Dutzende unterstützte Dateiformate, die in PDF umgewandelt werden;
- AIDA Pay, das aus dem freigegebenen Dokument die Zahlungsaufforderung per Link oder QR-Code an den Kunden sendet und den Zahlungseingang automatisch abgleicht;
- Automatisierungen und Zielsysteme, die die Daten dorthin bringen, wo sie gebraucht werden.
Start-ups, die mit generativer KI entstanden sind, gehen von einem Sprachmodell aus und versuchen, das Dokumentenmanagement darum herum aufzubauen. AIDA ist den umgekehrten Weg gegangen: zuerst hat AIDA verstanden, wie Unternehmen mit Dokumenten arbeiten, dann eine Engine gebaut, die von Menschen lernt, und heute wird diese Engine durch generative KI verstärkt.
Mit dieser Erfahrung im Rücken entwickelt sich AIDA im Tempo eines Start-ups weiter: im letzten Jahr verzeichnete das Changelog mehr als 350 Updates. Dazu gehören AIDA 20.0, das die agentische KI brachte, sowie AIDA 20.5, AIDA Match für den Dokumentenabgleich und die neue AIDA Mobile 7.0. Im Jahr 2025 wurde AIDA mit dem Preis „One to watch: Product of the Year“ bei den Document Manager Awards ausgezeichnet.
Häufig gestellte Fragen
Was ist Datenextraktion ohne Templates?
Es handelt sich um eine Extraktionsmethode, bei der die Position der Daten nicht für jedes Layout vorab beschrieben werden muss. Bei AIDA legt der Dokumenttyp nur fest, welche Daten extrahiert werden, und die Engine lernt aus den von Nutzern bestätigten Dokumenten, wo sie zu finden sind, und erkennt jedes neue Layout selbstständig.
Muss AIDA vor dem Start trainiert werden?
Nein. Die intelligenten Eigenschaften erkennen Datumsangaben, USt-IdNr., IBAN und andere gängige Werte ohne Training, und mit AIDA Boost werden alle Eigenschaften ab dem ersten Dokument extrahiert. Muss ein Wert korrigiert werden, genügt ein Klick bei der normalen Dokumentenprüfung, und AIDA lernt ihn.
Nutzt AIDA generative KI?
Ja. AIDA verfügt über eine Hybrid-AI-Engine: die Dokumentanalyse und das Lernen vom Nutzer, die wir seit 2012 entwickeln, arbeiten mit der generativen KI von AIDA Boost zusammen. Die KI-Agenten nutzen sie, um Dokumente zu durchsuchen, Berechnungen anzustellen und Aktionen auszuführen, immer auf Basis von Daten, die von Nutzern geprüft wurden.
Braucht man einen Programmierer, um AIDA zu konfigurieren?
Nein. Dokumenttypen, Eigenschaften, Automatisierungen und Zielsysteme werden mit wenigen Klicks über die Oberfläche eingerichtet. Die APIs stehen Teams zur Verfügung, die AIDA in ihre eigenen Systeme integrieren möchten, sind aber nicht erforderlich.
Wenn Sie sehen möchten, wie AIDA aus Ihren Dokumenten lernt, entdecken Sie die Datenextraktion von AIDA oder buchen Sie eine Demo und bringen Sie Ihre echten Dokumente mit.





