Eine mehrstufige OCR-Pipeline, die ein rohes PDF in bereinigten Text und dokumentenweite Signale umwandelt. Jeder Durchlauf ist gezielt: eine freie Textebene, wo diese vorhanden ist, eine schnelle Tesseract-Baseline, ein kombinierter Vision-Worker für Signaturen, Gesichter und ID-Erkennung, ein spezialisierter MRZ-Reader sowie EasyOCR als Deep-Learning-Letztstufe.
Denn Text, den Sie von Anfang an mit dem richtigen Werkzeug lesen, kann nicht verstümmelt werden.
5aufeinanderfolgende Durchläufe
3Detektoren in einem Worker
2OCR-Engines, erst schnell dann tief
1Seitenbild, einmalig geladen
Abschnitt 01Überblick
Die Pipeline auf einen Blick
Seiten werden von links nach rechts verarbeitet. Der MRZ-Durchlauf wird nur ausgelöst, wenn der ID-oder-nicht-Detektor eine Seite als Ausweisdokument einstuft; alles andere wird an den erweiterten OCR-Durchlauf weitergeleitet. Jede Stufe erzeugt Annotationen, die die nächste Stufe als Hinweise verwenden kann.
HauptdatenpfadBedingte Verzweigung, nur bei AusweisenVision-SignalDokumentannotation
Abschnitt 02Begründung
Warum die Arbeit überhaupt schichten
Ein reales Dokumentenkorpus ist heterogen: Digital erstellte PDFs, eingescannte Briefe mit einem Kaffeefleck, mehrsprachige Verträge und Reisepässe mit maschinenlesbarer Zone landen alle im selben Posteingang. Die Pipeline leitet jede Seite zunächst durch kostengünstige, deterministische Durchläufe und reserviert rechenintensive Deep-Learning-OCR für die Fälle, die dies rechtfertigen. Vision-Signale werden gemeinsam mit dem Text übertragen, sodass ein Verbraucher fragen kann,ob dieser Vertrag unterzeichnet ist oder ob es sich bei diesem Upload tatsächlich um einen Reisepass handelt, ohne die Datei erneut zu lesen.
Durchlauf 01PDF-Reader
Die vordereTür
Zwei PDFs, die für eine Person identisch aussehen, können intern vollkommen unterschiedlich sein: das eine ein digital erstellter Export mit einer perfekten Textebene, das andere ein per Smartphone aufgenommenes Foto, das mit 72 DPI als PDF gespeichert und um vier Grad gedreht wurde. Der Reader normalisiert diese Asymmetrie, sodass die nachgelagerte OCR damit nie konfrontiert wird.
Was er tut
Rastert jede Seite auf einen Standard von 300 DPI, damit die Engines konsistente Zeichengrößen verarbeiten.
Extrahiert die eingebettete Textebene bei Vorhandensein, wodurch OCR für digital erstellte Dateien vollständig übersprungen wird.
Korrigiert Neigung, Verzerrung und Ausrichtung, dann werden die Ränder des Scannerbetts abgeschnitten.
Teilt auf mehrseitige Dokumente in einen seitenweisen Datenstrom, den der Rest der Pipeline unabhängig verarbeitet.
Einzigartiger Vorteil
Freitext gewinnt. Ein digital erstelltes PDF überspringt OCR – sofort, perfekt und fehlerfrei.
Konsistente Eingabe. Jedes nachfolgende Modell kann von einem aufrechten Bild mit vernünftiger DPI-Auflösung ausgehen.
Eine einzige Quelle der Wahrheit. Das hier gerenderte Bild wird von jedem nachfolgenden Worker wiederverwendet – keine doppelte Rasterung.
Pass 02Tesseract
Die schnelle Basislösung
Tesseract ist das Arbeitstier: schnell, CPU-freundlich, über 100 Sprachen und strukturierte Ausgabe – Wortboxen, Zeilenboxen, wortgenaue Konfidenzwerte. Für die große Masse sauberer Bürodokumente löst es das Problem vollständig.
Funktionsweise
Führt den LSTM-Erkenner über jede Seite aus und gibt hOCR / TSV mit Wörtern, Zeilen und Boxen aus.
Fügt einen wortgenauen Konfidenz- Score hinzu, der bestimmt, wo EasyOCR einen zweiten Durchlauf benötigt.
Gibt Lesereihenfolge und Layout zurück, sodass Absätze sauber rekonstruiert werden.
Einzigartiger Vorteil
Geschwindigkeit und Kosten. Reines CPU-Betrieb, keine GPU-Abhängigkeit, horizontal skalierbar und kosteneffizient.
Deterministisch. Gleiche Eingabe, gleiche Ausgabe: einfach zu testen, zu cachen und in CI zu vergleichen.
Layout-bewusst. Wortboxen und Lesereihenfolge sind erstklassige Ausgaben.
Konfidenz als Routing-Signal. Bereiche mit geringer Konfidenz werden zur Eingabe für EasyOCR.
Tesseract ist bewusst der erste OCR-Durchlauf – für die meisten Seiten ausreichend. Die aufwändigen Durchläufe werden nur dort ausgeführt, wo Tesseract an seine Grenzen stößt.
Pass 03Kombinierter Worker
Unterschriften, Gesichter und eine Entscheidung
Der kombinierte Worker ist die visuelle Verarbeitungsspur. Anstatt drei separate Jobs auszuführen, die jeweils das Seitenbild neu laden, einen Tensor allokieren und ein Modell aufwärmen, führt er drei Detektoren in einem einzigen Durchlauf über dasselbe speicherinterne Bild aus und erzeugt dokumentweite Signale, die Text allein nicht liefern kann.
Detektor A
Unterschrift
Die meisten Verträge sind erst nach Gegenzeichnung rechtswirksam. Ein kleines CNN scannt nach tintenähnlichen Strichen, die als handschriftliche Unterschrift erkannt werden, und gibt Boxen sowie einen Score zurück.
Wandelt wurde dieser Vertrag unterzeichnet in einen booleschen Wert um.
Box und Seitenindex ermöglichen es einer Benutzeroberfläche, direkt zur Unterschriftszeile zu springen.
Die nächstgelegene Textzeile – der gedruckte Name – kann der Box zugeordnet werden.
Detektor B
YuNet
YuNet ist ein kompakter Gesichtsdetektor, der für die Echtzeiterkennung auf handelsüblicher Hardware konzipiert wurde. Hier geht es nicht um Gesichter, sondern um Porträts als Dokumentmerkmal.
Ein Gesicht in der Ecke ist ein starkes Indiz für einen Personalausweis, Reisepass oder Führerschein.
Etwa 1 ms pro Ausschnitt auf der CPU – günstig genug, um es auf jeder Seite auszuführen.
Das Vorhandensein eines Gesichts kann eine Schwärzung oder eine besondere Behandlung auslösen.
Detektor C
Ausweisdokument oder nicht
Ein binärer Klassifikator, der die gesamte Seite liest und eine Frage beantwortet: Handelt es sich um ein Ausweisdokument? Seine Aufgabe ist es, zu entscheiden, welche Seiten den MRZ-Spezialisten erreichen.
Verhindert, dass MRZ auf jeder Seite ausgeführt wird, da die meisten keine enthalten.
Verwendet den Gesichtstreffer von YuNet und den Text von Tesseract als Merkmale.
Ein kleiner Kopf über einem kleinen Backbone: schnell und einfach zu kalibrieren.
Warum kombiniert? Das Laden des Bildes, die Farbkonvertierung, die Größenanpassung und das Aufwärmen eines Modells machen den größten Teil der Latenz jedes Detektors aus. Alle drei über ein gemeinsames Bild, einen Prozess und eine enge Schleife auszuführen, reduziert diesen Overhead und hält die Annotationen konsistent, da alle drei dieselben Pixel verarbeitet haben.
Pass 04MRZ
Der Reisepass-Spezialist
Die maschinenlesbare Zone am unteren Rand eines Reisepasses oder Personalausweises entspricht einem strengen ICAO-9303-Format: ein fester Zeichensatz (A–Z 0–9 <), feste Positionen und integrierte Prüfziffern. Ein generisches OCR-System kann sie lesen, verfälscht jedochO/0 oder1/I. Dieser Pass ist speziell für den Streifen entwickelt.
Was er leistet
Wird nur ausgeführt, wenn der Klassifikator „Ausweisdokument oder nicht" die Seite markiert, sodass keine unnötige Arbeit anfällt.
Verwendet einen MRZ-optimierten Erkenner und eine Grammatik, die ausschließlich gültige MRZ-Zeichen ausgeben.
VerifiziertPrüfziffern– ein gefälschtes oder falsch gelesenes Feld wird durch Arithmetik erkannt, nicht durch Schätzung.
Einzigartiger Vorteil
Strukturiert, kein Freitext. KYC-Code verarbeitet einen typisierten Datensatz, keinen Freitext.
Selbstvalidierend. Prüfziffern bieten eine Garantie, die generische OCR-Systeme nicht leisten können.
Enger Anwendungsbereich, hohe Genauigkeit. Kleiner Zeichensatz, festes Layout – ein Spezialist ist hier klar im Vorteil.
Pass 05EasyOCR
Die Deep-Learning-letzte Meile
EasyOCR ist ein Deep-Learning-OCR-System – ein CRAFT-Textdetektor kombiniert mit einem CRNN-Erkenner auf PyTorch. Es ist ressourcenintensiver als Tesseract, überzeugt jedoch genau dort, wo Tesseract Schwierigkeiten hat: bei kontrastarmen oder stilisierten Schriftarten, gekrümmtem oder rotiertem Text, Fotos von Kassenbons sowie zahlreichen nicht-lateinischen Schriften. Hier dient es als Fallback und als Rich-OCR-Pass.
Was er leistet
Liest die Bereiche erneut, in denen Tesseract eine geringe Konfidenz zurückgegeben hat – gezielt, nicht seitenübergreifend.
Verarbeitet nicht-lateinische Schriften, für die eine gegebene Tesseract-Konfiguration nicht eingerichtet ist.
Liefert eine zweite Einschätzung: Übereinstimmung zwischen den beiden Engines erhöht die Konfidenz deutlich.
Einzigartiger Vorteil
Robustheit. CNN-Erkennung bewältigt Fotos, Perspektivverzerrungen und ungewöhnliche Schriftarten.
Abdeckung. Mehr als 80 Sprachen ohne zusätzliche Konfiguration.
Zielgerichtet. Wird nur dort ausgeführt, wo Tesseract nicht ausreichend sicher war, sodass der aufwendige Pfad minimal bleibt.
Günstig zuerst, aufwendig nur wo nötig – das hält die Pipeline im Durchschnitt schnell, ohne den langen Rand zu vernachlässigen.
Abschnitt 03Routing
Die Entscheidung, die eine Seite trifft
Abschnitt 04Auf einen Blick
Was jeder Durchlauf hinzufügt
Durchlauf
Ausgabe
Kosten
Wann er sich bewährt
PDF-Reader
normalisierte Bilder, Textebene
sehr niedrig
digital erstellte PDFs
Tesseract
Wortrahmen + Konfidenz
niedrig · CPU
saubere Bürodokumente
Signatur
Signierflag + Rahmen
niedrig
Verträge, Compliance
YuNet
Gesichtsrahmen, Anzahl
sehr niedrig
Erkennung von Porträts / Ausweisen
ID-or-not
isID, Dokumenttyp
niedrig
Weiterleitung an MRZ
MRZ
typisierter Datensatz + Prüfziffern
mittel
Reisepässe, nationale Ausweise
EasyOCR
Text + Konfidenz
hoch · GPU-freundlich
stilisiert, verrauscht, mehrsprachig
Abschnitt 05Grundsätze
Was die Pipeline voraussetzt
Günstig zuerst, kostspielig nur wenn gerechtfertigt
Jeder Durchlauf existiert, weil der vorherige einen bestimmten Fehlerfall nicht bewältigen kann. Tesseract übernimmt den Großteil; EasyOCR wird nur für Wörter aufgerufen, die nicht erkannt werden konnten; MRZ nur dann, wenn es sich bei der Seite tatsächlich um einen Ausweis handelt.
Signale, nicht nur Text
OCR ist notwendig, aber selten ausreichend. Der kombinierte Worker gibt Signale auf Dokumentenebene aus – signiert, Porträt vorhanden, Identitätsdokument –, die die nachgelagerte Geschäftslogik tatsächlich benötigt.
Spezialisten übertreffen Generalisten in engen Domänen
Eine MRZ im Reisepass ist ein kleines, streng definiertes Format mit Prüfziffern. Ein spezialisierter Parser ist präziser und selbstvalidierend – auf eine Weise, die generische OCR auf demselben Streifen nicht erreichen kann.
Arbeit aufteilen
Der kombinierte Worker existiert, weil das Laden und Vorverarbeiten des Bildes der zeitaufwändige Teil ist. Drei Detektoren über einem einzigen im Arbeitsspeicher gehaltenen Bild reduzieren diesen Aufwand und sorgen für konsistente Annotationen.