Data & MoreEngineeringgithub.com/dataandmore/ocr

Ein Dokument, fünf
Durchläufe, nullRätselraten.

Eine mehrstufige OCR-Pipeline, die ein rohes PDF in bereinigten Text und dokumentenweite Signale umwandelt. Jeder Durchlauf ist gezielt: eine freie Textebene, wo diese vorhanden ist, eine schnelle Tesseract-Baseline, ein kombinierter Vision-Worker für Signaturen, Gesichter und ID-Erkennung, ein spezialisierter MRZ-Reader sowie EasyOCR als Deep-Learning-Letztstufe.

Denn Text, den Sie von Anfang an mit dem richtigen Werkzeug lesen, kann nicht verstümmelt werden.

5aufeinanderfolgende Durchläufe
3Detektoren in einem Worker
2OCR-Engines, erst schnell dann tief
1Seitenbild, einmalig geladen
Abschnitt 01Überblick

Die Pipeline auf einen Blick

Seiten werden von links nach rechts verarbeitet. Der MRZ-Durchlauf wird nur ausgelöst, wenn der ID-oder-nicht-Detektor eine Seite als Ausweisdokument einstuft; alles andere wird an den erweiterten OCR-Durchlauf weitergeleitet. Jede Stufe erzeugt Annotationen, die die nächste Stufe als Hinweise verwenden kann.

EINGABE SCHNELLER TEXT PARALLELE BILDVERARBEITUNG SPEZIALIST TIEFE OCR PDF-Reader pdfium / PyMuPDF Seiten → Bilder + Text Entzerrung · 300 DPI Tesseract LSTM · schnelle Baseline OCR Wortrahmen · Konfidenz Layout · Lesereihenfolge kostengünstig · deterministisch Kombinierter Worker drei Detektoren, ein Bildladevorgang Signatur signiert? wo? YuNet Gesichtsrahmen Porträt? ID oder nicht Klassifikator Weiterleitung? wenn ID immer · erweiterte OCR MRZ Reisepass- / Ausweisstreifen P<UTODOE<<JANE<< L898902C36UTO7408 ICAO 9303-Parser Prüfziffern verifiziert EasyOCR CRAFT + CRNN stilisiert · verrauscht 80+ Sprachen letzte Meile
Hauptdatenpfad Bedingte Verzweigung, nur bei Ausweisen Vision-Signal Dokumentannotation
Abschnitt 02Begründung

Warum die Arbeit überhaupt schichten

Ein reales Dokumentenkorpus ist heterogen: Digital erstellte PDFs, eingescannte Briefe mit einem Kaffeefleck, mehrsprachige Verträge und Reisepässe mit maschinenlesbarer Zone landen alle im selben Posteingang. Die Pipeline leitet jede Seite zunächst durch kostengünstige, deterministische Durchläufe und reserviert rechenintensive Deep-Learning-OCR für die Fälle, die dies rechtfertigen. Vision-Signale werden gemeinsam mit dem Text übertragen, sodass ein Verbraucher fragen kann,ob dieser Vertrag unterzeichnet ist oder ob es sich bei diesem Upload tatsächlich um einen Reisepass handelt, ohne die Datei erneut zu lesen.

Durchlauf 01PDF-Reader

Die vordereTür

Zwei PDFs, die für eine Person identisch aussehen, können intern vollkommen unterschiedlich sein: das eine ein digital erstellter Export mit einer perfekten Textebene, das andere ein per Smartphone aufgenommenes Foto, das mit 72 DPI als PDF gespeichert und um vier Grad gedreht wurde. Der Reader normalisiert diese Asymmetrie, sodass die nachgelagerte OCR damit nie konfrontiert wird.

Was er tut

  • Rastert jede Seite auf einen Standard von 300 DPI, damit die Engines konsistente Zeichengrößen verarbeiten.
  • Extrahiert die eingebettete Textebene bei Vorhandensein, wodurch OCR für digital erstellte Dateien vollständig übersprungen wird.
  • Korrigiert Neigung, Verzerrung und Ausrichtung, dann werden die Ränder des Scannerbetts abgeschnitten.
  • Teilt auf mehrseitige Dokumente in einen seitenweisen Datenstrom, den der Rest der Pipeline unabhängig verarbeitet.

Einzigartiger Vorteil

  • Freitext gewinnt. Ein digital erstelltes PDF überspringt OCR – sofort, perfekt und fehlerfrei.
  • Konsistente Eingabe. Jedes nachfolgende Modell kann von einem aufrechten Bild mit vernünftiger DPI-Auflösung ausgehen.
  • Eine einzige Quelle der Wahrheit. Das hier gerenderte Bild wird von jedem nachfolgenden Worker wiederverwendet – keine doppelte Rasterung.
geneigter Rohdaten-Scan neigungskorrigiert 300 DPI
Pass 02Tesseract

Die schnelle Basislösung

Rechnung Nr. 2026-0427 Gesamt: 12.480,00 Fällig am 30. Mai 2026 MwSt. 19283746 Wortboxen + Konfidenz

Tesseract ist das Arbeitstier: schnell, CPU-freundlich, über 100 Sprachen und strukturierte Ausgabe – Wortboxen, Zeilenboxen, wortgenaue Konfidenzwerte. Für die große Masse sauberer Bürodokumente löst es das Problem vollständig.

Funktionsweise

  • Führt den LSTM-Erkenner über jede Seite aus und gibt hOCR / TSV mit Wörtern, Zeilen und Boxen aus.
  • Fügt einen wortgenauen Konfidenz- Score hinzu, der bestimmt, wo EasyOCR einen zweiten Durchlauf benötigt.
  • Gibt Lesereihenfolge und Layout zurück, sodass Absätze sauber rekonstruiert werden.

Einzigartiger Vorteil

  • Geschwindigkeit und Kosten. Reines CPU-Betrieb, keine GPU-Abhängigkeit, horizontal skalierbar und kosteneffizient.
  • Deterministisch. Gleiche Eingabe, gleiche Ausgabe: einfach zu testen, zu cachen und in CI zu vergleichen.
  • Layout-bewusst. Wortboxen und Lesereihenfolge sind erstklassige Ausgaben.
  • Konfidenz als Routing-Signal. Bereiche mit geringer Konfidenz werden zur Eingabe für EasyOCR.
Tesseract ist bewusst der erste OCR-Durchlauf – für die meisten Seiten ausreichend. Die aufwändigen Durchläufe werden nur dort ausgeführt, wo Tesseract an seine Grenzen stößt.
Pass 03Kombinierter Worker

Unterschriften, Gesichter und eine Entscheidung

Der kombinierte Worker ist die visuelle Verarbeitungsspur. Anstatt drei separate Jobs auszuführen, die jeweils das Seitenbild neu laden, einen Tensor allokieren und ein Modell aufwärmen, führt er drei Detektoren in einem einzigen Durchlauf über dasselbe speicherinterne Bild aus und erzeugt dokumentweite Signale, die Text allein nicht liefern kann.

Seitenbild · einmalig geladen Unterschriften-Detektor CNN über die Seite · Boxen + Score YuNet Gesichtsdetektor klein, schnell, läuft auf CPU ID-oder-nicht-Klassifikator binärer Kopf · handelt es sich um einen Ausweis? unterschrieben = true box=(14,130,96,38) · p=0.93 Gesichter = 1 Porträt · Score 0.98 isID = true wird an den MRZ-Durchlauf weitergeleitet ein Bild, ein Batch drei Detektoren teilen sich Dekodierung + Vorverarbeitung ~3× schneller als drei separate Worker
Detektor A

Unterschrift

Die meisten Verträge sind erst nach Gegenzeichnung rechtswirksam. Ein kleines CNN scannt nach tintenähnlichen Strichen, die als handschriftliche Unterschrift erkannt werden, und gibt Boxen sowie einen Score zurück.

  • Wandelt wurde dieser Vertrag unterzeichnet in einen booleschen Wert um.
  • Box und Seitenindex ermöglichen es einer Benutzeroberfläche, direkt zur Unterschriftszeile zu springen.
  • Die nächstgelegene Textzeile – der gedruckte Name – kann der Box zugeordnet werden.
Detektor B

YuNet

YuNet ist ein kompakter Gesichtsdetektor, der für die Echtzeiterkennung auf handelsüblicher Hardware konzipiert wurde. Hier geht es nicht um Gesichter, sondern um Porträts als Dokumentmerkmal.

  • Ein Gesicht in der Ecke ist ein starkes Indiz für einen Personalausweis, Reisepass oder Führerschein.
  • Etwa 1 ms pro Ausschnitt auf der CPU – günstig genug, um es auf jeder Seite auszuführen.
  • Das Vorhandensein eines Gesichts kann eine Schwärzung oder eine besondere Behandlung auslösen.
Detektor C

Ausweisdokument oder nicht

Ein binärer Klassifikator, der die gesamte Seite liest und eine Frage beantwortet: Handelt es sich um ein Ausweisdokument? Seine Aufgabe ist es, zu entscheiden, welche Seiten den MRZ-Spezialisten erreichen.

  • Verhindert, dass MRZ auf jeder Seite ausgeführt wird, da die meisten keine enthalten.
  • Verwendet den Gesichtstreffer von YuNet und den Text von Tesseract als Merkmale.
  • Ein kleiner Kopf über einem kleinen Backbone: schnell und einfach zu kalibrieren.
Warum kombiniert? Das Laden des Bildes, die Farbkonvertierung, die Größenanpassung und das Aufwärmen eines Modells machen den größten Teil der Latenz jedes Detektors aus. Alle drei über ein gemeinsames Bild, einen Prozess und eine enge Schleife auszuführen, reduziert diesen Overhead und hält die Annotationen konsistent, da alle drei dieselben Pixel verarbeitet haben.
Pass 04MRZ

Der Reisepass-Spezialist

Die maschinenlesbare Zone am unteren Rand eines Reisepasses oder Personalausweises entspricht einem strengen ICAO-9303-Format: ein fester Zeichensatz (A–Z 0–9 <), feste Positionen und integrierte Prüfziffern. Ein generisches OCR-System kann sie lesen, verfälscht jedochO/0 oder1/I. Dieser Pass ist speziell für den Streifen entwickelt.

Was er leistet

  • Wird nur ausgeführt, wenn der Klassifikator „Ausweisdokument oder nicht" die Seite markiert, sodass keine unnötige Arbeit anfällt.
  • Verwendet einen MRZ-optimierten Erkenner und eine Grammatik, die ausschließlich gültige MRZ-Zeichen ausgeben.
  • Analysiert die Felder: Typ, ausstellendes Land, Nachname, Vornamen, Dokumentennummer, Staatsangehörigkeit, Geburtsdatum, Geschlecht, Ablaufdatum.
  • VerifiziertPrüfziffern– ein gefälschtes oder falsch gelesenes Feld wird durch Arithmetik erkannt, nicht durch Schätzung.

Einzigartiger Vorteil

  • Strukturiert, kein Freitext. KYC-Code verarbeitet einen typisierten Datensatz, keinen Freitext.
  • Selbstvalidierend. Prüfziffern bieten eine Garantie, die generische OCR-Systeme nicht leisten können.
  • Enger Anwendungsbereich, hohe Genauigkeit. Kleiner Zeichensatz, festes Layout – ein Spezialist ist hier klar im Vorteil.
UTOPIA PASSPORT SURNAME: DOE GIVEN: JANE DOB: 1985-04-12 P<UTODOE<<JANE<<<<<<<<<<<< L898902C36UTO7408122F12<<06 parser → typed record · check ✓
Pass 05EasyOCR

Die Deep-Learning-letzte Meile

Tesseract · confidence 0.41 |nv01ce N0. 2O26-O427 stilisierte Schriftart, geringer Kontrast EasyOCR · confidence 0.96 Invoice No. 2026-0427 CRAFT detector + CRNN

EasyOCR ist ein Deep-Learning-OCR-System – ein CRAFT-Textdetektor kombiniert mit einem CRNN-Erkenner auf PyTorch. Es ist ressourcenintensiver als Tesseract, überzeugt jedoch genau dort, wo Tesseract Schwierigkeiten hat: bei kontrastarmen oder stilisierten Schriftarten, gekrümmtem oder rotiertem Text, Fotos von Kassenbons sowie zahlreichen nicht-lateinischen Schriften. Hier dient es als Fallback und als Rich-OCR-Pass.

Was er leistet

  • Liest die Bereiche erneut, in denen Tesseract eine geringe Konfidenz zurückgegeben hat – gezielt, nicht seitenübergreifend.
  • Verarbeitet nicht-lateinische Schriften, für die eine gegebene Tesseract-Konfiguration nicht eingerichtet ist.
  • Liefert eine zweite Einschätzung: Übereinstimmung zwischen den beiden Engines erhöht die Konfidenz deutlich.

Einzigartiger Vorteil

  • Robustheit. CNN-Erkennung bewältigt Fotos, Perspektivverzerrungen und ungewöhnliche Schriftarten.
  • Abdeckung. Mehr als 80 Sprachen ohne zusätzliche Konfiguration.
  • Zielgerichtet. Wird nur dort ausgeführt, wo Tesseract nicht ausreichend sicher war, sodass der aufwendige Pfad minimal bleibt.
Günstig zuerst, aufwendig nur wo nötig – das hält die Pipeline im Durchschnitt schnell, ohne den langen Rand zu vernachlässigen.
Abschnitt 03Routing

Die Entscheidung, die eine Seite trifft

Seite rendern PDF-Leser Tesseract-Pass Wörter + Konfidenz Kombinierter Worker signature · YuNet · ID-or-not Bereiche mit geringer Konfidenz? Entscheidung, ob EasyOCR benötigt wird MRZ-Pass nur wenn isID = true EasyOCR-Pass gezielt, dann global Abschließender Datensatz Text + Signale + MRZ
Abschnitt 04Auf einen Blick

Was jeder Durchlauf hinzufügt

Durchlauf Ausgabe Kosten Wann er sich bewährt
PDF-Reader normalisierte Bilder, Textebene sehr niedrig digital erstellte PDFs
Tesseract Wortrahmen + Konfidenz niedrig · CPU saubere Bürodokumente
Signatur Signierflag + Rahmen niedrig Verträge, Compliance
YuNet Gesichtsrahmen, Anzahl sehr niedrig Erkennung von Porträts / Ausweisen
ID-or-not isID, Dokumenttyp niedrig Weiterleitung an MRZ
MRZ typisierter Datensatz + Prüfziffern mittel Reisepässe, nationale Ausweise
EasyOCR Text + Konfidenz hoch · GPU-freundlich stilisiert, verrauscht, mehrsprachig
Abschnitt 05Grundsätze

Was die Pipeline voraussetzt

Günstig zuerst, kostspielig nur wenn gerechtfertigt

Jeder Durchlauf existiert, weil der vorherige einen bestimmten Fehlerfall nicht bewältigen kann. Tesseract übernimmt den Großteil; EasyOCR wird nur für Wörter aufgerufen, die nicht erkannt werden konnten; MRZ nur dann, wenn es sich bei der Seite tatsächlich um einen Ausweis handelt.

Signale, nicht nur Text

OCR ist notwendig, aber selten ausreichend. Der kombinierte Worker gibt Signale auf Dokumentenebene aus – signiert, Porträt vorhanden, Identitätsdokument –, die die nachgelagerte Geschäftslogik tatsächlich benötigt.

Spezialisten übertreffen Generalisten in engen Domänen

Eine MRZ im Reisepass ist ein kleines, streng definiertes Format mit Prüfziffern. Ein spezialisierter Parser ist präziser und selbstvalidierend – auf eine Weise, die generische OCR auf demselben Streifen nicht erreichen kann.

Arbeit aufteilen

Der kombinierte Worker existiert, weil das Laden und Vorverarbeiten des Bildes der zeitaufwändige Teil ist. Drei Detektoren über einem einzigen im Arbeitsspeicher gehaltenen Bild reduzieren diesen Aufwand und sorgen für konsistente Annotationen.