1 👁️ Tesseract (Die mächtige Open-Source-Texterkennung)
1.1 1.1 🔬 DIE FUNKTIONSWEISE: WIE ARBEITET TESSERACT?
Das Digitalisieren von Papierdokumenten hat einen großen Haken:
Für den Computer ist ein Scan erst einmal nur ein „dummes“ Bild aus Pixeln. Man kann darin weder nach Wörtern suchen, noch Text mit der Maus markieren und kopieren.
Tesseract ändert das. Es analysiert die Formen der Pixel, erkennt Linien, Buchstaben sowie Wörter und setzt diese wieder zu echtem Text zusammen. Seit der Version 4 nutzt Tesseract dafür modernste künstliche Intelligenz (neuronale Netze / LSTM), wodurch die Erkennungsrate selbst bei schlechten Scans oder Smartphone-Fotos extrem hoch ist.
1.1.1 1.1.1 Die wichtigsten Stärken im Überblick:
- Sprachpakete:
Tesseract kann mit über 100 Sprachen gefüttert werden. Man kann ihm beim Start sagen, ob der Text auf Deutsch, Englisch oder mehrsprachig verfasst ist. - Layout-Analyse:
Das Programm erkennt automatisch, ob es sich um ein mehrspaltiges Zeitungs-Layout, eine Tabelle oder einen normalen Brief handelt, und liest den Text in der korrekten Reihenfolge. - Hintergrund-Motor:
Weil Tesseract so präzise ist, greifen fast alle bekannten Linux-Grafikprogramme zur Texterkennung im Hintergrund auf Tesseract zurück.
1.2 1.2 🛠️ INSTALLATION UND DIE WICHTIGSTEN SPRACHPAKETE
Tesseract lässt sich auf allen großen Distributionen direkt installieren.
Wichtig: Man sollte immer das deutsche Sprachpaket (deu) direkt mitinstallieren, da die Erkennung sonst standardmäßig nur auf Englisch funktioniert.
Ubuntu / Linux Mint / Pop!_OS:
Arch Linux:
openSUSE (Tumbleweed / Leap):
1.2.1 1.2.1 Ein kurzes Praxis-Beispiel für das Terminal:
Um den Text aus einem Bild namens brief.png zu lesen und als Textdatei ergebnis.txt zu speichern, reicht dieser kurze Befehl:
(Das -l deu sagt Tesseract, dass es das deutsche Sprachpaket nutzen soll).
1.3 1.3 ⚠️ DIE KLASSISCHEN STOLPERSTEINE
1.3.1 „Tesseract erkennt statt Umlauten (ä, ö, ü) nur seltsame Hieroglyphen oder Sonderzeichen.“
Hintergrund:
Das ist der häufigste Fehler.
Wenn das deutsche Sprachpaket fehlt oder beim Befehl nicht angegeben wird, versucht Tesseract das Bild mit dem englischen Zeichensatz zu lesen. Da es im Englischen keine Umlaute gibt, rät die Software falsch.
Lösung:
Stelle sicher, dass das Paket für die deutsche Sprache (siehe Installations-Schritt oben) installiert ist, und hänge an jeden Terminal-Befehl zwingend das Kürzel -l deu an.
1.3.2 „Die Texterkennung ist total fehlerhaft und wirft nur Buchstabensalat aus.“
Hintergrund:
OCR-Software ist extrem empfindlich, was den Kontrast und die Drehung des Bildes angeht. Wenn ein Dokument schief fotografiert wurde, die Auflösung zu gering ist oder der Hintergrund stark rauscht, sinkt die Erkennungsrate drastisch.
Lösung:
Das Bild sollte vor der Bearbeitung kurz optimiert werden. Im Forum empfiehlt sich folgendes Vorgehen: Den Scan gerade ausrichten (drehen), den Kontrast erhöhen (sodass die Schrift tiefschwarz und der Hintergrund reinweiß ist) und die Auflösung auf mindestens 300 DPI heraufsetzen. Danach klappt die Erkennung meist fehlerfrei.
1.4 1.4 💡 FAZIT
Tesseract ist ein absolut unverzichtbares Werkzeug, wenn es um das papierlose Büro unter Linux geht. Wer keine Lust auf das Terminal hat, installiert sich einfach die grafische Oberfläche gImageReader dazu – diese nutzt Tesseract im Hintergrund, lässt sich aber komplett bequem per Maus bedienen.