1. Home
  2. Dashboard
  3. Forum
    1. Unresolved Threads
    2. Members
      1. Recent Activities
      2. Users Online
      3. Team
      4. Search Members
  4. Articles
    1. Liste funktionierender Drucker
    2. Unser Forum
    3. Gaming
    4. Distributionen
    5. Hardware und Linux
    6. Netzwerk & Server
    7. Software-Vorstellungen
    8. Reviews
  5. Linux Guides
    1. Homepage
    2. YouTube
    3. Telegram
    4. Community-Stammtisch
  6. Lexicon
    1. Last Changes
  7. Smart Search
  • Login
  • Register
  • Search
Lexikon
  • Everywhere
  • Articles
  • Pages
  • Forum
  • Lexikon
  • More Options
  1. Linux Guides Community
  2. Lexicon

Tesseract

  • Forwared from „tesseract“
  • tuxine
  • June 18, 2026 at 5:11 PM
  • July 17, 2026 at 5:15 PM
  • 216 times viewed
  • Tesseract ist eine extrem leistungsstarke, freie Software zur optischen Texterkennung (OCR – Optical Character Recognition). Das ursprünglich von Hewlett-Packard entwickelte und heute von Google gepflegte Werkzeug ist in der Lage, gedruckten Text auf Bildern, Fotos oder Scans vollautomatisch zu erkennen und in editierbaren Text umzuwandeln. Tesseract unterstützt über 100 Sprachen (inklusive Deutsch) und kann sogar alte Frakturschriften lesen. Da es standardmäßig als reines Terminal-Werkzeug läuft, dient es im Linux-Alltag meist als unsichtbarer Motor für grafische Programme wie PDFsam, gImageReader oder Paperless-ngx.

    Klick für mehr ...

    1 👁️ Tesseract (Die mächtige Open-Source-Texterkennung)

    1.1 1.1 🔬 DIE FUNKTIONSWEISE: WIE ARBEITET TESSERACT?

    Das Digitalisieren von Papierdokumenten hat einen großen Haken:

    Für den Computer ist ein Scan erst einmal nur ein „dummes“ Bild aus Pixeln. Man kann darin weder nach Wörtern suchen, noch Text mit der Maus markieren und kopieren.

    Tesseract ändert das. Es analysiert die Formen der Pixel, erkennt Linien, Buchstaben sowie Wörter und setzt diese wieder zu echtem Text zusammen. Seit der Version 4 nutzt Tesseract dafür modernste künstliche Intelligenz (neuronale Netze / LSTM), wodurch die Erkennungsrate selbst bei schlechten Scans oder Smartphone-Fotos extrem hoch ist.

    1.1.1 1.1.1 Die wichtigsten Stärken im Überblick:

    • Sprachpakete:
      Tesseract kann mit über 100 Sprachen gefüttert werden. Man kann ihm beim Start sagen, ob der Text auf Deutsch, Englisch oder mehrsprachig verfasst ist.
    • Layout-Analyse:
      Das Programm erkennt automatisch, ob es sich um ein mehrspaltiges Zeitungs-Layout, eine Tabelle oder einen normalen Brief handelt, und liest den Text in der korrekten Reihenfolge.
    • Hintergrund-Motor:
      Weil Tesseract so präzise ist, greifen fast alle bekannten Linux-Grafikprogramme zur Texterkennung im Hintergrund auf Tesseract zurück.

    1.2 1.2 🛠️ INSTALLATION UND DIE WICHTIGSTEN SPRACHPAKETE

    Tesseract lässt sich auf allen großen Distributionen direkt installieren.

    Wichtig: Man sollte immer das deutsche Sprachpaket (deu) direkt mitinstallieren, da die Erkennung sonst standardmäßig nur auf Englisch funktioniert.

    Ubuntu / Linux Mint / Pop!_OS:

    Code
    sudo apt install tesseract-ocr tesseract-ocr-deu

    Fedora:

    Code
    sudo dnf install tesseract tesseract-langpack-deu

    Arch Linux:

    Code
    sudo pacman -S tesseract tesseract-data-deu

    openSUSE (Tumbleweed / Leap):

    Code
    sudo zypper install tesseract tesseract-traineddata-deu

    1.2.1 1.2.1 Ein kurzes Praxis-Beispiel für das Terminal:

    Um den Text aus einem Bild namens brief.png zu lesen und als Textdatei ergebnis.txt zu speichern, reicht dieser kurze Befehl:

    Code
    tesseract brief.png ergebnis -l deu

    (Das -l deu sagt Tesseract, dass es das deutsche Sprachpaket nutzen soll).

    1.3 1.3 ⚠️ DIE KLASSISCHEN STOLPERSTEINE

    1.3.1 „Tesseract erkennt statt Umlauten (ä, ö, ü) nur seltsame Hieroglyphen oder Sonderzeichen.“

    Hintergrund:
    Das ist der häufigste Fehler.
    Wenn das deutsche Sprachpaket fehlt oder beim Befehl nicht angegeben wird, versucht Tesseract das Bild mit dem englischen Zeichensatz zu lesen. Da es im Englischen keine Umlaute gibt, rät die Software falsch.

    Lösung:
    Stelle sicher, dass das Paket für die deutsche Sprache (siehe Installations-Schritt oben) installiert ist, und hänge an jeden Terminal-Befehl zwingend das Kürzel -l deu an.

    1.3.2 „Die Texterkennung ist total fehlerhaft und wirft nur Buchstabensalat aus.“

    Hintergrund:
    OCR-Software ist extrem empfindlich, was den Kontrast und die Drehung des Bildes angeht. Wenn ein Dokument schief fotografiert wurde, die Auflösung zu gering ist oder der Hintergrund stark rauscht, sinkt die Erkennungsrate drastisch.

    Lösung:
    Das Bild sollte vor der Bearbeitung kurz optimiert werden. Im Forum empfiehlt sich folgendes Vorgehen: Den Scan gerade ausrichten (drehen), den Kontrast erhöhen (sodass die Schrift tiefschwarz und der Hintergrund reinweiß ist) und die Auflösung auf mindestens 300 DPI heraufsetzen. Danach klappt die Erkennung meist fehlerfrei.

    1.4 1.4 💡 FAZIT

    Tesseract ist ein absolut unverzichtbares Werkzeug, wenn es um das papierlose Büro unter Linux geht. Wer keine Lust auf das Terminal hat, installiert sich einfach die grafische Oberfläche gImageReader dazu – diese nutzt Tesseract im Hintergrund, lässt sich aber komplett bequem per Maus bedienen.

    • Texterkennung
  • Previous entry Simple Scan / Dokument Scanner
  • Next entry Texmaker
  • Changelog
  • PDF
25-linuxguides-png

Table of Contents

  • 1 👁️ Tesseract (Die mächtige Open-Source-Texterkennung)
    • 1.1 1.1 🔬 DIE FUNKTIONSWEISE: WIE ARBEITET TESSERACT?
      • 1.1.1 1.1.1 Die wichtigsten Stärken im Überblick:
    • 1.2 1.2 🛠️ INSTALLATION UND DIE WICHTIGSTEN SPRACHPAKETE
      • 1.2.1 1.2.1 Ein kurzes Praxis-Beispiel für das Terminal:
    • 1.3 1.3 ⚠️ DIE KLASSISCHEN STOLPERSTEINE
      • 1.3.1 „Tesseract erkennt statt Umlauten (ä, ö, ü) nur seltsame Hieroglyphen oder Sonderzeichen.“
      • 1.3.2 „Die Texterkennung ist total fehlerhaft und wirft nur Buchstabensalat aus.“
    • 1.4 1.4 💡 FAZIT

Categories

  1. 3D 6
  2. Allgemein 84
  3. Audio 37
  4. AppImages 4
  5. Bild - Anzeige, - Bearbeitung, Foto-Bearbeitung, Grafik-Bearbeitung, - Verwaltung, Techn. Zeichnen, 35
  6. Büro, Mail, Messenger, Drucker, Scanner, PDF, OCR, LaTex 31
  7. Browser 18
  8. Dateimanager 6
  9. Dateisysteme und dessen Verwaltung, Dateisuche 8
  10. Datensicherung 9
  11. Desktop-Umgebungen 15
  12. Distributionen, Boot 98
  13. Editoren (Text, Quellcode,Markdown,Wiki,Autoren,Web) 11
  14. Fenstermanager 14
  15. Firewall - Datensicherheit 15
  16. Gaming unter Linux 12
  17. Hardware, Speicher, virtuelle Speicher 34
  18. Installer 3
  19. Kernel 8
  20. Maker Community 9
  21. Netzwerk 36
  22. Python 10
  23. Packprogramme - Archivmanager, Synchronisierung 18
  24. Paketverwaltung 30
  25. Remote Verbindungen 6
  26. Sandbox Programme 6
  27. Schnittstellen 6
  28. Systemdienste 13
  29. Terminaleditoren 20
  30. Terminal - bzw. Konsolenbefehle u. Werkzeuge 67
  31. Video, Medienserver 12
  32. Videoplayer 9
  33. Virtualisierung und Container 17
  34. Windows Umgebung 15
  1. Privacy Policy
  2. Legal Notice
  1. Nutzungsbedingungen
Lexicon, developed by www.viecode.com
Powered by WoltLab Suite™