PDFzugangPDF kostenlos prüfen

Lokale OCR · PDFzugang Wissen

Gescannte PDF durchsuchbar machen – ohne das Dokument hochzuladen

Ein Scan besteht zunächst nur aus Bildern. Ohne Texterkennung können Suchfunktion, Kopieren und Screenreader den Inhalt nicht zuverlässig nutzen.

Einordnung

OCR ist Texterkennung, noch keine fertige Barrierefreiheit

Die OCR wandelt sichtbare Buchstaben in bearbeitbaren Text um. Qualität hängt von Auflösung, Kontrast, Sprache, Drehung und Schriftbild ab. Namen, Zahlen und Sonderzeichen sollten besonders sorgfältig kontrolliert werden.

Nach der Erkennung fehlt weiterhin die semantische Struktur. Deshalb wird der Text in einzelne bearbeitbare Blöcke zerlegt und anschließend als Überschrift, Absatz oder Liste eingeordnet.

  • Richtige Dokumentsprache vor OCR auswählen
  • Erkannten Text vollständig gegen den Scan lesen
  • Zahlen, Eigennamen und Umlaute kontrollieren
  • Abschnitte und Listen semantisch kennzeichnen
  • Originalscan für den visuellen Vergleich aufbewahren

Im Werkzeug

Vom Scan zur getaggten Lesefassung

Der kostenlose Dokument-Check erkennt Seiten mit kaum auswählbarem Text. Nach dem Start der lokalen OCR erscheint der erkannte Inhalt im Struktureditor.

Der Export erzeugt eine kleine textbasierte PDF/UA-Lesefassung. Das Scanbild selbst wird nicht als Layoutkopie übernommen; der Fokus liegt auf lesbarem, durchsuchbarem Inhalt.

01 / Prüfen

Datei lokal lesen

Der Browser untersucht Text, Metadaten und automatisch erkennbare Strukturprobleme.

02 / Korrigieren

Inhalt sichtbar ordnen

OCR-Text, Überschriften, Absätze und Listen bleiben vor dem Export bearbeitbar.

03 / Ausgeben

Vier Ergebnisse erhalten

Basisfix, getaggte Lesefassung, semantisches HTML und transparenter Prüfbericht.

Grenze der Automatik

PDFzugang ist kein Zertifikat. Komplexe Tabellen, Formulare, Alternativtexte und die inhaltlich richtige Lesereihenfolge müssen zusätzlich manuell geprüft werden.

Eigene PDF jetzt prüfen

Analyse kostenlos, Export einmalig ab 4,90 €, ohne Konto und ohne Datei-Upload.

Zum Dokument-Check →

FAQ

Häufige Fragen

Welche Sprachen werden unterstützt?

Die Oberfläche bietet aktuell Deutsch, Englisch, Rumänisch, Türkisch, Französisch und Spanisch.

Wird der Scan an einen OCR-Dienst übertragen?

Nein. Tesseract.js verarbeitet die gerenderten Seiten lokal im Browser. Sprachmodelle und Programmcode müssen beim ersten Start geladen werden.

Bleibt das Originalbild erhalten?

Das Basisfix behält die Original-PDF. Die zusätzliche Lesefassung enthält den erkannten und strukturierten Text.

Weiterlesen

Quellen und Prüfbasis