PDF zu JSON
Text und Struktur eines PDFs als JSON extrahieren
PDF hochladen
Dateien hierher ziehen oder klicken zum Durchsuchen
Über PDF zu JSON
Extrahiert Textinhalt und Struktur eines PDFs als JSON — seitenweise, mit Textblöcken und ihren Positionen auf der Seite. Du bekommst das Dokument als Daten statt als Bild eines Dokuments.
Die Textextraktion läuft im Browser. Geschäftlich sensible Dokumente — Preislisten, Kataloge, Verträge — werden nie hochgeladen.
PDF zu JSON verwenden
- Lade das PDF.
- Wähl, ob Positionskoordinaten mitgegeben werden — nötig, wenn du Spalten rekonstruieren willst.
- Extrahieren.
- Lade das JSON herunter und verarbeite es weiter.
In der Produktion
Ein Verleih schickt seinen Katalog als PDF. Die Positionen in eine Tabelle oder eine Geräteliste zu bekommen heißt, den Text mitsamt Layout zu extrahieren — was Kopieren und Einfügen zerstört, sobald das Dokument Spalten hat.
Häufige Fragen
- Funktioniert das bei einem gescannten Dokument?
- Nein. Ein Scan ist ein Foto ohne Textebene, es gibt also nichts zu extrahieren. Er braucht vorher Texterkennung; ohne sie bekommst du ein leeres Ergebnis statt einer Fehlermeldung.
- Warum ist der Text nicht in Lesereihenfolge?
- PDFs speichern Text in der Reihenfolge, in der er gezeichnet wurde, und die ist bei mehrspaltigen Layouts oft nicht die Lesereihenfolge. Genau dafür gibt es die Positionskoordinaten — mit ihnen lassen sich die Spalten rekonstruieren.
- Bleiben Tabellen als Tabellen erhalten?
- Nicht als strukturierte Tabellen, weil die meisten PDFs sie nicht als solche auszeichnen. Du bekommst den Zellentext mit Koordinaten, aus denen sich das Raster durch Gruppieren der Positionen rekonstruieren lässt.
