Zum Inhalt springen
getnextpdf.com

Enterprise Edition

Intelligence — Ausführliche Referenz

Diese Detailreferenz dokumentiert die Schlüssel-Wert-Typisierung und Schema-Validierung, die Synthese von Tabellengittern und die Grenze der Orchestrierung durchsuchbarer Overlays.

Diese Fähigkeit wird in NextPDF Enterprise (nextpdf/enterprise) ausgeliefert und aktiviert sich mit einem Lizenzumschlag der Enterprise-Stufe. Ein Deployment ohne diese Berechtigung lädt die Klassen der Fähigkeit nicht. Editionen vergleichen und Lizenz erwerben.

StructuredExtractor::extract typisiert rohe Schlüssel-Wert-Eingaben. Wird ein Schema bereitgestellt, werden nur Paare behalten, deren Schlüssel einem Schemafeld entspricht; Paare ohne explizite Konfidenz erhalten einen festen Standardwert. validateSchema gibt die erforderlichen Feldnamen zurück, die nicht gefunden wurden (leer bedeutet konform). Dieser Schritt typisiert und validiert bereits extrahierte Daten; er erkennt keinen Text und weist keine berechnete Präzision zu.

TableExtractor::extract erstellt strukturierte Tabellen aus rohen Zeilengittern. Die Spaltenzahl entspricht der breitesten Zeile; kurze Zeilen werden mit leeren Zellen aufgefüllt. Jede Zelle erhält eine synthetisierte Bounding-Box aus einer gleichmäßigen Unterteilung einer normalisierten Seitenfläche und eine feste Standardkonfidenz. Eine Tabelle ohne Zeilen oder ohne Spalten wird übersprungen. Die Bounding-Boxes sind eine Gittersynthese, kein gemessenes Layout.

SearchableOverlay::generate validiert den PDF-Header, begrenzt Eingabegröße und Seitenzahl (scheitert bei Überlauf fail-closed), erkennt Seiten ohne nutzbare Textschicht, steuert das konfigurierte OCR-Backend und gibt Wortzahlen pro Seite sowie eine durchschnittliche Konfidenz zurück. Eine Seite mit einer nutzbaren nativen Textschicht wird standardmäßig übersprungen. Unsichtbarer OCR-Text stützt sich auf einen Textrendering-Modus, der die Glyphen weder füllt noch strichelt (ISO 32000-2:2020 §9.3.3); ist die Quelle getaggt, bildet der Strukturbaum Inhalt auf eine Lesereihenfolge ab (§14.7) und Tabellenstrukturelemente beschreiben Zeilen und Zellen (§14.8). Die eigentliche Rasterisierung und Injektion unsichtbaren Texts werden an einen separaten Sidecar-Prozess delegiert; die PHP-Oberfläche orchestriert und gibt Ergebnismetadaten zurück. Die Overlay-Ausgabe ist ein abgeleitetes Dokument — jede vorhandene Signatur wird ungültig und die Compliance muss erneut validiert werden. Die Konfidenz ist Passthrough oder ein fester Standardwert; die Oberfläche sichert keine OCR-Genauigkeit und keinen Extraktions-Recall zu.

NextPDF\Enterprise\Intelligence\StructuredExtractor, NextPDF\Enterprise\Intelligence\ExtractionSchema, NextPDF\Enterprise\Intelligence\SchemaField, NextPDF\Enterprise\Intelligence\KeyValuePair, NextPDF\Enterprise\Intelligence\TableExtractor, NextPDF\Enterprise\Intelligence\TableResult, NextPDF\Enterprise\Intelligence\TableCell, NextPDF\Enterprise\Intelligence\SearchableOverlay, NextPDF\Enterprise\Intelligence\OverlayConfig, NextPDF\Enterprise\Intelligence\SearchableOverlayResult, NextPDF\Enterprise\Intelligence\PageOverlayInfo, NextPDF\Enterprise\Intelligence\ExtractionConfig sowie die ExtractionStrategy / OverlayQuality-Enums. Das OCR-Backend ist ein injizierter Vertrag, der vom Deployment bereitgestellt wird. Die Signaturen sind auf der öffentlichen Seite aufgeführt.

Der Overlay-Mechanismus bildet sich auf ISO 32000-2:2020 §9.3.3 (Textrendering-Modus) ab und, für getaggte Quellen, auf §14.7–§14.8 (Strukturbaum und Tabellenelemente). Die Strukturierungsschritte verbrauchen bereits extrahierte Daten; die Qualität ist durch den vorgelagerten Extraktor und das OCR-Backend begrenzt.

  • Synthetisierte Tabellen-Bounding-Boxes sind eine gleichmäßige Gitterunterteilung, kein gemessenes Layout.
  • Ist das OCR-Backend nicht verfügbar, tragen betroffene Seiten null Wörter bei, statt dass der gesamte Lauf stillschweigend scheitert; prüfen Sie das Ergebnis pro Seite.
  • Die Overlay-Ausgabe ist ein abgeleitetes Dokument; validieren Sie Signaturen und Compliance-Status erneut.
  • In diesem Modul findet keine kryptografische Operation statt, daher gibt es kein FIPS-Modus-spezifisches Verhalten.

Diese Seite dokumentiert ausschließlich extern beobachtbares Verhalten und die unterstützte öffentliche API-Oberfläche. Interne Namespace-Pfade, Hilfsklassen, Mechanismustabellen, Runbook-Dateinamen und Ticket-Präfixe liegen außerhalb des Umfangs.

NextPDF Core (Apache-2.0) hat keine Orchestrierung durchsuchbarer Overlays und keine schema-validierte Strukturierungsoberfläche — keine; diese Fähigkeit hat kein Core-Tier-Äquivalent.

NextPDF Pro liefert strukturelle AST-gesteuerte Extraktion über ein bereits geparstes Dokument; es bietet keine schema-validierte Schlüssel-Wert-Strukturierung, keine Tabellenrekonstruktion aus rohen Gittern und keine OCR-gestützte Orchestrierung durchsuchbarer Overlays. Diese werden ausschließlich im Paket nextpdf/enterprise ausgeliefert.

Die Schlüssel-Wert-Typisierung, die Schema-Validierung, die Synthese von Tabellengittern und die Overlay-Orchestrierung werden auf Verhaltensebene beschrieben. Die eigentliche Rasterisierung und Injektion unsichtbaren Texts laufen in einem separaten Sidecar-Prozess; die Sidecar-Interna, das OCR-Modell und etwaige interne Orchestrierungsdetails liegen außerhalb des Umfangs und werden hier nicht wiedergegeben. Das OCR-Backend ist ein injizierter Vertrag, der vom Deployment bereitgestellt wird.

Das Deployment stellt das OCR-Backend bereit und betreibt es und wählt, wo OCR berechnet wird — und damit, wo Dokumentbilder und erkannter Text berechnet und gespeichert werden. Die Oberfläche begrenzt Eingabegröße und Seitenzahl und scheitert bei Überlauf fail-closed. NextPDF Enterprise orchestriert den Workflow und gibt Ergebnismetadaten zurück; es bettet kein OCR-Modell ein und garantiert keine Erkennungsgenauigkeit und keinen Extraktions-Recall.

Für diese Oberfläche gilt keine exportkontrollrechtliche Beschränkung. Die Oberfläche sichert keine Garantie der OCR-Genauigkeit und des Extraktions-Recalls und keinen regulatorischen Compliance-Status zu. Diese Referenz ist kein Rechtsgutachten.