Enterprise Edition
Intelligence — Ausführliche Referenz
Auf einen Blick
Abschnitt betitelt „Auf einen Blick“Diese Detailreferenz dokumentiert die Schlüssel-Wert-Typisierung und Schema-Validierung, die Synthese von Tabellengittern und die Grenze der Orchestrierung durchsuchbarer Overlays.
Verfügbarkeit & Lizenzierung
Abschnitt betitelt „Verfügbarkeit & Lizenzierung“Diese Fähigkeit wird in NextPDF Enterprise (nextpdf/enterprise) ausgeliefert und aktiviert sich mit einem Lizenzumschlag der Enterprise-Stufe. Ein Deployment ohne diese Berechtigung lädt die Klassen der Fähigkeit nicht. Editionen vergleichen und Lizenz erwerben.
Verhaltensvertrag
Abschnitt betitelt „Verhaltensvertrag“StructuredExtractor::extract typisiert rohe Schlüssel-Wert-Eingaben. Wird
ein Schema bereitgestellt, werden nur Paare behalten, deren Schlüssel einem
Schemafeld entspricht; Paare ohne explizite Konfidenz erhalten einen festen
Standardwert. validateSchema gibt die erforderlichen Feldnamen zurück, die
nicht gefunden wurden (leer bedeutet konform). Dieser Schritt typisiert und
validiert bereits extrahierte Daten; er erkennt keinen Text und weist keine
berechnete Präzision zu.
TableExtractor::extract erstellt strukturierte Tabellen aus rohen
Zeilengittern. Die Spaltenzahl entspricht der breitesten Zeile; kurze Zeilen
werden mit leeren Zellen aufgefüllt. Jede Zelle erhält eine synthetisierte
Bounding-Box aus einer gleichmäßigen Unterteilung einer normalisierten
Seitenfläche und eine feste Standardkonfidenz. Eine Tabelle ohne Zeilen oder
ohne Spalten wird übersprungen. Die Bounding-Boxes sind eine Gittersynthese,
kein gemessenes Layout.
SearchableOverlay::generate validiert den PDF-Header, begrenzt
Eingabegröße und Seitenzahl (scheitert bei Überlauf fail-closed), erkennt
Seiten ohne nutzbare Textschicht, steuert das konfigurierte OCR-Backend und
gibt Wortzahlen pro Seite sowie eine durchschnittliche Konfidenz zurück. Eine
Seite mit einer nutzbaren nativen Textschicht wird standardmäßig
übersprungen. Unsichtbarer OCR-Text stützt sich auf einen Textrendering-Modus,
der die Glyphen weder füllt noch strichelt (ISO 32000-2:2020 §9.3.3); ist die
Quelle getaggt, bildet der Strukturbaum Inhalt auf eine Lesereihenfolge ab
(§14.7) und Tabellenstrukturelemente beschreiben Zeilen und Zellen (§14.8).
Die eigentliche Rasterisierung und Injektion unsichtbaren Texts werden an
einen separaten Sidecar-Prozess delegiert; die PHP-Oberfläche orchestriert und
gibt Ergebnismetadaten zurück. Die Overlay-Ausgabe ist ein abgeleitetes
Dokument — jede vorhandene Signatur wird ungültig und die Compliance muss
erneut validiert werden. Die Konfidenz ist Passthrough oder ein fester
Standardwert; die Oberfläche sichert keine OCR-Genauigkeit und keinen
Extraktions-Recall zu.
Öffentliche API-Oberfläche
Abschnitt betitelt „Öffentliche API-Oberfläche“NextPDF\Enterprise\Intelligence\StructuredExtractor,
NextPDF\Enterprise\Intelligence\ExtractionSchema,
NextPDF\Enterprise\Intelligence\SchemaField,
NextPDF\Enterprise\Intelligence\KeyValuePair,
NextPDF\Enterprise\Intelligence\TableExtractor,
NextPDF\Enterprise\Intelligence\TableResult,
NextPDF\Enterprise\Intelligence\TableCell,
NextPDF\Enterprise\Intelligence\SearchableOverlay,
NextPDF\Enterprise\Intelligence\OverlayConfig,
NextPDF\Enterprise\Intelligence\SearchableOverlayResult,
NextPDF\Enterprise\Intelligence\PageOverlayInfo,
NextPDF\Enterprise\Intelligence\ExtractionConfig sowie die
ExtractionStrategy / OverlayQuality-Enums. Das OCR-Backend ist ein
injizierter Vertrag, der vom Deployment bereitgestellt wird. Die Signaturen
sind auf der öffentlichen Seite aufgeführt.
Konformität
Abschnitt betitelt „Konformität“Der Overlay-Mechanismus bildet sich auf ISO 32000-2:2020 §9.3.3 (Textrendering-Modus) ab und, für getaggte Quellen, auf §14.7–§14.8 (Strukturbaum und Tabellenelemente). Die Strukturierungsschritte verbrauchen bereits extrahierte Daten; die Qualität ist durch den vorgelagerten Extraktor und das OCR-Backend begrenzt.
Randfälle & Verhalten im FIPS-Modus
Abschnitt betitelt „Randfälle & Verhalten im FIPS-Modus“- Synthetisierte Tabellen-Bounding-Boxes sind eine gleichmäßige Gitterunterteilung, kein gemessenes Layout.
- Ist das OCR-Backend nicht verfügbar, tragen betroffene Seiten null Wörter bei, statt dass der gesamte Lauf stillschweigend scheitert; prüfen Sie das Ergebnis pro Seite.
- Die Overlay-Ausgabe ist ein abgeleitetes Dokument; validieren Sie Signaturen und Compliance-Status erneut.
- In diesem Modul findet keine kryptografische Operation statt, daher gibt es kein FIPS-Modus-spezifisches Verhalten.
Veröffentlichungsgrenze
Abschnitt betitelt „Veröffentlichungsgrenze“Diese Seite dokumentiert ausschließlich extern beobachtbares Verhalten und die unterstützte öffentliche API-Oberfläche. Interne Namespace-Pfade, Hilfsklassen, Mechanismustabellen, Runbook-Dateinamen und Ticket-Präfixe liegen außerhalb des Umfangs.
Core-Fallback
Abschnitt betitelt „Core-Fallback“NextPDF Core (Apache-2.0) hat keine Orchestrierung durchsuchbarer Overlays und keine schema-validierte Strukturierungsoberfläche — keine; diese Fähigkeit hat kein Core-Tier-Äquivalent.
Pro-Fallback
Abschnitt betitelt „Pro-Fallback“NextPDF Pro liefert strukturelle AST-gesteuerte Extraktion über ein bereits geparstes Dokument; es bietet keine schema-validierte Schlüssel-Wert-Strukturierung, keine Tabellenrekonstruktion aus rohen Gittern und keine OCR-gestützte Orchestrierung durchsuchbarer Overlays. Diese werden ausschließlich im Paket nextpdf/enterprise ausgeliefert.
Hinweis zur Enterprise-Grenze
Abschnitt betitelt „Hinweis zur Enterprise-Grenze“Die Schlüssel-Wert-Typisierung, die Schema-Validierung, die Synthese von Tabellengittern und die Overlay-Orchestrierung werden auf Verhaltensebene beschrieben. Die eigentliche Rasterisierung und Injektion unsichtbaren Texts laufen in einem separaten Sidecar-Prozess; die Sidecar-Interna, das OCR-Modell und etwaige interne Orchestrierungsdetails liegen außerhalb des Umfangs und werden hier nicht wiedergegeben. Das OCR-Backend ist ein injizierter Vertrag, der vom Deployment bereitgestellt wird.
Bereitstellungsgrenze
Abschnitt betitelt „Bereitstellungsgrenze“Das Deployment stellt das OCR-Backend bereit und betreibt es und wählt, wo OCR berechnet wird — und damit, wo Dokumentbilder und erkannter Text berechnet und gespeichert werden. Die Oberfläche begrenzt Eingabegröße und Seitenzahl und scheitert bei Überlauf fail-closed. NextPDF Enterprise orchestriert den Workflow und gibt Ergebnismetadaten zurück; es bettet kein OCR-Modell ein und garantiert keine Erkennungsgenauigkeit und keinen Extraktions-Recall.
Rechtliche Compliance-Grenze
Abschnitt betitelt „Rechtliche Compliance-Grenze“Für diese Oberfläche gilt keine exportkontrollrechtliche Beschränkung. Die Oberfläche sichert keine Garantie der OCR-Genauigkeit und des Extraktions-Recalls und keinen regulatorischen Compliance-Status zu. Diese Referenz ist kein Rechtsgutachten.