Ga naar inhoud
getnextpdf.com

Enterprise editie

Intelligence — Diepe referentie

Deze diepe referentie documenteert sleutel-waardetypering en schemavalidatie, synthese van tabelrasters en de orchestratiegrens voor doorzoekbare overlays.

Deze capaciteit wordt geleverd in NextPDF Enterprise (nextpdf/enterprise) en wordt geactiveerd met een licentie-envelop op Enterprise-niveau. Een implementatie zonder die entitlement laadt de klassen van de capaciteit niet. Vergelijk edities en vraag een licentie aan.

StructuredExtractor::extract typeert ruwe sleutel-waarde-invoer. Wanneer een schema wordt aangeleverd, worden alleen paren behouden waarvan de sleutel overeenkomt met een schemaveld; paren zonder een expliciete betrouwbaarheid krijgen een vaste standaardwaarde. validateSchema retourneert de namen van de vereiste velden die niet zijn gevonden (leeg betekent conform). Deze stap typeert en valideert reeds geëxtraheerde gegevens; deze herkent geen tekst en kent geen berekende precisie toe.

TableExtractor::extract bouwt gestructureerde tabellen uit ruwe rij-rasters. Het kolomaantal is de breedste rij; korte rijen worden opgevuld met lege cellen. Elke cel krijgt een gesynthetiseerde bounding box uit een uniforme onderverdeling van een genormaliseerd paginagebied en een vaste standaardbetrouwbaarheid. Een tabel zonder rijen of zonder kolommen wordt overgeslagen. De bounding boxes zijn een rastersynthese, geen gemeten lay-out.

SearchableOverlay::generate valideert de PDF-header, begrenst de invoergrootte en het paginaaantal (faalt gesloten bij overflow), detecteert pagina’s zonder een bruikbare tekstlaag, stuurt de geconfigureerde OCR-backend aan en retourneert woordtellingen per pagina en een gemiddelde betrouwbaarheid. Een pagina met een bruikbare native tekstlaag wordt standaard overgeslagen. Onzichtbare OCR-tekst steunt op een text rendering mode die de glyphs niet vult en niet stroked (ISO 32000-2:2020 §9.3.3); wanneer de bron getagd is, mapt de structure tree inhoud naar een leesvolgorde (§14.7) en beschrijven table-structure-elementen rijen en cellen (§14.8). De daadwerkelijke rasterisatie en de injectie van onzichtbare tekst worden gedelegeerd aan een afzonderlijk sidecar-proces; het PHP-oppervlak orkestreert en retourneert resultaatmetadata. De overlay-uitvoer is een afgeleid document — een bestaande handtekening wordt ongeldig gemaakt en de conformiteit moet opnieuw worden gevalideerd. De betrouwbaarheid is een passthrough of een vaste standaardwaarde; het oppervlak beweert geen OCR-nauwkeurigheid of extractierecall.

NextPDF\Enterprise\Intelligence\StructuredExtractor, NextPDF\Enterprise\Intelligence\ExtractionSchema, NextPDF\Enterprise\Intelligence\SchemaField, NextPDF\Enterprise\Intelligence\KeyValuePair, NextPDF\Enterprise\Intelligence\TableExtractor, NextPDF\Enterprise\Intelligence\TableResult, NextPDF\Enterprise\Intelligence\TableCell, NextPDF\Enterprise\Intelligence\SearchableOverlay, NextPDF\Enterprise\Intelligence\OverlayConfig, NextPDF\Enterprise\Intelligence\SearchableOverlayResult, NextPDF\Enterprise\Intelligence\PageOverlayInfo, NextPDF\Enterprise\Intelligence\ExtractionConfig en de ExtractionStrategy / OverlayQuality-enums. De OCR-backend is een geïnjecteerd contract dat door de implementatie wordt aangeleverd. De signatures staan op de publieke pagina.

Het overlaymechanisme mapt naar ISO 32000-2:2020 §9.3.3 (text rendering mode) en, voor getagde bronnen, §14.7–§14.8 (structure tree en table-elementen). De structureringsstappen consumeren reeds geëxtraheerde gegevens; de kwaliteit wordt begrensd door de upstream-extractor en de OCR-backend.

  • Gesynthetiseerde bounding boxes voor tabellen zijn een uniforme rasteronderverdeling, geen gemeten lay-out.
  • Wanneer de OCR-backend niet beschikbaar is, dragen de betreffende pagina’s nul woorden bij in plaats van de hele run stilzwijgend te laten falen; controleer het resultaat per pagina.
  • De overlay-uitvoer is een afgeleid document; valideer handtekeningen en de conformiteitsstatus opnieuw.
  • In deze module vindt geen cryptografische bewerking plaats, dus er is geen FIPS-modusspecifiek gedrag.

Deze pagina documenteert alleen extern waarneembaar gedrag en het ondersteunde publieke API-oppervlak. Interne namespace-paden, helperklassen, mechanismetabellen, runbook-bestandsnamen en ticketprefixen vallen buiten de scope.

NextPDF Core (Apache-2.0) heeft geen orchestratie voor doorzoekbare overlays en geen schemagevalideerd structureringsoppervlak — geen; deze capaciteit heeft geen equivalent op Core-niveau.

NextPDF Pro levert structurele AST-gestuurde extractie over een reeds geparseerd document; het biedt geen schemagevalideerde sleutel-waardestructurering, geen tabelreconstructie uit ruwe rasters en geen OCR-ondersteunde orchestratie van doorzoekbare overlays. Die worden alleen meegeleverd in het nextpdf/enterprise-pakket.

Sleutel-waardetypering, schemavalidatie, synthese van tabelrasters en overlay-orchestratie worden op gedragsniveau beschreven. De daadwerkelijke rasterisatie en de injectie van onzichtbare tekst draaien in een afzonderlijk sidecar-proces; de sidecar-internals, het OCR-model en eventuele interne orchestratiedetails vallen buiten de scope en worden hier niet gereproduceerd. De OCR-backend is een geïnjecteerd contract dat door de implementatie wordt aangeleverd.

De implementatie levert en beheert de OCR-backend en kiest waar OCR wordt berekend — en daarmee waar documentafbeeldingen en herkende tekst worden berekend en opgeslagen. Het oppervlak begrenst de invoergrootte en het paginaaantal en faalt gesloten bij overflow. NextPDF Enterprise orkestreert de workflow en retourneert resultaatmetadata; het bedt geen OCR-model in en garandeert geen herkenningsnauwkeurigheid of extractierecall.

Op dit oppervlak is geen exportcontrolerestrictie van toepassing. Het oppervlak beweert geen garantie op OCR-nauwkeurigheid of extractierecall en geen regelgevende-compliancestatus. Deze referentie is geen juridisch advies.