Enterprise edizione
Intelligence — Riferimento approfondito
In sintesi
Sezione intitolata “In sintesi”Questo riferimento approfondito documenta la tipizzazione chiave-valore e la convalida dello schema, la sintesi della griglia di tabella e il confine di orchestrazione dell’overlay ricercabile.
Disponibilità e licenza
Sezione intitolata “Disponibilità e licenza”Questa funzionalità è distribuita in NextPDF Enterprise (nextpdf/enterprise) e si attiva con un envelope di licenza di tier Enterprise. Una distribuzione priva di tale entitlement non carica le classi della funzionalità. Confronta le edizioni e ottieni una licenza.
Contratto di comportamento
Sezione intitolata “Contratto di comportamento”StructuredExtractor::extract tipizza l’input chiave-valore grezzo. Quando viene
fornito uno schema, vengono mantenute solo le coppie la cui chiave corrisponde a un campo
dello schema; le coppie prive di una confidenza esplicita ricevono un valore predefinito fisso. validateSchema restituisce
i nomi dei campi obbligatori che non sono stati trovati (vuoto significa conforme). Questo
passo tipizza e convalida dati già estratti; non riconosce testo
e non assegna alcuna precisione calcolata.
TableExtractor::extract costruisce tabelle strutturate a partire da griglie di righe grezze. Il
conteggio delle colonne è dato dalla riga più larga; le righe corte vengono riempite con celle vuote. Ogni
cella riceve un bounding box sintetizzato da una suddivisione uniforme di un’area di pagina
normalizzata e una confidenza predefinita fissa. Una tabella senza righe o
senza colonne viene saltata. I bounding box sono una sintesi di griglia, non un
layout misurato.
SearchableOverlay::generate convalida l’header del PDF, delimita la dimensione di input
e il numero di pagine (fallendo in modo chiuso in caso di overflow), rileva le pagine prive di un
layer di testo utilizzabile, guida il backend OCR configurato e restituisce i conteggi di parole
per ciascuna pagina e una confidenza media. Una pagina con un layer di testo nativo utilizzabile viene
saltata per impostazione predefinita. Il testo OCR invisibile si basa su una modalità di rendering del testo che
non riempie né traccia i glifi (ISO 32000-2:2020 §9.3.3); quando la
sorgente è tagged, lo structure tree mappa il contenuto a un ordine di lettura (§14.7)
e gli elementi di struttura della tabella descrivono righe e celle (§14.8). La
rasterizzazione effettiva e l’iniezione del testo invisibile sono delegate a un processo
sidecar separato; la superficie PHP orchestra e restituisce i metadati di risultato.
L’output dell’overlay è un documento derivato — qualsiasi firma esistente viene
invalidata e la conformità deve essere riconvalidata. La confidenza è passthrough oppure
un valore predefinito fisso; la superficie non asserisce alcuna accuratezza OCR né alcun recall di estrazione.
Superficie API pubblica
Sezione intitolata “Superficie API pubblica”NextPDF\Enterprise\Intelligence\StructuredExtractor,
NextPDF\Enterprise\Intelligence\ExtractionSchema,
NextPDF\Enterprise\Intelligence\SchemaField,
NextPDF\Enterprise\Intelligence\KeyValuePair,
NextPDF\Enterprise\Intelligence\TableExtractor,
NextPDF\Enterprise\Intelligence\TableResult,
NextPDF\Enterprise\Intelligence\TableCell,
NextPDF\Enterprise\Intelligence\SearchableOverlay,
NextPDF\Enterprise\Intelligence\OverlayConfig,
NextPDF\Enterprise\Intelligence\SearchableOverlayResult,
NextPDF\Enterprise\Intelligence\PageOverlayInfo,
NextPDF\Enterprise\Intelligence\ExtractionConfig, e gli enum
ExtractionStrategy / OverlayQuality. Il backend OCR è un contratto iniettato
fornito dalla distribuzione. Le firme sono elencate sulla pagina pubblica.
Conformità
Sezione intitolata “Conformità”Il meccanismo di overlay mappa a ISO 32000-2:2020 §9.3.3 (modalità di rendering del testo) e, per le sorgenti tagged, a §14.7–§14.8 (structure tree ed elementi di tabella). I passi di strutturazione consumano dati già estratti; la qualità è limitata dall’estrattore a monte e dal backend OCR.
Casi limite e comportamento in modalità FIPS
Sezione intitolata “Casi limite e comportamento in modalità FIPS”- I bounding box di tabella sintetizzati sono una suddivisione a griglia uniforme, non un layout misurato.
- Quando il backend OCR non è disponibile, le pagine interessate contribuiscono con zero parole anziché far fallire silenziosamente l’intera esecuzione; controllare il risultato per ciascuna pagina.
- L’output dell’overlay è un documento derivato; riconvalidare le firme e lo stato di conformità.
- In questo modulo non avviene alcuna operazione crittografica, quindi non esiste alcun comportamento specifico della modalità FIPS.
Confine di pubblicazione
Sezione intitolata “Confine di pubblicazione”Questa pagina documenta esclusivamente il comportamento osservabile dall’esterno e la superficie API pubblica supportata. I percorsi di namespace interni, le classi helper, le tabelle dei meccanismi, i nomi dei file di runbook e i prefissi di ticket sono fuori ambito.
Fallback di Core
Sezione intitolata “Fallback di Core”NextPDF Core (Apache-2.0) non dispone di alcuna orchestrazione di overlay ricercabile e di alcuna superficie di strutturazione convalidata da schema — nessuna; questa funzionalità non ha alcun equivalente di tier Core.
Fallback di Pro
Sezione intitolata “Fallback di Pro”NextPDF Pro include l’estrazione strutturale guidata da AST su un documento già analizzato; non fornisce la strutturazione chiave-valore convalidata da schema, la ricostruzione di tabelle da griglie grezze, né l’orchestrazione di overlay ricercabile supportata da OCR. Queste sono incluse esclusivamente nel pacchetto nextpdf/enterprise.
Nota sul confine Enterprise
Sezione intitolata “Nota sul confine Enterprise”La tipizzazione chiave-valore, la convalida dello schema, la sintesi della griglia di tabella e l’orchestrazione dell’overlay sono descritte a livello di comportamento. La rasterizzazione effettiva e l’iniezione del testo invisibile vengono eseguite in un processo sidecar separato; i dettagli interni del sidecar, il modello OCR e qualsiasi dettaglio interno di orchestrazione sono fuori ambito e non sono qui riprodotti. Il backend OCR è un contratto iniettato fornito dalla distribuzione.
Confine di distribuzione
Sezione intitolata “Confine di distribuzione”La distribuzione fornisce e gestisce il backend OCR e sceglie dove l’OCR viene calcolato — e quindi dove le immagini dei documenti e il testo riconosciuto vengono calcolati e memorizzati. La superficie delimita la dimensione di input e il numero di pagine e fallisce in modo chiuso in caso di overflow. NextPDF Enterprise orchestra il flusso di lavoro e restituisce i metadati di risultato; non incorpora un modello OCR e non garantisce alcuna accuratezza di riconoscimento né alcun recall di estrazione.
Confine di conformità legale
Sezione intitolata “Confine di conformità legale”Non si applica alcuna restrizione di controllo delle esportazioni a questa superficie. La superficie non asserisce alcuna garanzia di accuratezza OCR o di recall di estrazione e alcuno stato di conformità normativa. Questo riferimento non è un parere legale.