Enterprise édition
Intelligence — référence approfondie
Cette référence approfondie documente le typage clé-valeur et la validation de schéma, la synthèse de grille de tableau, et la frontière d’orchestration de la surcouche cherchable.
Disponibilité et licence
Section intitulée « Disponibilité et licence »Cette capacité est livrée dans NextPDF Enterprise (nextpdf/enterprise) et s’active avec une enveloppe de licence de palier Enterprise. Un déploiement dépourvu de ce droit ne charge pas les classes de la capacité. Compare les éditions et obtiens une licence.
Contrat de comportement
Section intitulée « Contrat de comportement »StructuredExtractor::extract type l’entrée clé-valeur brute. Lorsqu’un schéma est
fourni, seules les paires dont la clé correspond à un champ du schéma sont
conservées ; les paires sans confiance explicite reçoivent une valeur par défaut
fixe. validateSchema renvoie les noms des champs requis qui n’ont pas été trouvés
(une réponse vide signifie conforme). Cette étape type et valide des données déjà
extraites ; elle ne reconnaît aucun texte et n’attribue aucune précision calculée.
TableExtractor::extract construit des tableaux structurés à partir de grilles de
lignes brutes. Le nombre de colonnes correspond à la ligne la plus large ; les
lignes courtes sont complétées par des cellules vides. Chaque cellule reçoit une
boîte englobante synthétisée par une subdivision uniforme d’une aire de page
normalisée et une confiance par défaut fixe. Un tableau sans ligne ou sans colonne
est ignoré. Les boîtes englobantes sont une synthèse de grille, pas une mise en page
mesurée.
SearchableOverlay::generate valide l’en-tête du PDF, borne la taille d’entrée et le
nombre de pages (en échouant par sécurité en cas de dépassement), détecte les pages
dépourvues de couche de texte utilisable, pilote le backend OCR configuré, et
renvoie un décompte de mots par page et une confiance moyenne. Une page disposant
d’une couche de texte native utilisable est ignorée par défaut. Le texte OCR
invisible repose sur un mode de rendu de texte qui ne remplit ni ne trace les
glyphes (ISO 32000-2:2020 §9.3.3) ; lorsque la source est balisée, l’arbre de
structure mappe le contenu vers un ordre de lecture (§14.7) et les éléments de
structure de tableau décrivent les lignes et les cellules (§14.8). La rastérisation
proprement dite et l’injection de texte invisible sont déléguées à un processus
sidecar distinct ; la surface PHP orchestre et renvoie les métadonnées de résultat.
La sortie de la surcouche est un document dérivé — toute signature existante est
invalidée et la conformité doit être revalidée. La confiance est transmise telle
quelle ou fixée à une valeur par défaut ; la surface n’affirme aucune exactitude OCR
ni aucun rappel d’extraction.
Surface de l’API publique
Section intitulée « Surface de l’API publique »NextPDF\Enterprise\Intelligence\StructuredExtractor,
NextPDF\Enterprise\Intelligence\ExtractionSchema,
NextPDF\Enterprise\Intelligence\SchemaField,
NextPDF\Enterprise\Intelligence\KeyValuePair,
NextPDF\Enterprise\Intelligence\TableExtractor,
NextPDF\Enterprise\Intelligence\TableResult,
NextPDF\Enterprise\Intelligence\TableCell,
NextPDF\Enterprise\Intelligence\SearchableOverlay,
NextPDF\Enterprise\Intelligence\OverlayConfig,
NextPDF\Enterprise\Intelligence\SearchableOverlayResult,
NextPDF\Enterprise\Intelligence\PageOverlayInfo,
NextPDF\Enterprise\Intelligence\ExtractionConfig, et les énumérations
ExtractionStrategy / OverlayQuality. Le backend OCR est un contrat injecté
fourni par le déploiement. Les signatures sont listées sur la page publique.
Conformité
Section intitulée « Conformité »Le mécanisme de surcouche correspond à ISO 32000-2:2020 §9.3.3 (mode de rendu de texte) et, pour les sources balisées, §14.7–§14.8 (arbre de structure et éléments de tableau). Les étapes de structuration consomment des données déjà extraites ; la qualité est bornée par l’extracteur en amont et le backend OCR.
Cas limites et comportement en mode FIPS
Section intitulée « Cas limites et comportement en mode FIPS »- Les boîtes englobantes de tableau synthétisées sont une subdivision de grille uniforme, pas une mise en page mesurée.
- Lorsque le backend OCR est indisponible, les pages concernées contribuent zéro mot plutôt que de faire échouer silencieusement l’ensemble de l’exécution ; vérifie le résultat par page.
- La sortie de la surcouche est un document dérivé ; revalide les signatures et l’état de conformité.
- Aucune opération cryptographique ne se produit dans ce module, il n’y a donc aucun comportement spécifique au mode FIPS.
Frontière de publication
Section intitulée « Frontière de publication »Cette page documente uniquement le comportement observable de l’extérieur et la surface d’API publique prise en charge. Les chemins d’espace de noms internes, les classes utilitaires, les tables de mécanismes, les noms de fichiers de runbook et les préfixes de ticket sont hors périmètre.
Repli Core
Section intitulée « Repli Core »NextPDF Core (Apache-2.0) n’a aucune orchestration de surcouche cherchable ni aucune surface de structuration validée par schéma — aucune ; cette capacité n’a aucun équivalent au palier Core.
Repli Pro
Section intitulée « Repli Pro »NextPDF Pro propose une extraction structurelle pilotée par AST sur un document déjà analysé ; il ne fournit ni structuration clé-valeur validée par schéma, ni reconstruction de tableau à partir de grilles brutes, ni orchestration de surcouche cherchable adossée à l’OCR. Ces capacités sont livrées uniquement dans le paquet nextpdf/enterprise.
Note sur la frontière Enterprise
Section intitulée « Note sur la frontière Enterprise »Le typage clé-valeur, la validation de schéma, la synthèse de grille de tableau et l’orchestration de surcouche sont décrits au niveau du comportement. La rastérisation proprement dite et l’injection de texte invisible s’exécutent dans un processus sidecar distinct ; les éléments internes du sidecar, le modèle OCR et tout détail d’orchestration interne sont hors périmètre et ne sont pas reproduits ici. Le backend OCR est un contrat injecté fourni par le déploiement.
Frontière de déploiement
Section intitulée « Frontière de déploiement »Le déploiement fournit et opère le backend OCR et choisit où l’OCR est calculé — et donc où les images de document et le texte reconnu sont calculés et stockés. La surface borne la taille d’entrée et le nombre de pages et échoue par sécurité en cas de dépassement. NextPDF Enterprise orchestre le flux et renvoie les métadonnées de résultat ; il n’intègre aucun modèle OCR et ne garantit aucune exactitude de reconnaissance ni aucun rappel d’extraction.
Frontière juridique et de conformité
Section intitulée « Frontière juridique et de conformité »Aucune restriction de contrôle des exportations ne s’applique à cette surface. La surface n’affirme aucune garantie d’exactitude OCR ou de rappel d’extraction ni aucun état de conformité réglementaire. Cette référence n’est pas un avis juridique.