Aller au contenu
getnextpdf.com

Enterprise édition

Intelligence — référence approfondie

Cette référence approfondie documente le typage clé-valeur et la validation de schéma, la synthèse de grille de tableau, et la frontière d’orchestration de la surcouche cherchable.

Cette capacité est livrée dans NextPDF Enterprise (nextpdf/enterprise) et s’active avec une enveloppe de licence de palier Enterprise. Un déploiement dépourvu de ce droit ne charge pas les classes de la capacité. Compare les éditions et obtiens une licence.

StructuredExtractor::extract type l’entrée clé-valeur brute. Lorsqu’un schéma est fourni, seules les paires dont la clé correspond à un champ du schéma sont conservées ; les paires sans confiance explicite reçoivent une valeur par défaut fixe. validateSchema renvoie les noms des champs requis qui n’ont pas été trouvés (une réponse vide signifie conforme). Cette étape type et valide des données déjà extraites ; elle ne reconnaît aucun texte et n’attribue aucune précision calculée.

TableExtractor::extract construit des tableaux structurés à partir de grilles de lignes brutes. Le nombre de colonnes correspond à la ligne la plus large ; les lignes courtes sont complétées par des cellules vides. Chaque cellule reçoit une boîte englobante synthétisée par une subdivision uniforme d’une aire de page normalisée et une confiance par défaut fixe. Un tableau sans ligne ou sans colonne est ignoré. Les boîtes englobantes sont une synthèse de grille, pas une mise en page mesurée.

SearchableOverlay::generate valide l’en-tête du PDF, borne la taille d’entrée et le nombre de pages (en échouant par sécurité en cas de dépassement), détecte les pages dépourvues de couche de texte utilisable, pilote le backend OCR configuré, et renvoie un décompte de mots par page et une confiance moyenne. Une page disposant d’une couche de texte native utilisable est ignorée par défaut. Le texte OCR invisible repose sur un mode de rendu de texte qui ne remplit ni ne trace les glyphes (ISO 32000-2:2020 §9.3.3) ; lorsque la source est balisée, l’arbre de structure mappe le contenu vers un ordre de lecture (§14.7) et les éléments de structure de tableau décrivent les lignes et les cellules (§14.8). La rastérisation proprement dite et l’injection de texte invisible sont déléguées à un processus sidecar distinct ; la surface PHP orchestre et renvoie les métadonnées de résultat. La sortie de la surcouche est un document dérivé — toute signature existante est invalidée et la conformité doit être revalidée. La confiance est transmise telle quelle ou fixée à une valeur par défaut ; la surface n’affirme aucune exactitude OCR ni aucun rappel d’extraction.

NextPDF\Enterprise\Intelligence\StructuredExtractor, NextPDF\Enterprise\Intelligence\ExtractionSchema, NextPDF\Enterprise\Intelligence\SchemaField, NextPDF\Enterprise\Intelligence\KeyValuePair, NextPDF\Enterprise\Intelligence\TableExtractor, NextPDF\Enterprise\Intelligence\TableResult, NextPDF\Enterprise\Intelligence\TableCell, NextPDF\Enterprise\Intelligence\SearchableOverlay, NextPDF\Enterprise\Intelligence\OverlayConfig, NextPDF\Enterprise\Intelligence\SearchableOverlayResult, NextPDF\Enterprise\Intelligence\PageOverlayInfo, NextPDF\Enterprise\Intelligence\ExtractionConfig, et les énumérations ExtractionStrategy / OverlayQuality. Le backend OCR est un contrat injecté fourni par le déploiement. Les signatures sont listées sur la page publique.

Le mécanisme de surcouche correspond à ISO 32000-2:2020 §9.3.3 (mode de rendu de texte) et, pour les sources balisées, §14.7–§14.8 (arbre de structure et éléments de tableau). Les étapes de structuration consomment des données déjà extraites ; la qualité est bornée par l’extracteur en amont et le backend OCR.

  • Les boîtes englobantes de tableau synthétisées sont une subdivision de grille uniforme, pas une mise en page mesurée.
  • Lorsque le backend OCR est indisponible, les pages concernées contribuent zéro mot plutôt que de faire échouer silencieusement l’ensemble de l’exécution ; vérifie le résultat par page.
  • La sortie de la surcouche est un document dérivé ; revalide les signatures et l’état de conformité.
  • Aucune opération cryptographique ne se produit dans ce module, il n’y a donc aucun comportement spécifique au mode FIPS.

Cette page documente uniquement le comportement observable de l’extérieur et la surface d’API publique prise en charge. Les chemins d’espace de noms internes, les classes utilitaires, les tables de mécanismes, les noms de fichiers de runbook et les préfixes de ticket sont hors périmètre.

NextPDF Core (Apache-2.0) n’a aucune orchestration de surcouche cherchable ni aucune surface de structuration validée par schéma — aucune ; cette capacité n’a aucun équivalent au palier Core.

NextPDF Pro propose une extraction structurelle pilotée par AST sur un document déjà analysé ; il ne fournit ni structuration clé-valeur validée par schéma, ni reconstruction de tableau à partir de grilles brutes, ni orchestration de surcouche cherchable adossée à l’OCR. Ces capacités sont livrées uniquement dans le paquet nextpdf/enterprise.

Le typage clé-valeur, la validation de schéma, la synthèse de grille de tableau et l’orchestration de surcouche sont décrits au niveau du comportement. La rastérisation proprement dite et l’injection de texte invisible s’exécutent dans un processus sidecar distinct ; les éléments internes du sidecar, le modèle OCR et tout détail d’orchestration interne sont hors périmètre et ne sont pas reproduits ici. Le backend OCR est un contrat injecté fourni par le déploiement.

Le déploiement fournit et opère le backend OCR et choisit où l’OCR est calculé — et donc où les images de document et le texte reconnu sont calculés et stockés. La surface borne la taille d’entrée et le nombre de pages et échoue par sécurité en cas de dépassement. NextPDF Enterprise orchestre le flux et renvoie les métadonnées de résultat ; il n’intègre aucun modèle OCR et ne garantit aucune exactitude de reconnaissance ni aucun rappel d’extraction.

Aucune restriction de contrôle des exportations ne s’applique à cette surface. La surface n’affirme aucune garantie d’exactitude OCR ou de rappel d’extraction ni aucun état de conformité réglementaire. Cette référence n’est pas un avis juridique.