Ir al contenido
getnextpdf.com

Enterprise edición

Inteligencia — Referencia detallada

Esta referencia detallada documenta el tipado clave-valor y la validación de esquema, la síntesis de la cuadrícula de tablas y el límite de orquestación de la capa de texto buscable.

Esta capacidad se distribuye en NextPDF Enterprise (nextpdf/enterprise) y se activa con un sobre de licencia de nivel Enterprise. Un despliegue sin ese derecho no carga las clases de la capacidad. Comparar ediciones y obtener una licencia.

StructuredExtractor::extract tipa la entrada clave-valor en bruto. Cuando se suministra un esquema, solo se conservan los pares cuya clave coincide con un campo del esquema; los pares sin una confianza explícita reciben un valor predeterminado fijo. validateSchema devuelve los nombres de los campos obligatorios que no se encontraron (vacío significa conforme). Este paso tipa y valida datos ya extraídos; no reconoce texto y no asigna ninguna precisión calculada.

TableExtractor::extract construye tablas estructuradas a partir de cuadrículas de filas en bruto. El número de columnas es el de la fila más ancha; las filas cortas se rellenan con celdas vacías. Cada celda recibe una caja delimitadora sintetizada a partir de una subdivisión uniforme de un área de página normalizada y una confianza predeterminada fija. Una tabla sin filas o sin columnas se omite. Las cajas delimitadoras son una síntesis de cuadrícula, no un diseño medido.

SearchableOverlay::generate valida la cabecera del PDF, acota el tamaño de entrada y el número de páginas (cerrando de forma segura ante el desbordamiento), detecta las páginas que carecen de una capa de texto utilizable, impulsa el backend de OCR configurado y devuelve los recuentos de palabras por página y una confianza media. Una página con una capa de texto nativa utilizable se omite de forma predeterminada. El texto de OCR invisible depende de un modo de renderizado de texto que ni rellena ni traza los glifos (ISO 32000-2:2020 §9.3.3); cuando el origen está etiquetado, el árbol de estructura asigna el contenido a un orden de lectura (§14.7) y los elementos de estructura de tabla describen filas y celdas (§14.8). La rasterización real y la inyección de texto invisible se delegan en un proceso sidecar independiente; la superficie PHP orquesta y devuelve metadatos del resultado. La salida de la capa superpuesta es un documento derivado: cualquier firma existente queda invalidada y la conformidad debe revalidarse. La confianza es de paso o un valor predeterminado fijo; la superficie no afirma ninguna precisión de OCR ni exhaustividad de extracción.

NextPDF\Enterprise\Intelligence\StructuredExtractor, NextPDF\Enterprise\Intelligence\ExtractionSchema, NextPDF\Enterprise\Intelligence\SchemaField, NextPDF\Enterprise\Intelligence\KeyValuePair, NextPDF\Enterprise\Intelligence\TableExtractor, NextPDF\Enterprise\Intelligence\TableResult, NextPDF\Enterprise\Intelligence\TableCell, NextPDF\Enterprise\Intelligence\SearchableOverlay, NextPDF\Enterprise\Intelligence\OverlayConfig, NextPDF\Enterprise\Intelligence\SearchableOverlayResult, NextPDF\Enterprise\Intelligence\PageOverlayInfo, NextPDF\Enterprise\Intelligence\ExtractionConfig, y los enums ExtractionStrategy / OverlayQuality. El backend de OCR es un contrato inyectado suministrado por el despliegue. Las firmas se enumeran en la página pública.

El mecanismo de la capa superpuesta se corresponde con ISO 32000-2:2020 §9.3.3 (modo de renderizado de texto) y, para los orígenes etiquetados, con §14.7–§14.8 (árbol de estructura y elementos de tabla). Los pasos de estructuración consumen datos ya extraídos; la calidad está acotada por el extractor anterior y el backend de OCR.

  • Las cajas delimitadoras de tabla sintetizadas son una subdivisión de cuadrícula uniforme, no un diseño medido.
  • Cuando el backend de OCR no está disponible, las páginas afectadas aportan cero palabras en lugar de hacer fallar toda la ejecución de forma silenciosa; comprueba el resultado por página.
  • La salida de la capa superpuesta es un documento derivado; revalida las firmas y el estado de conformidad.
  • No se produce ninguna operación criptográfica en este módulo, por lo que no hay comportamiento específico del modo FIPS.

Esta página documenta únicamente el comportamiento observable desde el exterior y la superficie de API pública compatible. Las rutas de espacio de nombres internas, las clases auxiliares, las tablas de mecanismos, los nombres de archivo de runbook y los prefijos de tickets quedan fuera del alcance.

NextPDF Core (Apache-2.0) no tiene orquestación de capa de texto buscable ni superficie de estructuración validada por esquema: ninguna; esta capacidad no tiene equivalente en el nivel Core.

NextPDF Pro incorpora extracción estructural basada en AST sobre un documento ya analizado; no proporciona estructuración clave-valor validada por esquema, reconstrucción de tablas a partir de cuadrículas en bruto ni orquestación de capa de texto buscable respaldada por OCR. Estas se distribuyen únicamente en el paquete nextpdf/enterprise.

El tipado clave-valor, la validación de esquema, la síntesis de la cuadrícula de tablas y la orquestación de la capa superpuesta se describen a nivel de comportamiento. La rasterización real y la inyección de texto invisible se ejecutan en un proceso sidecar independiente; los elementos internos del sidecar, el modelo de OCR y cualquier detalle interno de orquestación quedan fuera del alcance y no se reproducen aquí. El backend de OCR es un contrato inyectado suministrado por el despliegue.

El despliegue suministra y opera el backend de OCR y elige dónde se calcula el OCR —y, por tanto, dónde se calculan y almacenan las imágenes del documento y el texto reconocido—. La superficie acota el tamaño de entrada y el número de páginas y se cierra de forma segura ante el desbordamiento. NextPDF Enterprise orquesta el flujo de trabajo y devuelve metadatos del resultado; no incrusta un modelo de OCR ni garantiza la precisión del reconocimiento ni la exhaustividad de la extracción.

Ninguna restricción de control de exportación aplica a esta superficie. La superficie no afirma ninguna garantía de precisión de OCR ni de exhaustividad de extracción, ni ningún estado de cumplimiento regulatorio. Esta referencia no constituye una opinión jurídica.