Enterprise edición
Inteligencia — Referencia detallada
De un vistazo
Sección titulada «De un vistazo»Esta referencia detallada documenta el tipado clave-valor y la validación de esquema, la síntesis de la cuadrícula de tablas y el límite de orquestación de la capa de texto buscable.
Disponibilidad y licencias
Sección titulada «Disponibilidad y licencias»Esta capacidad se distribuye en NextPDF Enterprise (nextpdf/enterprise) y se activa con un sobre de licencia de nivel Enterprise. Un despliegue sin ese derecho no carga las clases de la capacidad. Comparar ediciones y obtener una licencia.
Contrato de comportamiento
Sección titulada «Contrato de comportamiento»StructuredExtractor::extract tipa la entrada clave-valor en bruto. Cuando se
suministra un esquema, solo se conservan los pares cuya clave coincide con un
campo del esquema; los pares sin una confianza explícita reciben un valor
predeterminado fijo. validateSchema devuelve los nombres de los campos
obligatorios que no se encontraron (vacío significa conforme). Este paso tipa y
valida datos ya extraídos; no reconoce texto y no asigna ninguna precisión
calculada.
TableExtractor::extract construye tablas estructuradas a partir de cuadrículas
de filas en bruto. El número de columnas es el de la fila más ancha; las filas
cortas se rellenan con celdas vacías. Cada celda recibe una caja delimitadora
sintetizada a partir de una subdivisión uniforme de un área de página
normalizada y una confianza predeterminada fija. Una tabla sin filas o sin
columnas se omite. Las cajas delimitadoras son una síntesis de cuadrícula, no
un diseño medido.
SearchableOverlay::generate valida la cabecera del PDF, acota el tamaño de
entrada y el número de páginas (cerrando de forma segura ante el desbordamiento),
detecta las páginas que carecen de una capa de texto utilizable, impulsa el
backend de OCR configurado y devuelve los recuentos de palabras por página y una
confianza media. Una página con una capa de texto nativa utilizable se omite de
forma predeterminada. El texto de OCR invisible depende de un modo de
renderizado de texto que ni rellena ni traza los glifos (ISO 32000-2:2020
§9.3.3); cuando el origen está etiquetado, el árbol de estructura asigna el
contenido a un orden de lectura (§14.7) y los elementos de estructura de tabla
describen filas y celdas (§14.8). La rasterización real y la inyección de texto
invisible se delegan en un proceso sidecar independiente; la superficie PHP
orquesta y devuelve metadatos del resultado. La salida de la capa superpuesta es
un documento derivado: cualquier firma existente queda invalidada y la
conformidad debe revalidarse. La confianza es de paso o un valor predeterminado
fijo; la superficie no afirma ninguna precisión de OCR ni exhaustividad de
extracción.
Superficie de API pública
Sección titulada «Superficie de API pública»NextPDF\Enterprise\Intelligence\StructuredExtractor,
NextPDF\Enterprise\Intelligence\ExtractionSchema,
NextPDF\Enterprise\Intelligence\SchemaField,
NextPDF\Enterprise\Intelligence\KeyValuePair,
NextPDF\Enterprise\Intelligence\TableExtractor,
NextPDF\Enterprise\Intelligence\TableResult,
NextPDF\Enterprise\Intelligence\TableCell,
NextPDF\Enterprise\Intelligence\SearchableOverlay,
NextPDF\Enterprise\Intelligence\OverlayConfig,
NextPDF\Enterprise\Intelligence\SearchableOverlayResult,
NextPDF\Enterprise\Intelligence\PageOverlayInfo,
NextPDF\Enterprise\Intelligence\ExtractionConfig, y los enums
ExtractionStrategy / OverlayQuality. El backend de OCR es un contrato
inyectado suministrado por el despliegue. Las firmas se enumeran en la página
pública.
Conformidad
Sección titulada «Conformidad»El mecanismo de la capa superpuesta se corresponde con ISO 32000-2:2020 §9.3.3 (modo de renderizado de texto) y, para los orígenes etiquetados, con §14.7–§14.8 (árbol de estructura y elementos de tabla). Los pasos de estructuración consumen datos ya extraídos; la calidad está acotada por el extractor anterior y el backend de OCR.
Casos límite y comportamiento en modo FIPS
Sección titulada «Casos límite y comportamiento en modo FIPS»- Las cajas delimitadoras de tabla sintetizadas son una subdivisión de cuadrícula uniforme, no un diseño medido.
- Cuando el backend de OCR no está disponible, las páginas afectadas aportan cero palabras en lugar de hacer fallar toda la ejecución de forma silenciosa; comprueba el resultado por página.
- La salida de la capa superpuesta es un documento derivado; revalida las firmas y el estado de conformidad.
- No se produce ninguna operación criptográfica en este módulo, por lo que no hay comportamiento específico del modo FIPS.
Límite de publicación
Sección titulada «Límite de publicación»Esta página documenta únicamente el comportamiento observable desde el exterior y la superficie de API pública compatible. Las rutas de espacio de nombres internas, las clases auxiliares, las tablas de mecanismos, los nombres de archivo de runbook y los prefijos de tickets quedan fuera del alcance.
Alternativa en Core
Sección titulada «Alternativa en Core»NextPDF Core (Apache-2.0) no tiene orquestación de capa de texto buscable ni superficie de estructuración validada por esquema: ninguna; esta capacidad no tiene equivalente en el nivel Core.
Alternativa en Pro
Sección titulada «Alternativa en Pro»NextPDF Pro incorpora extracción estructural basada en AST sobre un documento ya analizado; no proporciona estructuración clave-valor validada por esquema, reconstrucción de tablas a partir de cuadrículas en bruto ni orquestación de capa de texto buscable respaldada por OCR. Estas se distribuyen únicamente en el paquete nextpdf/enterprise.
Nota sobre el límite de Enterprise
Sección titulada «Nota sobre el límite de Enterprise»El tipado clave-valor, la validación de esquema, la síntesis de la cuadrícula de tablas y la orquestación de la capa superpuesta se describen a nivel de comportamiento. La rasterización real y la inyección de texto invisible se ejecutan en un proceso sidecar independiente; los elementos internos del sidecar, el modelo de OCR y cualquier detalle interno de orquestación quedan fuera del alcance y no se reproducen aquí. El backend de OCR es un contrato inyectado suministrado por el despliegue.
Límite de despliegue
Sección titulada «Límite de despliegue»El despliegue suministra y opera el backend de OCR y elige dónde se calcula el OCR —y, por tanto, dónde se calculan y almacenan las imágenes del documento y el texto reconocido—. La superficie acota el tamaño de entrada y el número de páginas y se cierra de forma segura ante el desbordamiento. NextPDF Enterprise orquesta el flujo de trabajo y devuelve metadatos del resultado; no incrusta un modelo de OCR ni garantiza la precisión del reconocimiento ni la exhaustividad de la extracción.
Límite de cumplimiento legal
Sección titulada «Límite de cumplimiento legal»Ninguna restricción de control de exportación aplica a esta superficie. La superficie no afirma ninguna garantía de precisión de OCR ni de exhaustividad de extracción, ni ningún estado de cumplimiento regulatorio. Esta referencia no constituye una opinión jurídica.