Pular para o conteúdo
getnextpdf.com

Enterprise edição

Intelligence — Referência Profunda

Esta referência aprofundada documenta a tipagem de chave-valor e a validação de esquema, a síntese de grade de tabela e o limite de orquestração de sobreposição pesquisável.

Esta capacidade é distribuída no NextPDF Enterprise (nextpdf/enterprise) e ativa com um envelope de licença de nível Enterprise. Uma implantação sem esse direito não carrega as classes da capacidade. Compare edições e obtenha uma licença.

StructuredExtractor::extract tipa a entrada bruta de chave-valor. Quando um esquema é fornecido, apenas os pares cuja chave corresponde a um campo do esquema são mantidos; pares sem uma confiança explícita recebem um padrão fixo. validateSchema retorna os nomes de campos obrigatórios que não foram encontrados (vazio significa conforme). Esta etapa tipa e valida dados já extraídos; ela não reconhece texto e não atribui nenhuma precisão calculada.

TableExtractor::extract constrói tabelas estruturadas a partir de grades brutas de linhas. A contagem de colunas é a da linha mais larga; linhas curtas são preenchidas com células vazias. Cada célula recebe uma bounding box sintetizada a partir de uma subdivisão uniforme de uma área normalizada de página e uma confiança padrão fixa. Uma tabela sem linhas ou sem colunas é ignorada. As bounding boxes são uma síntese de grade, não um layout medido.

SearchableOverlay::generate valida o cabeçalho do PDF, delimita o tamanho da entrada e a contagem de páginas (falhando de forma segura em estouro), detecta páginas sem uma camada de texto utilizável, aciona o backend de OCR configurado e retorna a contagem de palavras por página e uma confiança média. Uma página com uma camada de texto nativa utilizável é ignorada por padrão. O texto OCR invisível depende de um modo de renderização de texto que não preenche nem traça os glifos (ISO 32000-2:2020 §9.3.3); quando a origem é marcada (tagged), a árvore de estrutura mapeia o conteúdo para uma ordem de leitura (§14.7) e os elementos de estrutura de tabela descrevem linhas e células (§14.8). A rasterização efetiva e a injeção de texto invisível são delegadas a um processo de sidecar separado; a superfície PHP orquestra e retorna metadados de resultado. A saída de sobreposição é um documento derivado — qualquer assinatura existente é invalidada e a conformidade deve ser revalidada. A confiança é passthrough ou um padrão fixo; a superfície não afirma nenhuma precisão de OCR nem recall de extração.

NextPDF\Enterprise\Intelligence\StructuredExtractor, NextPDF\Enterprise\Intelligence\ExtractionSchema, NextPDF\Enterprise\Intelligence\SchemaField, NextPDF\Enterprise\Intelligence\KeyValuePair, NextPDF\Enterprise\Intelligence\TableExtractor, NextPDF\Enterprise\Intelligence\TableResult, NextPDF\Enterprise\Intelligence\TableCell, NextPDF\Enterprise\Intelligence\SearchableOverlay, NextPDF\Enterprise\Intelligence\OverlayConfig, NextPDF\Enterprise\Intelligence\SearchableOverlayResult, NextPDF\Enterprise\Intelligence\PageOverlayInfo, NextPDF\Enterprise\Intelligence\ExtractionConfig e os enums ExtractionStrategy / OverlayQuality. O backend de OCR é um contrato injetado, fornecido pela implantação. As assinaturas são listadas na página pública.

O mecanismo de sobreposição mapeia para a ISO 32000-2:2020 §9.3.3 (modo de renderização de texto) e, para origens marcadas, §14.7–§14.8 (árvore de estrutura e elementos de tabela). As etapas de estruturação consomem dados já extraídos; a qualidade é delimitada pelo extrator a montante e pelo backend de OCR.

  • As bounding boxes de tabela sintetizadas são uma subdivisão de grade uniforme, não um layout medido.
  • Quando o backend de OCR está indisponível, as páginas afetadas contribuem com zero palavras em vez de fazer a execução inteira falhar silenciosamente; verifique o resultado por página.
  • A saída de sobreposição é um documento derivado; revalide as assinaturas e o status de conformidade.
  • Nenhuma operação criptográfica ocorre neste módulo, então não há comportamento específico do modo FIPS.

Esta página documenta apenas o comportamento observável externamente e a superfície da API pública suportada. Caminhos de namespace internos, classes auxiliares, tabelas de mecanismo, nomes de arquivo de runbook e prefixos de tíquete estão fora do escopo.

O NextPDF Core (Apache-2.0) não tem orquestração de sobreposição pesquisável e não tem superfície de estruturação validada por esquema — nenhuma; este recurso não tem equivalente no nível Core.

O NextPDF Pro distribui extração estrutural orientada por AST sobre um documento já analisado; ele não fornece estruturação de chave-valor validada por esquema, reconstrução de tabela a partir de grades brutas nem orquestração de sobreposição pesquisável com suporte de OCR. Essas são distribuídas apenas no pacote nextpdf/enterprise.

A tipagem de chave-valor, a validação de esquema, a síntese de grade de tabela e a orquestração de sobreposição são descritas no nível de comportamento. A rasterização efetiva e a injeção de texto invisível são executadas em um processo de sidecar separado; os detalhes internos do sidecar, o modelo de OCR e qualquer detalhe interno de orquestração estão fora do escopo e não são reproduzidos aqui. O backend de OCR é um contrato injetado, fornecido pela implantação.

A implantação fornece e opera o backend de OCR e escolhe onde o OCR é computado — e, portanto, onde as imagens do documento e o texto reconhecido são computados e armazenados. A superfície delimita o tamanho da entrada e a contagem de páginas e falha de forma segura em estouro. O NextPDF Enterprise orquestra o fluxo de trabalho e retorna metadados de resultado; ele não incorpora um modelo de OCR e não garante precisão de reconhecimento nem recall de extração.

Nenhuma restrição de controle de exportação se aplica a esta superfície. A superfície não afirma nenhuma garantia de precisão de OCR nem de recall de extração e nenhum status de conformidade regulatória. Esta referência não é um parecer jurídico.