Enterprise edição
Intelligence — Referência Profunda
Em resumo
Seção intitulada “Em resumo”Esta referência aprofundada documenta a tipagem de chave-valor e a validação de esquema, a síntese de grade de tabela e o limite de orquestração de sobreposição pesquisável.
Disponibilidade e licenciamento
Seção intitulada “Disponibilidade e licenciamento”Esta capacidade é distribuída no NextPDF Enterprise (nextpdf/enterprise) e ativa com um envelope de licença de nível Enterprise. Uma implantação sem esse direito não carrega as classes da capacidade. Compare edições e obtenha uma licença.
Contrato de comportamento
Seção intitulada “Contrato de comportamento”StructuredExtractor::extract tipa a entrada bruta de chave-valor. Quando um esquema é
fornecido, apenas os pares cuja chave corresponde a um campo do esquema são mantidos;
pares sem uma confiança explícita recebem um padrão fixo. validateSchema retorna
os nomes de campos obrigatórios que não foram encontrados (vazio significa conforme). Esta
etapa tipa e valida dados já extraídos; ela não reconhece texto e
não atribui nenhuma precisão calculada.
TableExtractor::extract constrói tabelas estruturadas a partir de grades brutas de
linhas. A contagem de colunas é a da linha mais larga; linhas curtas são preenchidas com
células vazias. Cada célula recebe uma bounding box sintetizada a partir de uma
subdivisão uniforme de uma área normalizada de página e uma confiança padrão fixa. Uma
tabela sem linhas ou sem colunas é ignorada. As bounding boxes são uma síntese de
grade, não um layout medido.
SearchableOverlay::generate valida o cabeçalho do PDF, delimita o tamanho da entrada
e a contagem de páginas (falhando de forma segura em estouro), detecta páginas sem uma
camada de texto utilizável, aciona o backend de OCR configurado e retorna a contagem de
palavras por página e uma confiança média. Uma página com uma camada de texto nativa
utilizável é ignorada por padrão. O texto OCR invisível depende de um modo de
renderização de texto que não preenche nem traça os glifos (ISO 32000-2:2020 §9.3.3); quando a
origem é marcada (tagged), a árvore de estrutura mapeia o conteúdo para uma ordem de leitura
(§14.7) e os elementos de estrutura de tabela descrevem linhas e células (§14.8). A
rasterização efetiva e a injeção de texto invisível são delegadas a um processo de
sidecar separado; a superfície PHP orquestra e retorna metadados de resultado. A
saída de sobreposição é um documento derivado — qualquer assinatura existente é
invalidada e a conformidade deve ser revalidada. A confiança é passthrough ou
um padrão fixo; a superfície não afirma nenhuma precisão de OCR nem recall de extração.
Superfície da API pública
Seção intitulada “Superfície da API pública”NextPDF\Enterprise\Intelligence\StructuredExtractor,
NextPDF\Enterprise\Intelligence\ExtractionSchema,
NextPDF\Enterprise\Intelligence\SchemaField,
NextPDF\Enterprise\Intelligence\KeyValuePair,
NextPDF\Enterprise\Intelligence\TableExtractor,
NextPDF\Enterprise\Intelligence\TableResult,
NextPDF\Enterprise\Intelligence\TableCell,
NextPDF\Enterprise\Intelligence\SearchableOverlay,
NextPDF\Enterprise\Intelligence\OverlayConfig,
NextPDF\Enterprise\Intelligence\SearchableOverlayResult,
NextPDF\Enterprise\Intelligence\PageOverlayInfo,
NextPDF\Enterprise\Intelligence\ExtractionConfig e os enums
ExtractionStrategy / OverlayQuality. O backend de OCR é um contrato
injetado, fornecido pela implantação. As assinaturas são listadas na página
pública.
Conformidade
Seção intitulada “Conformidade”O mecanismo de sobreposição mapeia para a ISO 32000-2:2020 §9.3.3 (modo de renderização de texto) e, para origens marcadas, §14.7–§14.8 (árvore de estrutura e elementos de tabela). As etapas de estruturação consomem dados já extraídos; a qualidade é delimitada pelo extrator a montante e pelo backend de OCR.
Casos extremos e comportamento em modo FIPS
Seção intitulada “Casos extremos e comportamento em modo FIPS”- As bounding boxes de tabela sintetizadas são uma subdivisão de grade uniforme, não um layout medido.
- Quando o backend de OCR está indisponível, as páginas afetadas contribuem com zero palavras em vez de fazer a execução inteira falhar silenciosamente; verifique o resultado por página.
- A saída de sobreposição é um documento derivado; revalide as assinaturas e o status de conformidade.
- Nenhuma operação criptográfica ocorre neste módulo, então não há comportamento específico do modo FIPS.
Limite de publicação
Seção intitulada “Limite de publicação”Esta página documenta apenas o comportamento observável externamente e a superfície da API pública suportada. Caminhos de namespace internos, classes auxiliares, tabelas de mecanismo, nomes de arquivo de runbook e prefixos de tíquete estão fora do escopo.
Fallback do Core
Seção intitulada “Fallback do Core”O NextPDF Core (Apache-2.0) não tem orquestração de sobreposição pesquisável e não tem superfície de estruturação validada por esquema — nenhuma; este recurso não tem equivalente no nível Core.
Fallback do Pro
Seção intitulada “Fallback do Pro”O NextPDF Pro distribui extração estrutural orientada por AST sobre um documento já analisado; ele não fornece estruturação de chave-valor validada por esquema, reconstrução de tabela a partir de grades brutas nem orquestração de sobreposição pesquisável com suporte de OCR. Essas são distribuídas apenas no pacote nextpdf/enterprise.
Nota sobre o limite do Enterprise
Seção intitulada “Nota sobre o limite do Enterprise”A tipagem de chave-valor, a validação de esquema, a síntese de grade de tabela e a orquestração de sobreposição são descritas no nível de comportamento. A rasterização efetiva e a injeção de texto invisível são executadas em um processo de sidecar separado; os detalhes internos do sidecar, o modelo de OCR e qualquer detalhe interno de orquestração estão fora do escopo e não são reproduzidos aqui. O backend de OCR é um contrato injetado, fornecido pela implantação.
Limite de implantação
Seção intitulada “Limite de implantação”A implantação fornece e opera o backend de OCR e escolhe onde o OCR é computado — e, portanto, onde as imagens do documento e o texto reconhecido são computados e armazenados. A superfície delimita o tamanho da entrada e a contagem de páginas e falha de forma segura em estouro. O NextPDF Enterprise orquestra o fluxo de trabalho e retorna metadados de resultado; ele não incorpora um modelo de OCR e não garante precisão de reconhecimento nem recall de extração.
Limite de conformidade legal
Seção intitulada “Limite de conformidade legal”Nenhuma restrição de controle de exportação se aplica a esta superfície. A superfície não afirma nenhuma garantia de precisão de OCR nem de recall de extração e nenhum status de conformidade regulatória. Esta referência não é um parecer jurídico.