跳转到内容
getnextpdf.com

Enterprise 版本

Intelligence — 深度参考

这份深度参考记录了键值类型化与 schema 校验、表格栅格合成,以及可搜索叠层编排边界。

此能力随 NextPDF Enterprisenextpdf/enterprise)发行,并通过一份 Enterprise 层级的授权信封激活。不具备该授权的部署不会加载此能力的相关类。比较各版本并获取授权

StructuredExtractor::extract 会对原始键值输入进行类型化。当提供了 schema 时,仅保留其键与某个 schema 字段匹配的键值对;没有显式置信度的键值对会获得一个固定的默认值。validateSchema 返回未找到的必填字段名(为空表示符合)。这一步会对已经抽取出的数据进行类型化与校验;它不识别文本,也不赋予任何计算得到的精度。

TableExtractor::extract 会从原始行栅格构建结构化表格。列数取最宽的行;较短的行会以空单元格补齐。每个单元格会从一个归一化页面区域的均匀细分中获得一个合成的边界框,以及一个固定的默认置信度。一个没有任何行或没有任何列的表格会被跳过。这些边界框是一种栅格合成,而非一种实测的版面。

SearchableOverlay::generate 会校验 PDF 头部,对输入尺寸与页数设界(在溢出时失败即关闭),检测缺少可用文本层的页面,驱动所配置的 OCR 后端,并返回逐页的字数以及一个平均置信度。一个具有可用原生文本层的页面默认会被跳过。不可见的 OCR 文本依赖一种既不填充也不描边字形的文本渲染模式(ISO 32000-2:2020 §9.3.3);当源被打了标签时,结构树会将内容映射到一个阅读顺序(§14.7),而表格结构元素会描述行与单元格(§14.8)。实际的栅格化与不可见文本注入会被委派给一个单独的 sidecar 进程;PHP 接口面负责编排并返回结果元数据。叠层输出是一份派生文档——任何既有签名都会失效,且符合性必须重新校验。置信度是直通的,或为一个固定默认值;该接口面不断言任何 OCR 准确率或抽取召回率。

NextPDF\Enterprise\Intelligence\StructuredExtractorNextPDF\Enterprise\Intelligence\ExtractionSchemaNextPDF\Enterprise\Intelligence\SchemaFieldNextPDF\Enterprise\Intelligence\KeyValuePairNextPDF\Enterprise\Intelligence\TableExtractorNextPDF\Enterprise\Intelligence\TableResultNextPDF\Enterprise\Intelligence\TableCellNextPDF\Enterprise\Intelligence\SearchableOverlayNextPDF\Enterprise\Intelligence\OverlayConfigNextPDF\Enterprise\Intelligence\SearchableOverlayResultNextPDF\Enterprise\Intelligence\PageOverlayInfoNextPDF\Enterprise\Intelligence\ExtractionConfig,以及 ExtractionStrategy / OverlayQuality 枚举。OCR 后端是一个由部署注入提供的契约。各签名在公开页面上列出。

叠层机制映射到 ISO 32000-2:2020 §9.3.3(文本渲染模式),以及——针对带标签的源——§14.7–§14.8(结构树与表格元素)。各结构化步骤消费的是已经抽取出的数据;质量受上游抽取器与 OCR 后端的限制。

  • 合成的表格边界框是一种均匀栅格细分,而非一种实测的版面。
  • 当 OCR 后端不可用时,受影响的页面贡献零个词,而不是静默地令整次运行失败;请检查逐页结果。
  • 叠层输出是一份派生文档;请重新校验签名与符合性状态。
  • 本模块不发生任何密码学操作,因此不存在 FIPS 模式特有的行为。

本页面仅记录可从外部观察到的行为以及受支持的公共 API 接口面。内部命名空间路径、辅助类、机制表、runbook 文件名与工单前缀均不在范围内。

NextPDF Core(Apache-2.0)没有任何可搜索叠层编排,也没有任何经 schema 校验的结构化接口面——无;此能力没有 Core 层级的对等物。

NextPDF Pro 提供在已解析文档之上的结构化 AST 驱动抽取;它不提供经 schema 校验的键值结构化、从原始栅格重建表格,或 OCR 支撑的可搜索叠层编排。这些仅随 nextpdf/enterprise 包发行。

键值类型化、schema 校验、表格栅格合成与叠层编排都在行为层面进行描述。实际的栅格化与不可见文本注入在一个单独的 sidecar 进程中运行;sidecar 内部细节、OCR 模型,以及任何内部编排细节均不在范围内,此处不予复现。OCR 后端是一个由部署注入提供的契约。

部署方提供并运行 OCR 后端,并选择在何处计算 OCR——从而决定文档图像与识别文本在何处计算与存储。该接口面会对输入尺寸与页数设界,并在溢出时失败即关闭。NextPDF Enterprise 编排该工作流程并返回结果元数据;它不内嵌任何 OCR 模型,也不保证识别准确率或抽取召回率。

此接口面不适用任何出口管制限制。该接口面不断言任何 OCR 准确率或抽取召回率保证,也不断言任何监管合规状态。本参考不构成法律意见。