Enterprise 版本
Intelligence — 深度参考
这份深度参考记录了键值类型化与 schema 校验、表格栅格合成,以及可搜索叠层编排边界。
可用性与授权
标题为“可用性与授权”的章节此能力随 NextPDF Enterprise(nextpdf/enterprise)发行,并通过一份 Enterprise 层级的授权信封激活。不具备该授权的部署不会加载此能力的相关类。比较各版本并获取授权。
行为契约
标题为“行为契约”的章节StructuredExtractor::extract 会对原始键值输入进行类型化。当提供了 schema
时,仅保留其键与某个 schema 字段匹配的键值对;没有显式置信度的键值对会获得一个固定的默认值。validateSchema
返回未找到的必填字段名(为空表示符合)。这一步会对已经抽取出的数据进行类型化与校验;它不识别文本,也不赋予任何计算得到的精度。
TableExtractor::extract 会从原始行栅格构建结构化表格。列数取最宽的行;较短的行会以空单元格补齐。每个单元格会从一个归一化页面区域的均匀细分中获得一个合成的边界框,以及一个固定的默认置信度。一个没有任何行或没有任何列的表格会被跳过。这些边界框是一种栅格合成,而非一种实测的版面。
SearchableOverlay::generate 会校验 PDF 头部,对输入尺寸与页数设界(在溢出时失败即关闭),检测缺少可用文本层的页面,驱动所配置的 OCR
后端,并返回逐页的字数以及一个平均置信度。一个具有可用原生文本层的页面默认会被跳过。不可见的 OCR
文本依赖一种既不填充也不描边字形的文本渲染模式(ISO 32000-2:2020
§9.3.3);当源被打了标签时,结构树会将内容映射到一个阅读顺序(§14.7),而表格结构元素会描述行与单元格(§14.8)。实际的栅格化与不可见文本注入会被委派给一个单独的
sidecar 进程;PHP 接口面负责编排并返回结果元数据。叠层输出是一份派生文档——任何既有签名都会失效,且符合性必须重新校验。置信度是直通的,或为一个固定默认值;该接口面不断言任何
OCR 准确率或抽取召回率。
公共 API 接口面
标题为“公共 API 接口面”的章节NextPDF\Enterprise\Intelligence\StructuredExtractor、
NextPDF\Enterprise\Intelligence\ExtractionSchema、
NextPDF\Enterprise\Intelligence\SchemaField、
NextPDF\Enterprise\Intelligence\KeyValuePair、
NextPDF\Enterprise\Intelligence\TableExtractor、
NextPDF\Enterprise\Intelligence\TableResult、
NextPDF\Enterprise\Intelligence\TableCell、
NextPDF\Enterprise\Intelligence\SearchableOverlay、
NextPDF\Enterprise\Intelligence\OverlayConfig、
NextPDF\Enterprise\Intelligence\SearchableOverlayResult、
NextPDF\Enterprise\Intelligence\PageOverlayInfo、
NextPDF\Enterprise\Intelligence\ExtractionConfig,以及
ExtractionStrategy / OverlayQuality 枚举。OCR 后端是一个由部署注入提供的契约。各签名在公开页面上列出。
符合性
标题为“符合性”的章节叠层机制映射到 ISO 32000-2:2020 §9.3.3(文本渲染模式),以及——针对带标签的源——§14.7–§14.8(结构树与表格元素)。各结构化步骤消费的是已经抽取出的数据;质量受上游抽取器与 OCR 后端的限制。
边界情形与 FIPS 模式行为
标题为“边界情形与 FIPS 模式行为”的章节- 合成的表格边界框是一种均匀栅格细分,而非一种实测的版面。
- 当 OCR 后端不可用时,受影响的页面贡献零个词,而不是静默地令整次运行失败;请检查逐页结果。
- 叠层输出是一份派生文档;请重新校验签名与符合性状态。
- 本模块不发生任何密码学操作,因此不存在 FIPS 模式特有的行为。
发布边界
标题为“发布边界”的章节本页面仅记录可从外部观察到的行为以及受支持的公共 API 接口面。内部命名空间路径、辅助类、机制表、runbook 文件名与工单前缀均不在范围内。
Core 回退
标题为“Core 回退”的章节NextPDF Core(Apache-2.0)没有任何可搜索叠层编排,也没有任何经 schema 校验的结构化接口面——无;此能力没有 Core 层级的对等物。
Pro 回退
标题为“Pro 回退”的章节NextPDF Pro 提供在已解析文档之上的结构化 AST 驱动抽取;它不提供经 schema 校验的键值结构化、从原始栅格重建表格,或 OCR 支撑的可搜索叠层编排。这些仅随 nextpdf/enterprise 包发行。
Enterprise 边界说明
标题为“Enterprise 边界说明”的章节键值类型化、schema 校验、表格栅格合成与叠层编排都在行为层面进行描述。实际的栅格化与不可见文本注入在一个单独的 sidecar 进程中运行;sidecar 内部细节、OCR 模型,以及任何内部编排细节均不在范围内,此处不予复现。OCR 后端是一个由部署注入提供的契约。
部署边界
标题为“部署边界”的章节部署方提供并运行 OCR 后端,并选择在何处计算 OCR——从而决定文档图像与识别文本在何处计算与存储。该接口面会对输入尺寸与页数设界,并在溢出时失败即关闭。NextPDF Enterprise 编排该工作流程并返回结果元数据;它不内嵌任何 OCR 模型,也不保证识别准确率或抽取召回率。
法律合规边界
标题为“法律合规边界”的章节此接口面不适用任何出口管制限制。该接口面不断言任何 OCR 准确率或抽取召回率保证,也不断言任何监管合规状态。本参考不构成法律意见。