コンテンツにスキップ
getnextpdf.com

Enterprise エディション

Intelligence — 詳細リファレンス

この詳細リファレンスでは、キーバリューの型付けとスキーマ検証、テーブルグリッドの合成、および検索可能オーバーレイのオーケストレーション境界を説明します。

この機能は NextPDF Enterprisenextpdf/enterprise)に同梱され、Enterprise ティアのライセンスエンベロープで有効化されます。そのエンタイトルメントを持たないデプロイメントでは、この機能のクラスはロードされません。エディションを比較してライセンスを取得

StructuredExtractor::extract は、生のキーバリュー入力を型付けします。スキーマが提供されると、キーがスキーマフィールドに一致するペアのみが保持されます。明示的な確信度を持たないペアには、固定のデフォルト値が割り当てられます。validateSchema は、見つからなかった必須フィールド名を返します(空の場合は準拠を意味します)。このステップは、すでに抽出済みのデータを型付けして検証します。テキストを認識することはなく、計算された精度も割り当てません。

TableExtractor::extract は、生の行グリッドから構造化テーブルを構築します。列数は最も広い行の数になります。短い行は空のセルでパディングされます。各セルには、正規化されたページ領域を均等に分割した合成バウンディングボックスと、固定のデフォルト確信度が割り当てられます。行も列もないテーブルはスキップされます。バウンディングボックスはグリッド合成であり、計測されたレイアウトではありません。

SearchableOverlay::generate は、PDF ヘッダーを検証し、入力サイズとページ数の上限を設け(オーバーフロー時はフェイルクローズ)、使用可能なテキストレイヤーを欠くページを検出し、構成済みの OCR バックエンドを駆動し、ページごとの単語数と平均確信度を返します。使用可能なネイティブテキストレイヤーを持つページは、デフォルトでスキップされます。不可視の OCR テキストは、グリフの塗りつぶしもストロークも行わないテキストレンダリングモードに依存します(ISO 32000-2:2020 §9.3.3)。ソースがタグ付きの場合、構造ツリーはコンテンツを読み取り順序にマッピングし(§14.7)、テーブル構造要素は行とセルを記述します(§14.8)。実際のラスタライズと不可視テキストの注入は、別個のサイドカープロセスに委譲されます。PHP サーフェスはオーケストレーションを行い、結果メタデータを返します。オーバーレイ出力は派生ドキュメントです — 既存の署名はすべて無効になり、コンプライアンスは再検証する必要があります。確信度はパススルーまたは固定のデフォルト値です。このサーフェスは OCR の精度や抽出の再現率を一切主張しません。

NextPDF\Enterprise\Intelligence\StructuredExtractorNextPDF\Enterprise\Intelligence\ExtractionSchemaNextPDF\Enterprise\Intelligence\SchemaFieldNextPDF\Enterprise\Intelligence\KeyValuePairNextPDF\Enterprise\Intelligence\TableExtractorNextPDF\Enterprise\Intelligence\TableResultNextPDF\Enterprise\Intelligence\TableCellNextPDF\Enterprise\Intelligence\SearchableOverlayNextPDF\Enterprise\Intelligence\OverlayConfigNextPDF\Enterprise\Intelligence\SearchableOverlayResultNextPDF\Enterprise\Intelligence\PageOverlayInfoNextPDF\Enterprise\Intelligence\ExtractionConfig、および ExtractionStrategy / OverlayQuality enum。OCR バックエンドは、デプロイメントが提供する注入されたコントラクトです。シグネチャは公開ページに記載されています。

オーバーレイメカニズムは、ISO 32000-2:2020 §9.3.3(テキストレンダリングモード)に、タグ付きソースについては §14.7–§14.8(構造ツリーとテーブル要素)にマッピングされます。構造化ステップは、すでに抽出済みのデータを利用します。品質は、上流の抽出器と OCR バックエンドによって制限されます。

  • 合成されたテーブルのバウンディングボックスは均等なグリッド分割であり、計測されたレイアウトではありません。
  • OCR バックエンドが利用できない場合、影響を受けるページは、実行全体を黙って失敗させるのではなく、単語数ゼロを返します。ページごとの結果を確認してください。
  • オーバーレイ出力は派生ドキュメントです。署名とコンプライアンスのステータスを再検証してください。
  • このモジュールでは暗号操作は発生しないため、FIPS モード固有の挙動はありません。

このページは、外部から観測可能な挙動とサポート対象のパブリック API サーフェスのみを記述します。内部名前空間パス、ヘルパークラス、メカニズムテーブル、ランブックのファイル名、およびチケットのプレフィックスは対象外です。

NextPDF Core(Apache-2.0)には検索可能オーバーレイのオーケストレーションも、スキーマ検証付きの構造化サーフェスもありません — なし。この機能には Core ティアの同等品がありません。

NextPDF Pro は、すでに解析済みのドキュメントに対する構造的な AST 駆動の抽出を提供します。スキーマ検証付きのキーバリュー構造化、生のグリッドからのテーブル再構築、または OCR ベースの検索可能オーバーレイのオーケストレーションは提供しません。それらは nextpdf/enterprise パッケージにのみ同梱されています。

キーバリューの型付け、スキーマ検証、テーブルグリッドの合成、およびオーバーレイのオーケストレーションは、挙動レベルで記述されています。実際のラスタライズと不可視テキストの注入は、別個のサイドカープロセスで実行されます。サイドカーの内部、OCR モデル、および内部オーケストレーションの詳細は対象外であり、ここでは複製していません。OCR バックエンドは、デプロイメントが提供する注入されたコントラクトです。

デプロイメントは OCR バックエンドを提供して運用し、OCR をどこで計算するか — したがってドキュメント画像と認識されたテキストをどこで計算して保存するか — を選択します。サーフェスは入力サイズとページ数の上限を設け、オーバーフロー時はフェイルクローズします。NextPDF Enterprise はワークフローをオーケストレーションし、結果メタデータを返します。OCR モデルを埋め込んだり、認識精度や抽出の再現率を保証したりすることはありません。

このサーフェスには輸出管理上の制限は適用されません。このサーフェスは、OCR 精度や抽出再現率の保証、および規制コンプライアンスのステータスを一切主張しません。このリファレンスは法的意見ではありません。