Перейти к содержимому
getnextpdf.com

Enterprise редакция

Intelligence — глубокий справочник

Этот глубокий справочник описывает типизацию «ключ-значение» и проверку схемы, синтез сетки таблиц и границу оркестрации поискового наложения.

Эта возможность поставляется в NextPDF Enterprise (nextpdf/enterprise) и активируется лицензионным конвертом уровня Enterprise. Развёртывание без такого права не загружает классы возможности. Сравнить редакции и получить лицензию.

StructuredExtractor::extract типизирует сырой ввод «ключ-значение». Когда схема задана, сохраняются только пары, чей ключ совпадает с полем схемы; пары без явной уверенности получают фиксированное значение по умолчанию. validateSchema возвращает имена обязательных полей, которые не были найдены (пусто означает соответствие). Этот шаг типизирует и проверяет уже извлечённые данные; он не распознаёт текст и не назначает вычисленную точность.

TableExtractor::extract строит структурированные таблицы из сырых сеток строк. Число столбцов равно самой широкой строке; короткие строки дополняются пустыми ячейками. Каждая ячейка получает синтезированную ограничивающую рамку из равномерного разбиения нормализованной области страницы и фиксированную уверенность по умолчанию. Таблица без строк или без столбцов пропускается. Ограничивающие рамки — это синтез сетки, а не измеренный макет.

SearchableOverlay::generate проверяет заголовок PDF, ограничивает размер ввода и число страниц (с поведением fail-closed при переполнении), обнаруживает страницы без пригодного текстового слоя, управляет настроенным OCR-бэкендом и возвращает число слов на каждую страницу и среднюю уверенность. Страница с пригодным нативным текстовым слоем по умолчанию пропускается. Невидимый OCR-текст опирается на режим отрисовки текста, который ни заливает, ни обводит глифы (ISO 32000-2:2020 §9.3.3); когда источник тегирован, дерево структуры сопоставляет содержимое с порядком чтения (§14.7) и элементы структуры таблицы описывают строки и ячейки (§14.8). Фактические растеризация и внедрение невидимого текста делегируются отдельному sidecar-процессу; PHP-поверхность оркеструет и возвращает метаданные результата. Вывод наложения — это производный документ: любая существующая подпись аннулируется, и соответствие должно быть проверено повторно. Уверенность передаётся как есть или является фиксированным значением по умолчанию; поверхность не утверждает никакой точности OCR или полноты извлечения.

NextPDF\Enterprise\Intelligence\StructuredExtractor, NextPDF\Enterprise\Intelligence\ExtractionSchema, NextPDF\Enterprise\Intelligence\SchemaField, NextPDF\Enterprise\Intelligence\KeyValuePair, NextPDF\Enterprise\Intelligence\TableExtractor, NextPDF\Enterprise\Intelligence\TableResult, NextPDF\Enterprise\Intelligence\TableCell, NextPDF\Enterprise\Intelligence\SearchableOverlay, NextPDF\Enterprise\Intelligence\OverlayConfig, NextPDF\Enterprise\Intelligence\SearchableOverlayResult, NextPDF\Enterprise\Intelligence\PageOverlayInfo, NextPDF\Enterprise\Intelligence\ExtractionConfig, а также перечисления ExtractionStrategy / OverlayQuality. OCR-бэкенд — это внедряемый контракт, предоставляемый развёртыванием. Сигнатуры приведены на публичной странице.

Механизм наложения соответствует ISO 32000-2:2020 §9.3.3 (режим отрисовки текста) и, для тегированных источников, §14.7–§14.8 (дерево структуры и элементы таблиц). Шаги структурирования потребляют уже извлечённые данные; качество ограничено вышестоящим экстрактором и OCR-бэкендом.

  • Синтезированные ограничивающие рамки таблиц — это равномерное разбиение сетки, а не измеренный макет.
  • Когда OCR-бэкенд недоступен, затронутые страницы вносят ноль слов, а не молча проваливают весь прогон; проверяйте результат по каждой странице.
  • Вывод наложения — это производный документ; повторно проверьте подписи и статус соответствия.
  • В этом модуле не происходит криптографических операций, поэтому нет поведения, специфичного для режима FIPS.

Эта страница документирует только внешне наблюдаемое поведение и поддерживаемую публичную поверхность API. Внутренние пути пространств имён, вспомогательные классы, таблицы механизмов, имена файлов руководств по эксплуатации и префиксы тикетов находятся вне области действия.

В NextPDF Core (Apache-2.0) нет оркестрации поискового наложения и нет поверхности структурирования с проверкой схемы — их нет; у этой возможности нет эквивалента уровня Core.

NextPDF Pro поставляет структурное извлечение на основе AST над уже разобранным документом; он не предоставляет структурирования «ключ-значение» с проверкой схемы, реконструкции таблиц из сырых сеток или оркестрации поискового наложения с поддержкой OCR. Они поставляются только в пакете nextpdf/enterprise.

Типизация «ключ-значение», проверка схемы, синтез сетки таблиц и оркестрация наложения описаны на уровне поведения. Фактические растеризация и внедрение невидимого текста выполняются в отдельном sidecar-процессе; внутренности sidecar, OCR-модель и любые внутренние детали оркестрации находятся вне области действия и здесь не воспроизводятся. OCR-бэкенд — это внедряемый контракт, предоставляемый развёртыванием.

Развёртывание предоставляет и эксплуатирует OCR-бэкенд и выбирает, где вычисляется OCR — и, следовательно, где вычисляются и хранятся изображения документов и распознанный текст. Поверхность ограничивает размер ввода и число страниц и работает по принципу fail-closed при переполнении. NextPDF Enterprise оркеструет рабочий процесс и возвращает метаданные результата; он не встраивает OCR-модель и не гарантирует точности распознавания или полноты извлечения.

К этой поверхности не применяется ограничение экспортного контроля. Поверхность не утверждает никакой гарантии точности OCR или полноты извлечения и никакого статуса нормативного соответствия. Этот справочник не является юридическим заключением.