Przejdź do głównej zawartości
getnextpdf.com

Enterprise edycja

Intelligence — szczegółowa referencja

Ta szczegółowa referencja dokumentuje typowanie klucz-wartość i walidację schematu, syntezę siatki tabeli oraz granicę orchestracji nakładki z możliwością wyszukiwania.

Ta możliwość jest dostarczana w NextPDF Enterprise (nextpdf/enterprise) i aktywuje się wraz z kopertą licencyjną poziomu Enterprise. Wdrożenie bez tego uprawnienia nie ładuje klas tej możliwości. Porównaj edycje i uzyskaj licencję.

StructuredExtractor::extract typuje surowe dane wejściowe klucz-wartość. Gdy dostarczono schemat, zachowywane są wyłącznie pary, których klucz pasuje do pola schematu; pary bez jawnej pewności otrzymują ustaloną wartość domyślną. validateSchema zwraca nazwy pól wymaganych, których nie znaleziono (pusta lista oznacza zgodność). Ten krok typuje i waliduje już wyodrębnione dane; nie rozpoznaje tekstu i nie przypisuje żadnej obliczonej precyzji.

TableExtractor::extract buduje ustrukturyzowane tabele z surowych siatek wierszy. Liczba kolumn to najszerszy wiersz; krótkie wiersze są uzupełniane pustymi komórkami. Każda komórka otrzymuje zsyntetyzowany prostokąt ograniczający z jednolitego podziału znormalizowanego obszaru strony oraz ustaloną pewność domyślną. Tabela bez wierszy lub bez kolumn jest pomijana. Prostokąty ograniczające są syntezą siatki, a nie zmierzonym układem.

SearchableOverlay::generate waliduje nagłówek PDF, ogranicza rozmiar danych wejściowych oraz liczbę stron (kończąc w trybie fail-closed przy przepełnieniu), wykrywa strony pozbawione używalnej warstwy tekstowej, steruje skonfigurowanym backendem OCR i zwraca liczby słów dla poszczególnych stron oraz średnią pewność. Strona z używalną natywną warstwą tekstową jest domyślnie pomijana. Niewidzialny tekst OCR opiera się na trybie renderowania tekstu, który ani nie wypełnia, ani nie obrysowuje glifów (ISO 32000-2:2020 §9.3.3); gdy źródło jest otagowane, drzewo struktury odwzorowuje treść na kolejność czytania (§14.7), a elementy struktury tabeli opisują wiersze i komórki (§14.8). Właściwa rasteryzacja oraz wstrzykiwanie niewidzialnego tekstu są delegowane do osobnego procesu sidecara; powierzchnia PHP orchestruje i zwraca metadane wyniku. Wynik nakładki jest dokumentem pochodnym — każdy istniejący podpis jest unieważniany, a zgodność musi zostać ponownie zwalidowana. Pewność jest przekazywana lub jest ustaloną wartością domyślną; powierzchnia nie deklaruje żadnej dokładności OCR ani odzysku ekstrakcji.

NextPDF\Enterprise\Intelligence\StructuredExtractor, NextPDF\Enterprise\Intelligence\ExtractionSchema, NextPDF\Enterprise\Intelligence\SchemaField, NextPDF\Enterprise\Intelligence\KeyValuePair, NextPDF\Enterprise\Intelligence\TableExtractor, NextPDF\Enterprise\Intelligence\TableResult, NextPDF\Enterprise\Intelligence\TableCell, NextPDF\Enterprise\Intelligence\SearchableOverlay, NextPDF\Enterprise\Intelligence\OverlayConfig, NextPDF\Enterprise\Intelligence\SearchableOverlayResult, NextPDF\Enterprise\Intelligence\PageOverlayInfo, NextPDF\Enterprise\Intelligence\ExtractionConfig oraz enumy ExtractionStrategy / OverlayQuality. Backend OCR jest wstrzykiwanym kontraktem dostarczanym przez wdrożenie. Sygnatury są wymienione na stronie publicznej.

Mechanizm nakładki odwzorowuje się na ISO 32000-2:2020 §9.3.3 (tryb renderowania tekstu) oraz, dla źródeł otagowanych, §14.7–§14.8 (drzewo struktury i elementy tabeli). Kroki strukturyzowania konsumują już wyodrębnione dane; jakość jest ograniczona przez poprzedzający ekstraktor oraz backend OCR.

  • Zsyntetyzowane prostokąty ograniczające tabeli to jednolity podział siatki, a nie zmierzony układ.
  • Gdy backend OCR jest niedostępny, dotknięte strony wnoszą zero słów, zamiast cicho doprowadzać do niepowodzenia całego przebiegu; sprawdź wynik dla poszczególnych stron.
  • Wynik nakładki jest dokumentem pochodnym; ponownie zwaliduj podpisy oraz stan zgodności.
  • W tym module nie zachodzi żadna operacja kryptograficzna, więc nie ma zachowania specyficznego dla trybu FIPS.

Ta strona dokumentuje wyłącznie zewnętrznie obserwowalne zachowanie oraz obsługiwaną powierzchnię publicznego API. Wewnętrzne ścieżki przestrzeni nazw, klasy pomocnicze, tabele mechanizmów, nazwy plików runbooków oraz prefiksy zgłoszeń są poza zakresem.

NextPDF Core (Apache-2.0) nie ma orchestracji nakładki z możliwością wyszukiwania ani powierzchni strukturyzowania zwalidowanego schematem — żadnej; ta możliwość nie ma odpowiednika na poziomie Core.

NextPDF Pro dostarcza strukturalną ekstrakcję sterowaną AST nad już sparsowanym dokumentem; nie zapewnia strukturyzowania klucz-wartość zwalidowanego schematem, rekonstrukcji tabeli z surowych siatek ani orchestracji nakładki z możliwością wyszukiwania opartej na OCR. Te elementy są dostarczane wyłącznie w pakiecie nextpdf/enterprise.

Typowanie klucz-wartość, walidacja schematu, synteza siatki tabeli oraz orchestracja nakładki są opisane na poziomie zachowania. Właściwa rasteryzacja oraz wstrzykiwanie niewidzialnego tekstu działają w osobnym procesie sidecara; wewnętrzne elementy sidecara, model OCR oraz wszelkie wewnętrzne szczegóły orchestracji są poza zakresem i nie są tutaj odtwarzane. Backend OCR jest wstrzykiwanym kontraktem dostarczanym przez wdrożenie.

Wdrożenie dostarcza i obsługuje backend OCR oraz wybiera, gdzie obliczany jest OCR — a zatem gdzie obliczane i przechowywane są obrazy dokumentów oraz rozpoznany tekst. Powierzchnia ogranicza rozmiar danych wejściowych oraz liczbę stron i kończy w trybie fail-closed przy przepełnieniu. NextPDF Enterprise orchestruje przepływ pracy i zwraca metadane wyniku; nie osadza modelu OCR ani nie gwarantuje dokładności rozpoznawania lub odzysku ekstrakcji.

Do tej powierzchni nie stosuje się żadne ograniczenie kontroli eksportu. Powierzchnia nie deklaruje żadnej gwarancji dokładności OCR ani odzysku ekstrakcji oraz żadnego stanu zgodności regulacyjnej. Niniejsza referencja nie jest opinią prawną.