Enterprise edycja
Intelligence — szczegółowa referencja
W skrócie
Dział zatytułowany „W skrócie”Ta szczegółowa referencja dokumentuje typowanie klucz-wartość i walidację schematu, syntezę siatki tabeli oraz granicę orchestracji nakładki z możliwością wyszukiwania.
Dostępność i licencjonowanie
Dział zatytułowany „Dostępność i licencjonowanie”Ta możliwość jest dostarczana w NextPDF Enterprise (nextpdf/enterprise) i aktywuje się wraz z kopertą licencyjną poziomu Enterprise. Wdrożenie bez tego uprawnienia nie ładuje klas tej możliwości. Porównaj edycje i uzyskaj licencję.
Kontrakt zachowania
Dział zatytułowany „Kontrakt zachowania”StructuredExtractor::extract typuje surowe dane wejściowe klucz-wartość. Gdy
dostarczono schemat, zachowywane są wyłącznie pary, których klucz pasuje do
pola schematu; pary bez jawnej pewności otrzymują ustaloną wartość domyślną.
validateSchema zwraca nazwy pól wymaganych, których nie znaleziono (pusta
lista oznacza zgodność). Ten krok typuje i waliduje już wyodrębnione dane; nie
rozpoznaje tekstu i nie przypisuje żadnej obliczonej precyzji.
TableExtractor::extract buduje ustrukturyzowane tabele z surowych siatek
wierszy. Liczba kolumn to najszerszy wiersz; krótkie wiersze są uzupełniane
pustymi komórkami. Każda komórka otrzymuje zsyntetyzowany prostokąt
ograniczający z jednolitego podziału znormalizowanego obszaru strony oraz
ustaloną pewność domyślną. Tabela bez wierszy lub bez kolumn jest pomijana.
Prostokąty ograniczające są syntezą siatki, a nie zmierzonym układem.
SearchableOverlay::generate waliduje nagłówek PDF, ogranicza rozmiar danych
wejściowych oraz liczbę stron (kończąc w trybie fail-closed przy przepełnieniu),
wykrywa strony pozbawione używalnej warstwy tekstowej, steruje skonfigurowanym
backendem OCR i zwraca liczby słów dla poszczególnych stron oraz średnią
pewność. Strona z używalną natywną warstwą tekstową jest domyślnie pomijana.
Niewidzialny tekst OCR opiera się na trybie renderowania tekstu, który ani nie
wypełnia, ani nie obrysowuje glifów (ISO 32000-2:2020 §9.3.3); gdy źródło jest
otagowane, drzewo struktury odwzorowuje treść na kolejność czytania (§14.7),
a elementy struktury tabeli opisują wiersze i komórki (§14.8). Właściwa
rasteryzacja oraz wstrzykiwanie niewidzialnego tekstu są delegowane do
osobnego procesu sidecara; powierzchnia PHP orchestruje i zwraca metadane
wyniku. Wynik nakładki jest dokumentem pochodnym — każdy istniejący podpis
jest unieważniany, a zgodność musi zostać ponownie zwalidowana. Pewność jest
przekazywana lub jest ustaloną wartością domyślną; powierzchnia nie deklaruje
żadnej dokładności OCR ani odzysku ekstrakcji.
Powierzchnia publicznego API
Dział zatytułowany „Powierzchnia publicznego API”NextPDF\Enterprise\Intelligence\StructuredExtractor,
NextPDF\Enterprise\Intelligence\ExtractionSchema,
NextPDF\Enterprise\Intelligence\SchemaField,
NextPDF\Enterprise\Intelligence\KeyValuePair,
NextPDF\Enterprise\Intelligence\TableExtractor,
NextPDF\Enterprise\Intelligence\TableResult,
NextPDF\Enterprise\Intelligence\TableCell,
NextPDF\Enterprise\Intelligence\SearchableOverlay,
NextPDF\Enterprise\Intelligence\OverlayConfig,
NextPDF\Enterprise\Intelligence\SearchableOverlayResult,
NextPDF\Enterprise\Intelligence\PageOverlayInfo,
NextPDF\Enterprise\Intelligence\ExtractionConfig oraz enumy
ExtractionStrategy / OverlayQuality. Backend OCR jest wstrzykiwanym
kontraktem dostarczanym przez wdrożenie. Sygnatury są wymienione na stronie
publicznej.
Zgodność
Dział zatytułowany „Zgodność”Mechanizm nakładki odwzorowuje się na ISO 32000-2:2020 §9.3.3 (tryb renderowania tekstu) oraz, dla źródeł otagowanych, §14.7–§14.8 (drzewo struktury i elementy tabeli). Kroki strukturyzowania konsumują już wyodrębnione dane; jakość jest ograniczona przez poprzedzający ekstraktor oraz backend OCR.
Przypadki brzegowe i zachowanie w trybie FIPS
Dział zatytułowany „Przypadki brzegowe i zachowanie w trybie FIPS”- Zsyntetyzowane prostokąty ograniczające tabeli to jednolity podział siatki, a nie zmierzony układ.
- Gdy backend OCR jest niedostępny, dotknięte strony wnoszą zero słów, zamiast cicho doprowadzać do niepowodzenia całego przebiegu; sprawdź wynik dla poszczególnych stron.
- Wynik nakładki jest dokumentem pochodnym; ponownie zwaliduj podpisy oraz stan zgodności.
- W tym module nie zachodzi żadna operacja kryptograficzna, więc nie ma zachowania specyficznego dla trybu FIPS.
Granica publikacji
Dział zatytułowany „Granica publikacji”Ta strona dokumentuje wyłącznie zewnętrznie obserwowalne zachowanie oraz obsługiwaną powierzchnię publicznego API. Wewnętrzne ścieżki przestrzeni nazw, klasy pomocnicze, tabele mechanizmów, nazwy plików runbooków oraz prefiksy zgłoszeń są poza zakresem.
Rozwiązanie zastępcze Core
Dział zatytułowany „Rozwiązanie zastępcze Core”NextPDF Core (Apache-2.0) nie ma orchestracji nakładki z możliwością wyszukiwania ani powierzchni strukturyzowania zwalidowanego schematem — żadnej; ta możliwość nie ma odpowiednika na poziomie Core.
Rozwiązanie zastępcze Pro
Dział zatytułowany „Rozwiązanie zastępcze Pro”NextPDF Pro dostarcza strukturalną ekstrakcję sterowaną AST nad już sparsowanym dokumentem; nie zapewnia strukturyzowania klucz-wartość zwalidowanego schematem, rekonstrukcji tabeli z surowych siatek ani orchestracji nakładki z możliwością wyszukiwania opartej na OCR. Te elementy są dostarczane wyłącznie w pakiecie nextpdf/enterprise.
Uwaga o granicy Enterprise
Dział zatytułowany „Uwaga o granicy Enterprise”Typowanie klucz-wartość, walidacja schematu, synteza siatki tabeli oraz orchestracja nakładki są opisane na poziomie zachowania. Właściwa rasteryzacja oraz wstrzykiwanie niewidzialnego tekstu działają w osobnym procesie sidecara; wewnętrzne elementy sidecara, model OCR oraz wszelkie wewnętrzne szczegóły orchestracji są poza zakresem i nie są tutaj odtwarzane. Backend OCR jest wstrzykiwanym kontraktem dostarczanym przez wdrożenie.
Granica wdrożenia
Dział zatytułowany „Granica wdrożenia”Wdrożenie dostarcza i obsługuje backend OCR oraz wybiera, gdzie obliczany jest OCR — a zatem gdzie obliczane i przechowywane są obrazy dokumentów oraz rozpoznany tekst. Powierzchnia ogranicza rozmiar danych wejściowych oraz liczbę stron i kończy w trybie fail-closed przy przepełnieniu. NextPDF Enterprise orchestruje przepływ pracy i zwraca metadane wyniku; nie osadza modelu OCR ani nie gwarantuje dokładności rozpoznawania lub odzysku ekstrakcji.
Granica zgodności prawnej
Dział zatytułowany „Granica zgodności prawnej”Do tej powierzchni nie stosuje się żadne ograniczenie kontroli eksportu. Powierzchnia nie deklaruje żadnej gwarancji dokładności OCR ani odzysku ekstrakcji oraz żadnego stanu zgodności regulacyjnej. Niniejsza referencja nie jest opinią prawną.