Enterprise edycja
Intelligence
W skrócie
Dział zatytułowany „W skrócie”NextPDF Enterprise Intelligence przekształca surowe dane klucz-wartość i tabelaryczne w typowane, opcjonalnie walidowane wobec schematu struktury oraz orkiestruje tworzenie przeszukiwalnych plików PDF, sterując zapleczem OCR na zeskanowanych stronach. Opisuje struktury, które tworzy; nie deklaruje dokładności OCR ani kompletności wyodrębniania.
Dostępność i licencjonowanie
Dział zatytułowany „Dostępność i licencjonowanie”Ta funkcja jest dostarczana w NextPDF Enterprise (nextpdf/enterprise) i aktywuje się wraz z kopertą licencyjną w warstwie Enterprise. Wdrożenie bez tego uprawnienia nie ładuje klas tej funkcji. Wdrożenie bez aktywnego uprawnienia Enterprise nie ładuje tych klas. Porównaj edycje i uzyskaj licencję.
Instalacja
Dział zatytułowany „Instalacja”composer require nextpdf/enterprise:^3Przegląd koncepcyjny
Dział zatytułowany „Przegląd koncepcyjny”Ekstraktor strukturalny przyjmuje surowe pary klucz-wartość — utworzone wcześniej przez akcelerator lub parser heurystyczny — i emituje typowane obiekty par. Gdy dostarczono schemat, zachowuje tylko te pary, których klucz odpowiada polu schematu, i zgłasza, których pól wymaganych brakuje. Para bez jawnej pewności otrzymuje stałą wartość domyślną. Jest to krok typowania i walidacji nad danymi, które są już wyodrębnione; sam nie jest silnikiem wyodrębniania ani rozpoznawania i nie przypisuje obliczonej precyzji.
Ekstraktor tabel przyjmuje surowe siatki wierszy i buduje ustrukturyzowane wyniki tabel z obiektami dla każdej komórki oraz zsyntetyzowanymi, jednolitymi prostokątami otaczającymi, wyprowadzonymi przez podział znormalizowanego obszaru strony. Krótkie wiersze są dopełniane, aby każdy wiersz miał liczbę kolumn najszerszego z nich. Tabela bez wierszy lub bez kolumn jest pomijana. Prostokąty otaczające to synteza jednolitej siatki, a nie zmierzony układ.
Orkiestrator przeszukiwalnej nakładki przyjmuje zeskanowany lub mieszany plik PDF, wykrywa, które strony nie mają użytecznej warstwy tekstu, steruje skonfigurowanym zapleczem OCR i tworzy wynik opisujący liczbę słów na każdej stronie oraz średnią pewność. Niewidoczny tekst to mechanizm przeszukiwalnej zeskanowanej strony: operator pokazywania tekstu może umieścić glify, gdy tryb renderowania tekstu jest ustawiony tak, że tekst nie jest ani wypełniany, ani obrysowywany — ISO 32000-2:2020 §9.3.3 — a operatory pokazywania tekstu umieszczają glify w strumieniu treści — ISO 32000-2:2020 §9.4. Gdy źródło jest oznaczone znacznikami, hierarchia struktury logicznej mapuje treść na kolejność odczytu — ISO 32000-2:2020 §14.7, struktura oznaczona znacznikami wspiera ponowne wykorzystanie treści — ISO 32000-2:2020 §14.8, a elementy struktury tabeli opisują wiersze i komórki — ISO 32000-2:2020 §14.8.
Faktyczna rasteryzacja i wstrzykiwanie niewidocznego tekstu są wykonywane przez oddzielny proces typu sidecar; powierzchnia PHP orkiestruje przepływ pracy i tworzy metadane wyniku. Wynik przebiegu nakładki to dokument pochodny: każdy istniejący podpis zostaje unieważniony, a stan zgodności wymaga ponownej walidacji. Wartości pewności są przekazywane bez zmian lub są stałymi wartościami domyślnymi, a nie gwarantowaną miarą dokładności.
Dlaczego działa to w ten sposób
Dział zatytułowany „Dlaczego działa to w ten sposób”Powierzchnia wyznacza wyraźną granicę między strukturyzowaniem a rozpoznawaniem. Typowanie i walidacja wobec schematu działają w procesie, ponieważ są deterministyczne i tanie. Rozpoznawanie — rasteryzacja i wstrzykiwanie niewidocznego tekstu — jest delegowane do wstrzykiwanego zaplecza OCR oraz oddzielnego komponentu sidecar, ponieważ jest ciężkie, zależne od zaplecza i najlepiej trzymać je poza granicą zaufania PHP. Ten podział pozwala wdrożeniu wybrać, gdzie obliczane i przechowywane są obrazy dokumentów oraz rozpoznany tekst, bez zmiany kodu wywołującego. Moduł odmawia też wymyślania wartości precyzji: nieoznaczona para otrzymuje stałą wartość domyślną, a zgłaszana pewność jest przekazywana, a nie obliczana. Wywołujący nigdy nie otrzymuje sfabrykowanej liczby dokładności.
Tło projektowe: API, które odmawia zgadywania.
Powierzchnia API
Dział zatytułowany „Powierzchnia API”| Typ | Rodzaj | Rola | Stabilność | Od wersji |
|---|---|---|---|---|
StructuredExtractor | klasa | Typuje surowe pary klucz-wartość; filtr schematu i kontrola pól wymaganych | stabilny | 2.2.0 |
ExtractionSchema / SchemaField | klasy | Definicje pól i zbiór pól wymaganych | stabilny | 2.2.0 |
KeyValuePair | klasa | Jedna typowana para klucz-wartość z pewnością | stabilny | 2.2.0 |
TableExtractor | klasa | Buduje ustrukturyzowane tabele z surowych siatek wierszy | stabilny | 2.2.0 |
TableResult / TableCell | klasy | Kształt tabeli z tekstem, pewnością i prostokątem otaczającym dla każdej komórki | stabilny | 2.2.0 |
SearchableOverlay | klasa | Orkiestruje tworzenie przeszukiwalnego PDF opartego na OCR | stabilny | 2.2.0 |
OverlayConfig / OverlayQuality | klasy | Wskazówka językowa, DPI, gotowy zestaw jakości, pomijanie stron natywnych | stabilny | 2.2.0 |
SearchableOverlayResult / PageOverlayInfo | klasy | Liczba słów na każdej stronie i średnia pewność | stabilny | 2.2.0 |
ExtractionConfig / ExtractionStrategy | klasy | Strategia heurystyczna lub wspomagana OCR oraz wskazówki OCR | stabilny | 2.2.0 |
Zaplecze OCR to wstrzykiwany kontrakt. Orkiestrator nie osadza modelu OCR; wdrożenie dostarcza zaplecze i odpowiada za to, gdzie obliczany jest OCR.
Przykład kodu — szybki start
Dział zatytułowany „Przykład kodu — szybki start”<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Intelligence\StructuredExtractor;use NextPDF\Enterprise\Intelligence\ExtractionSchema;
/** * Type raw pairs against a schema and list any missing required fields. * * @param list<array{key: string, value: string, confidence?: float}> $rawPairs Upstream key-value data. * * @return list<string> Missing required field names (empty when compliant). */function validate(array $rawPairs, ExtractionSchema $schema): array{ $extractor = new StructuredExtractor(); $pairs = $extractor->extract($rawPairs, $schema);
return $extractor->validateSchema($schema, $pairs);}Ekstraktor typuje i filtruje dane, które wcześniejszy krok już utworzył. Sam nie wykonuje żadnego rozpoznawania.
Przykład kodu — użycie produkcyjne
Dział zatytułowany „Przykład kodu — użycie produkcyjne”<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Accelerator\OcrStrategyInterface;use NextPDF\Enterprise\Intelligence\OverlayConfig;use NextPDF\Enterprise\Intelligence\SearchableOverlay;use Psr\Log\LoggerInterface;
final readonly class OverlayJob{ public function __construct( private OcrStrategyInterface $ocr, private LoggerInterface $logger, ) {}
/** * Generate a searchable PDF from a scanned input. * * @param string $pdfData Scanned or mixed PDF bytes. * * @return string The derived searchable PDF bytes. */ public function run(string $pdfData): string { try { $result = (new SearchableOverlay($this->ocr)) ->generate($pdfData, new OverlayConfig(language: 'eng'));
$this->logger->info('Overlay complete', [ 'pages' => $result->pageCount, 'words' => $result->wordCount, ]);
return $result->pdfData; } catch (\Throwable $e) { $this->logger->error('Overlay failed', ['error' => $e->getMessage()]);
throw $e; } }}Log zawiera wyłącznie liczbę stron i słów. Nie zawiera rozpoznanego tekstu ani bajtów dokumentu. Blok catch ponownie zgłasza wyjątek; nie tłumi błędu.
Przypadki brzegowe i pułapki
Dział zatytułowany „Przypadki brzegowe i pułapki”- Ekstraktory strukturalny i tabel konsumują już wyodrębnione dane. Nie parsują PDF, nie uruchamiają modelu ani nie mierzą precyzji. Pewność jest przekazywana bez zmian lub jest stałą wartością domyślną.
- Zsyntetyzowane prostokąty otaczające tabel to podział jednolitej siatki, a nie zmierzony układ. Wywołujący, który potrzebuje prawdziwej geometrii, musi pozyskać ją z innego źródła.
- Przeszukiwalna nakładka to dokument pochodny. Każdy istniejący podpis cyfrowy zostaje unieważniony; stan zgodności należy ponownie zwalidować po utworzeniu nakładki.
- Gdy zaplecze OCR jest niedostępne, dotknięte strony wnoszą zero słów, zamiast po cichu kończyć cały przebieg niepowodzeniem — sprawdź wynik dla każdej strony.
- Strona, która ma już użyteczną natywną warstwę tekstu, jest domyślnie pomijana. Wyłącz pomijanie w konfiguracji, jeśli musisz wykonać ponowny OCR.
- Dokładność OCR zależy w całości od dostarczonego zaplecza, jakości danych wejściowych oraz wskazówki językowej. NextPDF nie deklaruje dokładności rozpoznawania ani kompletności wyodrębniania.
Wydajność
Dział zatytułowany „Wydajność”Wyodrębnianie strukturalne i tabelaryczne jest liniowe względem rozmiaru danych wejściowych. Koszt przeszukiwalnej nakładki jest zdominowany przez zaplecze OCR i rasteryzację komponentu sidecar przy skonfigurowanym DPI; narzut orkiestracji jest niewielki. Wejścia dotyczące liczby stron i rozmiaru są ograniczone i kończą się w trybie fail-closed przy przepełnieniu. Profil odtwarzalności to structural: wyodrębnianie jest deterministyczne dla ustalonego wejścia, podczas gdy wynik nakładki zależy od zaplecza OCR i może się różnić między zapleczami lub wersjami.
Uwagi dotyczące bezpieczeństwa
Dział zatytułowany „Uwagi dotyczące bezpieczeństwa”Ekstraktory to kroki strukturyzowania tylko do odczytu. Powierzchnia nakładki tworzy dokument pochodny oraz ogranicza rozmiar danych wejściowych i liczbę stron, kończąc w trybie fail-closed przy przepełnieniu. Zaplecze OCR to punkt integracji, a nie część granicy zaufania; wdrożenie je wybiera i obsługuje. W tym module nie zachodzi żadna operacja kryptograficzna, więc nie wysuwa on żadnej deklaracji FIPS.
Rezydencja danych i środki ograniczające dla danych osobowych
Dział zatytułowany „Rezydencja danych i środki ograniczające dla danych osobowych”Wyodrębnianie strukturalne i tabelaryczne działa w procesie na hoście. Orkiestracja przeszukiwalnej nakładki steruje wstrzykiwanym zapleczem OCR: to, gdzie to zaplecze działa — w procesie, w lokalnym komponencie sidecar czy w usłudze zdalnej — a zatem gdzie obliczane i przechowywane są obrazy dokumentów oraz rozpoznany tekst, jest odpowiedzialnością wdrożenia, poza granicą biblioteki. Jeśli dane wejściowe zawierają dane osobowe, będzie je zawierać także rozpoznana warstwa tekstu; traktuj dokument pochodny odpowiednio.
Bezpieczna telemetria i czyszczenie logów
Dział zatytułowany „Bezpieczna telemetria i czyszczenie logów”Biblioteka zgłasza typowane wyjątki ze strukturalnymi komunikatami i nie umieszcza bajtów dokumentu ani rozpoznanego tekstu w treści wyjątku. Wdrożenie, które prowadzi logowanie wokół tej powierzchni, powinno logować liczby i konfigurację — jak pokazano w przykładzie produkcyjnym — i nie może logować surowego ładunku PDF ani rozpoznanego tekstu do logów ani do zaplecza APM.
Zachowanie w trybie FIPS
Dział zatytułowany „Zachowanie w trybie FIPS”W tym module nie zachodzi żadna operacja kryptograficzna, więc nie ma zachowania specyficznego dla trybu FIPS.
Zgodność
Dział zatytułowany „Zgodność”| Deklaracja | Standard | Klauzula |
|---|---|---|
| Tryb renderowania tekstu decyduje, czy glify są wypełniane, obrysowywane, czy żadne z tych (podstawa niewidocznego tekstu OCR). | ISO 32000-2:2020 | §9.3.3 |
| Operatory pokazywania tekstu umieszczają glify w strumieniu treści. | ISO 32000-2:2020 | §9.4 |
| Hierarchia struktury logicznej mapuje treść na kolejność odczytu. | ISO 32000-2:2020 | §14.7 |
| Struktura oznaczona znacznikami wspiera ponowne wykorzystanie treści. | ISO 32000-2:2020 | §14.8 |
| Elementy struktury tabeli opisują wiersze i komórki. | ISO 32000-2:2020 | §14.8 |
| Drzewo struktury mapuje treść na kolejność odczytu. | ISO 32000-2:2020 | §14.7 |
Wszystkie klauzule są parafrazowane. NextPDF nie odtwarza tekstu normatywnego. Po wiążące brzmienie sięgnij do opublikowanego standardu. NextPDF nie wysuwa żadnej deklaracji dotyczącej dokładności OCR ani kompletności wyodrębniania; ta strona podaje tworzone struktury oraz granicę orkiestracji, a nie gwarancję jakości.
Kontrakt zachowania
Dział zatytułowany „Kontrakt zachowania”- Ekstraktory strukturalny i tabel konsumują już wyodrębnione dane; nie parsują PDF, nie uruchamiają modelu ani nie mierzą precyzji. Pewność jest przekazywana bez zmian lub jest stałą wartością domyślną.
- Filtr schematu zachowuje tylko te pary, których klucz odpowiada polu schematu, i zgłasza brakujące pola wymagane; zsyntetyzowane prostokąty otaczające tabel to podział jednolitej siatki, a nie zmierzony układ.
- Przeszukiwalna nakładka to dokument pochodny: każdy istniejący podpis cyfrowy zostaje unieważniony, a stan zgodności należy ponownie zwalidować.
- Gdy zaplecze OCR jest niedostępne, dotknięte strony wnoszą zero słów, zamiast po cichu kończyć cały przebieg niepowodzeniem; strona z użyteczną natywną warstwą tekstu jest domyślnie pomijana.
- Wejścia dotyczące liczby stron i rozmiaru są ograniczone i kończą w trybie fail-closed przy przepełnieniu. Wyodrębnianie jest deterministyczne dla ustalonego wejścia; wynik nakładki zależy od dostarczonego zaplecza OCR.
Granica publikacji
Dział zatytułowany „Granica publikacji”Ta strona dokumentuje wyłącznie obserwowalne z zewnątrz zachowanie oraz obsługiwaną publiczną powierzchnię API. Wewnętrzne ścieżki przestrzeni nazw, klasy pomocnicze, tabele mechanizmów, nazwy plików runbooków oraz prefiksy zgłoszeń są poza zakresem.
Rozwiązanie zastępcze Core
Dział zatytułowany „Rozwiązanie zastępcze Core”NextPDF Core (Apache-2.0) nie ma orkiestracji przeszukiwalnej nakładki ani powierzchni strukturyzowania walidowanego wobec schematu — żadnej; ta możliwość nie ma odpowiednika na poziomie Core. Model AST Core to baza sparsowanego dokumentu, a nie powierzchnia wyodrębniania ani OCR.
Rozwiązanie zastępcze Pro
Dział zatytułowany „Rozwiązanie zastępcze Pro”NextPDF Pro dostarcza strukturalne wyodrębnianie oparte na AST nad już sparsowanym dokumentem; nie zapewnia walidowanego wobec schematu strukturyzowania danych klucz-wartość, rekonstrukcji tabel z surowych siatek ani orkiestracji przeszukiwalnej nakładki opartej na OCR. Te są dostarczane wyłącznie w pakiecie nextpdf/enterprise.
Uwaga o granicy Enterprise
Dział zatytułowany „Uwaga o granicy Enterprise”Ekstraktory strukturalny/tabel oraz orkiestrator nakładki są opisane na poziomie zachowania. Faktyczna rasteryzacja i wstrzykiwanie niewidocznego tekstu działają w oddzielnym procesie typu sidecar; wewnętrzne mechanizmy komponentu sidecar, model OCR oraz wszelkie wewnętrzne szczegóły orkiestracji są poza zakresem powierzchni publicznej. Zaplecze OCR to wstrzykiwany kontrakt dostarczany przez wdrożenie.
Granica wdrożenia
Dział zatytułowany „Granica wdrożenia”Wdrożenie dostarcza i obsługuje zaplecze OCR oraz wybiera, gdzie obliczany jest OCR (w procesie, w lokalnym komponencie sidecar czy w usłudze zdalnej) — a zatem gdzie obliczane i przechowywane są obrazy dokumentów oraz rozpoznany tekst. NextPDF Enterprise orkiestruje przepływ pracy i tworzy metadane wyniku; nie osadza modelu OCR ani nie gwarantuje dokładności rozpoznawania czy kompletności wyodrębniania.
Granica zgodności prawnej
Dział zatytułowany „Granica zgodności prawnej”Do powierzchni Intelligence nie stosuje się żadne ograniczenie kontroli eksportu. Biblioteka nie deklaruje żadnej gwarancji dokładności OCR ani kompletności wyodrębniania, a także żadnego stanu zgodności regulacyjnej. Ta dokumentacja nie jest opinią prawną; skonsultuj się z własnymi doradcami ds. zgodności i prawnymi.
Zobacz także
Dział zatytułowany „Zobacz także”- Referencja Intelligence — pełna referencja API tej funkcji.
- Pro extraction — strukturalne bloki cytowań oparte na AST.
- Privacy — wykrywanie danych osobowych w wyodrębnionym tekście.
- NextPDF Enterprise — pełna powierzchnia funkcji Enterprise.
- Core AST — model sparsowanego dokumentu.
- Tagged PDF · OCR · Searchable PDF — terminy glosariusza.