Przejdź do głównej zawartości
getnextpdf.com

Enterprise edycja

Intelligence

NextPDF Enterprise Intelligence przekształca surowe dane klucz-wartość i tabelaryczne w typowane, opcjonalnie walidowane wobec schematu struktury oraz orkiestruje tworzenie przeszukiwalnych plików PDF, sterując zapleczem OCR na zeskanowanych stronach. Opisuje struktury, które tworzy; nie deklaruje dokładności OCR ani kompletności wyodrębniania.

Ta funkcja jest dostarczana w NextPDF Enterprise (nextpdf/enterprise) i aktywuje się wraz z kopertą licencyjną w warstwie Enterprise. Wdrożenie bez tego uprawnienia nie ładuje klas tej funkcji. Wdrożenie bez aktywnego uprawnienia Enterprise nie ładuje tych klas. Porównaj edycje i uzyskaj licencję.

Okno terminala
composer require nextpdf/enterprise:^3

Ekstraktor strukturalny przyjmuje surowe pary klucz-wartość — utworzone wcześniej przez akcelerator lub parser heurystyczny — i emituje typowane obiekty par. Gdy dostarczono schemat, zachowuje tylko te pary, których klucz odpowiada polu schematu, i zgłasza, których pól wymaganych brakuje. Para bez jawnej pewności otrzymuje stałą wartość domyślną. Jest to krok typowania i walidacji nad danymi, które są już wyodrębnione; sam nie jest silnikiem wyodrębniania ani rozpoznawania i nie przypisuje obliczonej precyzji.

Ekstraktor tabel przyjmuje surowe siatki wierszy i buduje ustrukturyzowane wyniki tabel z obiektami dla każdej komórki oraz zsyntetyzowanymi, jednolitymi prostokątami otaczającymi, wyprowadzonymi przez podział znormalizowanego obszaru strony. Krótkie wiersze są dopełniane, aby każdy wiersz miał liczbę kolumn najszerszego z nich. Tabela bez wierszy lub bez kolumn jest pomijana. Prostokąty otaczające to synteza jednolitej siatki, a nie zmierzony układ.

Orkiestrator przeszukiwalnej nakładki przyjmuje zeskanowany lub mieszany plik PDF, wykrywa, które strony nie mają użytecznej warstwy tekstu, steruje skonfigurowanym zapleczem OCR i tworzy wynik opisujący liczbę słów na każdej stronie oraz średnią pewność. Niewidoczny tekst to mechanizm przeszukiwalnej zeskanowanej strony: operator pokazywania tekstu może umieścić glify, gdy tryb renderowania tekstu jest ustawiony tak, że tekst nie jest ani wypełniany, ani obrysowywany — ISO 32000-2:2020 §9.3.3 — a operatory pokazywania tekstu umieszczają glify w strumieniu treści — ISO 32000-2:2020 §9.4. Gdy źródło jest oznaczone znacznikami, hierarchia struktury logicznej mapuje treść na kolejność odczytu — ISO 32000-2:2020 §14.7, struktura oznaczona znacznikami wspiera ponowne wykorzystanie treści — ISO 32000-2:2020 §14.8, a elementy struktury tabeli opisują wiersze i komórki — ISO 32000-2:2020 §14.8.

Faktyczna rasteryzacja i wstrzykiwanie niewidocznego tekstu są wykonywane przez oddzielny proces typu sidecar; powierzchnia PHP orkiestruje przepływ pracy i tworzy metadane wyniku. Wynik przebiegu nakładki to dokument pochodny: każdy istniejący podpis zostaje unieważniony, a stan zgodności wymaga ponownej walidacji. Wartości pewności są przekazywane bez zmian lub są stałymi wartościami domyślnymi, a nie gwarantowaną miarą dokładności.

Powierzchnia wyznacza wyraźną granicę między strukturyzowaniem a rozpoznawaniem. Typowanie i walidacja wobec schematu działają w procesie, ponieważ są deterministyczne i tanie. Rozpoznawanie — rasteryzacja i wstrzykiwanie niewidocznego tekstu — jest delegowane do wstrzykiwanego zaplecza OCR oraz oddzielnego komponentu sidecar, ponieważ jest ciężkie, zależne od zaplecza i najlepiej trzymać je poza granicą zaufania PHP. Ten podział pozwala wdrożeniu wybrać, gdzie obliczane i przechowywane są obrazy dokumentów oraz rozpoznany tekst, bez zmiany kodu wywołującego. Moduł odmawia też wymyślania wartości precyzji: nieoznaczona para otrzymuje stałą wartość domyślną, a zgłaszana pewność jest przekazywana, a nie obliczana. Wywołujący nigdy nie otrzymuje sfabrykowanej liczby dokładności.

Tło projektowe: API, które odmawia zgadywania.

TypRodzajRolaStabilnośćOd wersji
StructuredExtractorklasaTypuje surowe pary klucz-wartość; filtr schematu i kontrola pól wymaganychstabilny2.2.0
ExtractionSchema / SchemaFieldklasyDefinicje pól i zbiór pól wymaganychstabilny2.2.0
KeyValuePairklasaJedna typowana para klucz-wartość z pewnościąstabilny2.2.0
TableExtractorklasaBuduje ustrukturyzowane tabele z surowych siatek wierszystabilny2.2.0
TableResult / TableCellklasyKształt tabeli z tekstem, pewnością i prostokątem otaczającym dla każdej komórkistabilny2.2.0
SearchableOverlayklasaOrkiestruje tworzenie przeszukiwalnego PDF opartego na OCRstabilny2.2.0
OverlayConfig / OverlayQualityklasyWskazówka językowa, DPI, gotowy zestaw jakości, pomijanie stron natywnychstabilny2.2.0
SearchableOverlayResult / PageOverlayInfoklasyLiczba słów na każdej stronie i średnia pewnośćstabilny2.2.0
ExtractionConfig / ExtractionStrategyklasyStrategia heurystyczna lub wspomagana OCR oraz wskazówki OCRstabilny2.2.0

Zaplecze OCR to wstrzykiwany kontrakt. Orkiestrator nie osadza modelu OCR; wdrożenie dostarcza zaplecze i odpowiada za to, gdzie obliczany jest OCR.

Type and schema-validate raw key-value pairs
<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Intelligence\StructuredExtractor;
use NextPDF\Enterprise\Intelligence\ExtractionSchema;
/**
* Type raw pairs against a schema and list any missing required fields.
*
* @param list<array{key: string, value: string, confidence?: float}> $rawPairs Upstream key-value data.
*
* @return list<string> Missing required field names (empty when compliant).
*/
function validate(array $rawPairs, ExtractionSchema $schema): array
{
$extractor = new StructuredExtractor();
$pairs = $extractor->extract($rawPairs, $schema);
return $extractor->validateSchema($schema, $pairs);
}

Ekstraktor typuje i filtruje dane, które wcześniejszy krok już utworzył. Sam nie wykonuje żadnego rozpoznawania.

Searchable-overlay orchestration with safe logging
<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Accelerator\OcrStrategyInterface;
use NextPDF\Enterprise\Intelligence\OverlayConfig;
use NextPDF\Enterprise\Intelligence\SearchableOverlay;
use Psr\Log\LoggerInterface;
final readonly class OverlayJob
{
public function __construct(
private OcrStrategyInterface $ocr,
private LoggerInterface $logger,
) {}
/**
* Generate a searchable PDF from a scanned input.
*
* @param string $pdfData Scanned or mixed PDF bytes.
*
* @return string The derived searchable PDF bytes.
*/
public function run(string $pdfData): string
{
try {
$result = (new SearchableOverlay($this->ocr))
->generate($pdfData, new OverlayConfig(language: 'eng'));
$this->logger->info('Overlay complete', [
'pages' => $result->pageCount,
'words' => $result->wordCount,
]);
return $result->pdfData;
} catch (\Throwable $e) {
$this->logger->error('Overlay failed', ['error' => $e->getMessage()]);
throw $e;
}
}
}

Log zawiera wyłącznie liczbę stron i słów. Nie zawiera rozpoznanego tekstu ani bajtów dokumentu. Blok catch ponownie zgłasza wyjątek; nie tłumi błędu.

  • Ekstraktory strukturalny i tabel konsumują już wyodrębnione dane. Nie parsują PDF, nie uruchamiają modelu ani nie mierzą precyzji. Pewność jest przekazywana bez zmian lub jest stałą wartością domyślną.
  • Zsyntetyzowane prostokąty otaczające tabel to podział jednolitej siatki, a nie zmierzony układ. Wywołujący, który potrzebuje prawdziwej geometrii, musi pozyskać ją z innego źródła.
  • Przeszukiwalna nakładka to dokument pochodny. Każdy istniejący podpis cyfrowy zostaje unieważniony; stan zgodności należy ponownie zwalidować po utworzeniu nakładki.
  • Gdy zaplecze OCR jest niedostępne, dotknięte strony wnoszą zero słów, zamiast po cichu kończyć cały przebieg niepowodzeniem — sprawdź wynik dla każdej strony.
  • Strona, która ma już użyteczną natywną warstwę tekstu, jest domyślnie pomijana. Wyłącz pomijanie w konfiguracji, jeśli musisz wykonać ponowny OCR.
  • Dokładność OCR zależy w całości od dostarczonego zaplecza, jakości danych wejściowych oraz wskazówki językowej. NextPDF nie deklaruje dokładności rozpoznawania ani kompletności wyodrębniania.

Wyodrębnianie strukturalne i tabelaryczne jest liniowe względem rozmiaru danych wejściowych. Koszt przeszukiwalnej nakładki jest zdominowany przez zaplecze OCR i rasteryzację komponentu sidecar przy skonfigurowanym DPI; narzut orkiestracji jest niewielki. Wejścia dotyczące liczby stron i rozmiaru są ograniczone i kończą się w trybie fail-closed przy przepełnieniu. Profil odtwarzalności to structural: wyodrębnianie jest deterministyczne dla ustalonego wejścia, podczas gdy wynik nakładki zależy od zaplecza OCR i może się różnić między zapleczami lub wersjami.

Ekstraktory to kroki strukturyzowania tylko do odczytu. Powierzchnia nakładki tworzy dokument pochodny oraz ogranicza rozmiar danych wejściowych i liczbę stron, kończąc w trybie fail-closed przy przepełnieniu. Zaplecze OCR to punkt integracji, a nie część granicy zaufania; wdrożenie je wybiera i obsługuje. W tym module nie zachodzi żadna operacja kryptograficzna, więc nie wysuwa on żadnej deklaracji FIPS.

Rezydencja danych i środki ograniczające dla danych osobowych

Dział zatytułowany „Rezydencja danych i środki ograniczające dla danych osobowych”

Wyodrębnianie strukturalne i tabelaryczne działa w procesie na hoście. Orkiestracja przeszukiwalnej nakładki steruje wstrzykiwanym zapleczem OCR: to, gdzie to zaplecze działa — w procesie, w lokalnym komponencie sidecar czy w usłudze zdalnej — a zatem gdzie obliczane i przechowywane są obrazy dokumentów oraz rozpoznany tekst, jest odpowiedzialnością wdrożenia, poza granicą biblioteki. Jeśli dane wejściowe zawierają dane osobowe, będzie je zawierać także rozpoznana warstwa tekstu; traktuj dokument pochodny odpowiednio.

Biblioteka zgłasza typowane wyjątki ze strukturalnymi komunikatami i nie umieszcza bajtów dokumentu ani rozpoznanego tekstu w treści wyjątku. Wdrożenie, które prowadzi logowanie wokół tej powierzchni, powinno logować liczby i konfigurację — jak pokazano w przykładzie produkcyjnym — i nie może logować surowego ładunku PDF ani rozpoznanego tekstu do logów ani do zaplecza APM.

W tym module nie zachodzi żadna operacja kryptograficzna, więc nie ma zachowania specyficznego dla trybu FIPS.

DeklaracjaStandardKlauzula
Tryb renderowania tekstu decyduje, czy glify są wypełniane, obrysowywane, czy żadne z tych (podstawa niewidocznego tekstu OCR).ISO 32000-2:2020§9.3.3
Operatory pokazywania tekstu umieszczają glify w strumieniu treści.ISO 32000-2:2020§9.4
Hierarchia struktury logicznej mapuje treść na kolejność odczytu.ISO 32000-2:2020§14.7
Struktura oznaczona znacznikami wspiera ponowne wykorzystanie treści.ISO 32000-2:2020§14.8
Elementy struktury tabeli opisują wiersze i komórki.ISO 32000-2:2020§14.8
Drzewo struktury mapuje treść na kolejność odczytu.ISO 32000-2:2020§14.7

Wszystkie klauzule są parafrazowane. NextPDF nie odtwarza tekstu normatywnego. Po wiążące brzmienie sięgnij do opublikowanego standardu. NextPDF nie wysuwa żadnej deklaracji dotyczącej dokładności OCR ani kompletności wyodrębniania; ta strona podaje tworzone struktury oraz granicę orkiestracji, a nie gwarancję jakości.

  • Ekstraktory strukturalny i tabel konsumują już wyodrębnione dane; nie parsują PDF, nie uruchamiają modelu ani nie mierzą precyzji. Pewność jest przekazywana bez zmian lub jest stałą wartością domyślną.
  • Filtr schematu zachowuje tylko te pary, których klucz odpowiada polu schematu, i zgłasza brakujące pola wymagane; zsyntetyzowane prostokąty otaczające tabel to podział jednolitej siatki, a nie zmierzony układ.
  • Przeszukiwalna nakładka to dokument pochodny: każdy istniejący podpis cyfrowy zostaje unieważniony, a stan zgodności należy ponownie zwalidować.
  • Gdy zaplecze OCR jest niedostępne, dotknięte strony wnoszą zero słów, zamiast po cichu kończyć cały przebieg niepowodzeniem; strona z użyteczną natywną warstwą tekstu jest domyślnie pomijana.
  • Wejścia dotyczące liczby stron i rozmiaru są ograniczone i kończą w trybie fail-closed przy przepełnieniu. Wyodrębnianie jest deterministyczne dla ustalonego wejścia; wynik nakładki zależy od dostarczonego zaplecza OCR.

Ta strona dokumentuje wyłącznie obserwowalne z zewnątrz zachowanie oraz obsługiwaną publiczną powierzchnię API. Wewnętrzne ścieżki przestrzeni nazw, klasy pomocnicze, tabele mechanizmów, nazwy plików runbooków oraz prefiksy zgłoszeń są poza zakresem.

NextPDF Core (Apache-2.0) nie ma orkiestracji przeszukiwalnej nakładki ani powierzchni strukturyzowania walidowanego wobec schematu — żadnej; ta możliwość nie ma odpowiednika na poziomie Core. Model AST Core to baza sparsowanego dokumentu, a nie powierzchnia wyodrębniania ani OCR.

NextPDF Pro dostarcza strukturalne wyodrębnianie oparte na AST nad już sparsowanym dokumentem; nie zapewnia walidowanego wobec schematu strukturyzowania danych klucz-wartość, rekonstrukcji tabel z surowych siatek ani orkiestracji przeszukiwalnej nakładki opartej na OCR. Te są dostarczane wyłącznie w pakiecie nextpdf/enterprise.

Ekstraktory strukturalny/tabel oraz orkiestrator nakładki są opisane na poziomie zachowania. Faktyczna rasteryzacja i wstrzykiwanie niewidocznego tekstu działają w oddzielnym procesie typu sidecar; wewnętrzne mechanizmy komponentu sidecar, model OCR oraz wszelkie wewnętrzne szczegóły orkiestracji są poza zakresem powierzchni publicznej. Zaplecze OCR to wstrzykiwany kontrakt dostarczany przez wdrożenie.

Wdrożenie dostarcza i obsługuje zaplecze OCR oraz wybiera, gdzie obliczany jest OCR (w procesie, w lokalnym komponencie sidecar czy w usłudze zdalnej) — a zatem gdzie obliczane i przechowywane są obrazy dokumentów oraz rozpoznany tekst. NextPDF Enterprise orkiestruje przepływ pracy i tworzy metadane wyniku; nie osadza modelu OCR ani nie gwarantuje dokładności rozpoznawania czy kompletności wyodrębniania.

Do powierzchni Intelligence nie stosuje się żadne ograniczenie kontroli eksportu. Biblioteka nie deklaruje żadnej gwarancji dokładności OCR ani kompletności wyodrębniania, a także żadnego stanu zgodności regulacyjnej. Ta dokumentacja nie jest opinią prawną; skonsultuj się z własnymi doradcami ds. zgodności i prawnymi.