Lewati ke konten
getnextpdf.com

Enterprise edisi

Intelligence

NextPDF Enterprise Intelligence mengonversi data key-value dan tabel mentah menjadi struktur bertipe yang secara opsional tervalidasi-skema, dan mengorkestrasi pembuatan PDF yang dapat dicari dengan menggerakkan backend OCR atas halaman hasil pindaian. Modul ini mendeskripsikan struktur yang dihasilkannya; ia tidak menyatakan akurasi OCR atau recall ekstraksi.

Kapabilitas ini disertakan dalam NextPDF Enterprise (nextpdf/enterprise) dan aktif dengan amplop lisensi tingkat Enterprise. Penerapan tanpa hak akses tersebut tidak memuat kelas-kelas kapabilitas ini. Penerapan tanpa hak akses Enterprise yang aktif tidak memuat kelas-kelas ini. Bandingkan edisi dan dapatkan lisensi.

Terminal window
composer require nextpdf/enterprise:^3

Ekstraktor terstruktur mengambil pasangan key-value mentah — yang dihasilkan di hulu oleh sebuah accelerator atau parser heuristik — dan menghasilkan objek pasangan bertipe. Ketika sebuah skema disediakan, ekstraktor hanya menyimpan pasangan yang kuncinya cocok dengan suatu bidang skema dan melaporkan bidang wajib mana yang hilang. Pasangan tanpa nilai kepercayaan eksplisit menerima default tetap. Ini adalah langkah pemberian tipe dan validasi atas data yang sudah diekstraksi; langkah ini sendiri bukan mesin ekstraksi atau pengenalan dan tidak menetapkan presisi terhitung apa pun.

Ekstraktor tabel mengambil grid baris mentah dan membangun hasil tabel terstruktur dengan objek per-sel serta bounding box yang disintesis seragam, yang diturunkan dengan membagi suatu area halaman ternormalisasi. Baris pendek diisi padding sehingga setiap baris memiliki jumlah kolom terlebar. Tabel tanpa baris atau tanpa kolom dilewati. Bounding box adalah sintesis grid seragam, bukan tata letak yang terukur.

Orkestrator searchable-overlay menerima PDF hasil pindaian atau campuran, mendeteksi halaman mana yang tidak memiliki lapisan teks yang dapat digunakan, menggerakkan backend OCR yang dikonfigurasi, dan menghasilkan hasil yang mendeskripsikan jumlah kata per halaman serta kepercayaan rata-rata. Teks tak terlihat adalah mekanisme untuk halaman pindaian yang dapat dicari: operator penampil teks dapat menempatkan glif sementara mode render teks disetel sehingga teks tidak diisi maupun digores — ISO 32000-2:2020 §9.3.3 — dan operator penampil teks menempatkan glif dalam content stream — ISO 32000-2:2020 §9.4. Ketika sumbernya bertag, hierarki struktur logis memetakan konten ke urutan baca — ISO 32000-2:2020 §14.7, struktur bertag mendukung penggunaan ulang konten — ISO 32000-2:2020 §14.8, dan elemen struktur tabel mendeskripsikan baris dan sel — ISO 32000-2:2020 §14.8.

Rasterisasi dan injeksi teks tak terlihat yang sebenarnya dilakukan oleh proses sidecar terpisah; permukaan PHP mengorkestrasi alur kerja dan menghasilkan metadata hasil. Keluaran dari proses overlay adalah dokumen turunan: tanda tangan apa pun yang ada menjadi tidak valid dan status kepatuhan memerlukan validasi ulang. Nilai kepercayaan bersifat passthrough atau default tetap, bukan angka akurasi yang dijamin.

Permukaan ini menarik garis tegas antara penstrukturan dan pengenalan. Pemberian tipe dan validasi skema berjalan in-process, karena keduanya deterministik dan murah. Pengenalan — rasterisasi dan injeksi teks tak terlihat — didelegasikan ke backend OCR yang diinjeksikan dan proses sidecar terpisah, karena hal itu berat, spesifik-backend, dan paling baik dijaga di luar batas kepercayaan PHP. Pemisahan itu memungkinkan sebuah penerapan memilih tempat citra dokumen dan teks yang dikenali dihitung dan disimpan, tanpa mengubah kode pemanggil. Modul ini juga menolak mengarang angka presisi: pasangan tanpa label menerima default tetap, dan kepercayaan yang dilaporkan diteruskan alih-alih dihitung. Pemanggil tidak pernah diberi angka akurasi yang direkayasa.

Latar belakang desain: API yang menolak menebak.

TypeKindRoleStabilitySince
StructuredExtractorclassMemberi tipe pada pasangan key-value mentah; filter skema dan pemeriksaan bidang wajibstable2.2.0
ExtractionSchema / SchemaFieldclassesDefinisi bidang dan himpunan bidang wajibstable2.2.0
KeyValuePairclassSatu pasangan key-value bertipe dengan kepercayaanstable2.2.0
TableExtractorclassMembangun tabel terstruktur dari grid baris mentahstable2.2.0
TableResult / TableCellclassesBentuk tabel dengan teks, kepercayaan, dan bounding box per-selstable2.2.0
SearchableOverlayclassMengorkestrasi pembuatan PDF yang dapat dicari berbasis OCRstable2.2.0
OverlayConfig / OverlayQualityclassesPetunjuk bahasa, DPI, preset kualitas, lewati halaman nativestable2.2.0
SearchableOverlayResult / PageOverlayInfoclassesJumlah kata per halaman dan kepercayaan rata-ratastable2.2.0
ExtractionConfig / ExtractionStrategyclassesStrategi heuristik vs berbantuan OCR dan petunjuk OCRstable2.2.0

Backend OCR adalah kontrak yang diinjeksikan. Orkestrator tidak menyematkan model OCR; sebuah penerapan menyediakan backend dan bertanggung jawab atas tempat OCR dihitung.

Type and schema-validate raw key-value pairs
<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Intelligence\StructuredExtractor;
use NextPDF\Enterprise\Intelligence\ExtractionSchema;
/**
* Type raw pairs against a schema and list any missing required fields.
*
* @param list<array{key: string, value: string, confidence?: float}> $rawPairs Upstream key-value data.
*
* @return list<string> Missing required field names (empty when compliant).
*/
function validate(array $rawPairs, ExtractionSchema $schema): array
{
$extractor = new StructuredExtractor();
$pairs = $extractor->extract($rawPairs, $schema);
return $extractor->validateSchema($schema, $pairs);
}

Ekstraktor memberi tipe dan memfilter data yang sudah dihasilkan oleh langkah hulu. Ekstraktor tidak melakukan pengenalan apa pun sendiri.

Searchable-overlay orchestration with safe logging
<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Accelerator\OcrStrategyInterface;
use NextPDF\Enterprise\Intelligence\OverlayConfig;
use NextPDF\Enterprise\Intelligence\SearchableOverlay;
use Psr\Log\LoggerInterface;
final readonly class OverlayJob
{
public function __construct(
private OcrStrategyInterface $ocr,
private LoggerInterface $logger,
) {}
/**
* Generate a searchable PDF from a scanned input.
*
* @param string $pdfData Scanned or mixed PDF bytes.
*
* @return string The derived searchable PDF bytes.
*/
public function run(string $pdfData): string
{
try {
$result = (new SearchableOverlay($this->ocr))
->generate($pdfData, new OverlayConfig(language: 'eng'));
$this->logger->info('Overlay complete', [
'pages' => $result->pageCount,
'words' => $result->wordCount,
]);
return $result->pdfData;
} catch (\Throwable $e) {
$this->logger->error('Overlay failed', ['error' => $e->getMessage()]);
throw $e;
}
}
}

Log hanya membawa jumlah halaman dan kata. Log tidak membawa teks yang dikenali atau byte dokumen. Blok catch melempar ulang; ia tidak menelan kegagalan.

  • Ekstraktor terstruktur dan tabel mengonsumsi data yang sudah diekstraksi. Keduanya tidak mengurai PDF, menjalankan model, atau mengukur presisi. Kepercayaan bersifat passthrough atau default tetap.
  • Bounding box tabel yang disintesis adalah pembagian grid seragam, bukan tata letak terukur. Pemanggil yang membutuhkan geometri sebenarnya harus memperolehnya di tempat lain.
  • Searchable overlay adalah dokumen turunan. Tanda tangan digital apa pun yang ada menjadi tidak valid; status kepatuhan harus divalidasi ulang setelah overlay.
  • Ketika backend OCR tidak tersedia, halaman yang terdampak menyumbang nol kata alih-alih menggagalkan seluruh proses secara diam-diam — periksa hasil per-halaman.
  • Halaman yang sudah memiliki lapisan teks native yang dapat digunakan dilewati secara default. Nonaktifkan pelewatan dalam konfigurasi jika Anda harus melakukan OCR ulang.
  • Akurasi OCR sepenuhnya bergantung pada backend yang disediakan, kualitas masukan, dan petunjuk bahasa. NextPDF tidak menyatakan akurasi pengenalan atau recall ekstraksi.

Ekstraksi terstruktur dan tabel bersifat linear terhadap ukuran masukan. Biaya searchable-overlay didominasi oleh backend OCR dan rasterisasi sidecar pada DPI yang dikonfigurasi; overhead orkestrasi kecil. Masukan halaman dan ukuran dibatasi serta gagal-tertutup saat overflow. Profil reproduksibilitasnya adalah structural: ekstraksi bersifat deterministik untuk masukan tetap, sedangkan keluaran overlay bergantung pada backend OCR dan dapat bervariasi antarbackend atau antarversi.

Ekstraktor adalah langkah penstrukturan hanya-baca. Permukaan overlay menghasilkan dokumen turunan serta membatasi ukuran masukan dan jumlah halaman, gagal-tertutup saat overflow. Backend OCR adalah titik integrasi, bukan bagian dari batas kepercayaan; sebuah penerapan memilih dan mengoperasikannya. Tidak ada operasi kriptografis dalam modul ini, sehingga modul ini tidak membuat klaim FIPS.

Ekstraksi terstruktur dan tabel berjalan in-process di host. Orkestrasi searchable-overlay menggerakkan backend OCR yang diinjeksikan: tempat backend itu berjalan — in-process, sidecar lokal, atau layanan jarak jauh — dan karena itu tempat citra dokumen dan teks yang dikenali dihitung serta disimpan, adalah tanggung jawab penerapan di luar batas pustaka. Jika masukan memuat data pribadi, lapisan teks yang dikenali juga akan memuatnya; perlakukan dokumen turunan sesuai itu.

Pustaka melempar pengecualian bertipe dengan pesan struktural dan tidak menempatkan byte dokumen atau teks yang dikenali ke dalam teks pengecualian. Penerapan yang mencatat log di sekitar permukaan ini sebaiknya mencatat jumlah dan konfigurasi — seperti pada contoh produksi — dan tidak boleh mencatat payload PDF mentah atau teks yang dikenali ke log atau backend APM.

Tidak ada operasi kriptografis dalam modul ini, sehingga tidak ada perilaku khusus mode FIPS.

ClaimStandardClause
Mode render teks mengontrol apakah glif diisi, digores, atau tidak keduanya (dasar bagi teks OCR tak terlihat).ISO 32000-2:2020§9.3.3
Operator penampil teks menempatkan glif dalam content stream.ISO 32000-2:2020§9.4
Hierarki struktur logis memetakan konten ke urutan baca.ISO 32000-2:2020§14.7
Struktur bertag mendukung penggunaan ulang konten.ISO 32000-2:2020§14.8
Elemen struktur tabel mendeskripsikan baris dan sel.ISO 32000-2:2020§14.8
Pohon struktur memetakan konten ke urutan baca.ISO 32000-2:2020§14.7

Semua klausa diparafrasekan. NextPDF tidak mereproduksi teks normatif. Rujuk standar yang diterbitkan untuk redaksi otoritatifnya. NextPDF tidak membuat klaim akurasi OCR atau recall ekstraksi; halaman ini menyatakan struktur yang dihasilkan dan batas orkestrasi, bukan jaminan kualitas.

  • Ekstraktor terstruktur dan tabel mengonsumsi data yang sudah diekstraksi; keduanya tidak mengurai PDF, menjalankan model, atau mengukur presisi. Kepercayaan bersifat passthrough atau default tetap.
  • Filter skema hanya menyimpan pasangan yang kuncinya cocok dengan suatu bidang skema dan melaporkan bidang wajib yang hilang; bounding box tabel yang disintesis adalah pembagian grid seragam, bukan tata letak terukur.
  • Searchable overlay adalah dokumen turunan: tanda tangan digital apa pun yang ada menjadi tidak valid dan status kepatuhan harus divalidasi ulang.
  • Ketika backend OCR tidak tersedia, halaman yang terdampak menyumbang nol kata alih-alih menggagalkan seluruh proses secara diam-diam; halaman dengan lapisan teks native yang dapat digunakan dilewati secara default.
  • Masukan halaman dan ukuran dibatasi serta gagal-tertutup saat overflow. Ekstraksi bersifat deterministik untuk masukan tetap; keluaran overlay bergantung pada backend OCR yang disediakan.

Halaman ini hanya mendokumentasikan perilaku yang dapat diamati dari luar dan permukaan API publik yang didukung. Jalur namespace internal, kelas pembantu, tabel mekanisme, nama berkas runbook, dan prefiks tiket berada di luar cakupan.

NextPDF Core (Apache-2.0) tidak memiliki orkestrasi searchable-overlay dan tidak memiliki permukaan penstrukturan tervalidasi-skema — tidak ada sama sekali; kapabilitas ini tidak memiliki padanan tingkat Core. Model AST Core adalah basis dokumen terurai, bukan permukaan ekstraksi atau OCR.

NextPDF Pro menyertakan ekstraksi struktural berbasis AST atas dokumen yang sudah diurai; ia tidak menyediakan penstrukturan key-value tervalidasi-skema, rekonstruksi tabel dari grid mentah, atau orkestrasi searchable-overlay berbasis OCR. Semua itu hanya tersedia dalam paket nextpdf/enterprise.

Ekstraktor terstruktur/tabel dan orkestrator overlay dideskripsikan pada tingkat perilaku. Rasterisasi dan injeksi teks tak terlihat yang sebenarnya berjalan dalam proses sidecar terpisah; detail internal sidecar, model OCR, dan detail orkestrasi internal apa pun berada di luar cakupan permukaan publik. Backend OCR adalah kontrak yang diinjeksikan yang disediakan oleh penerapan.

Penerapan menyediakan dan mengoperasikan backend OCR serta memilih tempat OCR dihitung (in-process, sidecar lokal, atau layanan jarak jauh) — dan karena itu tempat citra dokumen serta teks yang dikenali dihitung dan disimpan. NextPDF Enterprise mengorkestrasi alur kerja dan menghasilkan metadata hasil; ia tidak menyematkan model OCR atau menjamin akurasi pengenalan maupun recall ekstraksi.

Tidak ada pembatasan kontrol ekspor yang berlaku untuk permukaan Intelligence. Pustaka tidak menyatakan jaminan akurasi OCR atau recall ekstraksi dan tidak menyatakan status kepatuhan regulasi. Dokumentasi ini bukan opini hukum; konsultasikan dengan penasihat kepatuhan dan hukum Anda sendiri.