ข้ามไปยังเนื้อหา
getnextpdf.com

Enterprise รุ่น

ระบบอัจฉริยะ

NextPDF Enterprise Intelligence แปลงข้อมูล key-value และตารางแบบดิบให้เป็นโครงสร้างที่มีชนิดและตรวจสอบตามสคีมาได้ตามต้องการ และประสานการสร้าง PDF ที่ค้นหาได้โดยขับเคลื่อนแบ็กเอนด์ OCR ทับหน้าที่สแกนมา โมดูลนี้อธิบายโครงสร้างที่ตนสร้างขึ้น แต่ไม่ได้ยืนยันความแม่นยำของ OCR หรือ recall ของการสกัดข้อมูล

ความสามารถนี้จัดส่งใน NextPDF Enterprise (nextpdf/enterprise) และเปิดใช้งานด้วย license envelope ระดับ Enterprise การปรับใช้ที่ไม่มีสิทธิ์นั้นจะไม่โหลดคลาสของความสามารถนี้ การปรับใช้ที่ไม่มีสิทธิ์ Enterprise ที่ใช้งานอยู่จะไม่โหลดคลาสเหล่านี้ เปรียบเทียบรุ่นและรับใบอนุญาต

Terminal window
composer require nextpdf/enterprise:^3

ตัวสกัดข้อมูลแบบมีโครงสร้างรับคู่ key-value แบบดิบ ซึ่งสร้างขึ้นต้นน้ำโดย accelerator หรือตัวแยกวิเคราะห์เชิงฮิวริสติก แล้วส่งออกอ็อบเจกต์คู่ที่มีชนิด เมื่อมีการระบุสคีมา ตัวสกัดจะคงไว้เฉพาะคู่ที่ key ตรงกับฟิลด์ของสคีมา และรายงานว่าฟิลด์ที่จำเป็นใดขาดหายไป คู่ที่ไม่มีค่าความเชื่อมั่นชัดเจนจะได้รับค่าเริ่มต้นแบบคงที่ นี่เป็นขั้นตอนการกำหนดชนิดและการตรวจสอบเหนือข้อมูลที่ถูกสกัดมาแล้ว มันไม่ใช่เอนจินการสกัดหรือการรู้จำในตัวเอง และไม่ได้กำหนดค่าความแม่นยำที่คำนวณขึ้น

ตัวสกัดตารางรับกริดแถวแบบดิบและสร้างผลลัพธ์ตารางแบบมีโครงสร้างพร้อมอ็อบเจกต์ต่อเซลล์ และ bounding box ที่สังเคราะห์ขึ้นอย่างสม่ำเสมอซึ่งได้มาจากการแบ่งย่อยพื้นที่หน้าที่ทำให้เป็นรูปแบบมาตรฐาน แถวที่สั้นจะถูกเติมให้เต็มเพื่อให้ทุกแถวมีจำนวนคอลัมน์ที่กว้างที่สุด ตารางที่ไม่มีแถวหรือไม่มีคอลัมน์จะถูกข้าม bounding box เป็นการสังเคราะห์กริดอย่างสม่ำเสมอ ไม่ใช่เค้าโครงที่วัดได้

ตัวประสานการซ้อนชั้นที่ค้นหาได้รับ PDF ที่สแกนมาหรือแบบผสม ตรวจหาว่าหน้าใดขาดชั้นข้อความที่ใช้งานได้ ขับเคลื่อนแบ็กเอนด์ OCR ที่กำหนดค่าไว้ และสร้างผลลัพธ์ที่อธิบายจำนวนคำต่อหน้าและค่าความเชื่อมั่นเฉลี่ย ข้อความที่มองไม่เห็นคือกลไกของหน้าที่สแกนมาแล้วค้นหาได้ คือ text-showing operator สามารถวางสัญลักษณ์ได้ในขณะที่ text rendering mode ถูกตั้งค่าให้ข้อความไม่ถูกเติมและไม่ถูกตีเส้น — ISO 32000-2:2020 §9.3.3 — และ text-showing operator วางสัญลักษณ์ในกระแสเนื้อหา — ISO 32000-2:2020 §9.4 เมื่อแหล่งที่มามีการกำกับโครงสร้าง ลำดับชั้นของโครงสร้างเชิงตรรกะจะแมปเนื้อหาไปยังลำดับการอ่าน — ISO 32000-2:2020 §14.7 โครงสร้างที่กำกับไว้รองรับการนำเนื้อหากลับมาใช้ซ้ำ — ISO 32000-2:2020 §14.8 และอิลิเมนต์โครงสร้างตารางอธิบายแถวและเซลล์ — ISO 32000-2:2020 §14.8

การแรสเตอร์ไรซ์จริงและการแทรกข้อความที่มองไม่เห็นดำเนินการโดยกระบวนการ sidecar แยกต่างหาก พื้นผิว PHP ประสานเวิร์กโฟลว์และสร้างข้อมูลเมตาของผลลัพธ์ ผลลัพธ์ของการรันการซ้อนชั้นคือเอกสารที่สืบทอดมา คือ ลายเซ็นเดิมใด ๆ จะถูกทำให้เป็นโมฆะ และสถานะการปฏิบัติตามข้อกำหนดต้องตรวจสอบใหม่ ค่าความเชื่อมั่นเป็นค่าที่ส่งผ่านมาหรือค่าเริ่มต้นแบบคงที่ ไม่ใช่ตัวเลขความแม่นยำที่รับประกัน

พื้นผิวนี้ขีดเส้นแบ่งชัดเจนระหว่างการจัดโครงสร้างและการรู้จำ การกำหนดชนิดและการตรวจสอบตามสคีมาทำงานในกระบวนการ เพราะเป็นแบบกำหนดได้แน่นอนและต้นทุนต่ำ ส่วนการรู้จำ ได้แก่ การแรสเตอร์ไรซ์และการแทรกข้อความที่มองไม่เห็น ถูกมอบหมายให้แบ็กเอนด์ OCR ที่ถูกฉีดเข้ามาและ sidecar แยกต่างหาก เพราะมันหนัก ขึ้นกับแบ็กเอนด์ และควรเก็บไว้นอกขอบเขตความเชื่อถือของ PHP การแยกนี้ทำให้การปรับใช้เลือกได้ว่าจะคำนวณและจัดเก็บรูปภาพเอกสารและข้อความที่รู้จำได้ที่ใด โดยไม่ต้องเปลี่ยนโค้ดที่เรียกใช้ โมดูลยังปฏิเสธที่จะสร้างตัวเลขความแม่นยำขึ้นมาเอง คือ คู่ที่ไม่มีป้ายกำกับจะได้รับค่าเริ่มต้นแบบคงที่ และค่าความเชื่อมั่นที่รายงานเป็นค่าที่ส่งผ่านมามากกว่าที่คำนวณขึ้น ผู้เรียกใช้จะไม่ได้รับตัวเลขความแม่นยำที่ถูกกุขึ้นเลย

ภูมิหลังการออกแบบ: API ที่ปฏิเสธการเดา

TypeKindRoleStabilitySince
StructuredExtractorclassกำหนดชนิดให้คู่ key-value แบบดิบ พร้อมตัวกรองสคีมาและการตรวจสอบฟิลด์ที่จำเป็นstable2.2.0
ExtractionSchema / SchemaFieldclassesคำนิยามฟิลด์และชุดฟิลด์ที่จำเป็นstable2.2.0
KeyValuePairclassคู่ key-value ที่มีชนิดหนึ่งคู่พร้อมค่าความเชื่อมั่นstable2.2.0
TableExtractorclassสร้างตารางแบบมีโครงสร้างจากกริดแถวดิบstable2.2.0
TableResult / TableCellclassesรูปทรงของตารางพร้อมข้อความ ค่าความเชื่อมั่น และ bounding box ต่อเซลล์stable2.2.0
SearchableOverlayclassประสานการสร้าง PDF ที่ค้นหาได้ซึ่งขับเคลื่อนด้วย OCRstable2.2.0
OverlayConfig / OverlayQualityclassesคำใบ้ภาษา DPI ค่าพรีเซ็ตคุณภาพ และการข้ามหน้าแบบ nativestable2.2.0
SearchableOverlayResult / PageOverlayInfoclassesจำนวนคำต่อหน้าและค่าความเชื่อมั่นเฉลี่ยstable2.2.0
ExtractionConfig / ExtractionStrategyclassesกลยุทธ์แบบฮิวริสติกเทียบกับแบบ OCR-assisted และคำใบ้ OCRstable2.2.0

แบ็กเอนด์ OCR เป็นสัญญาที่ถูกฉีดเข้ามา ตัวประสานไม่ได้ฝังโมเดล OCR ไว้ การปรับใช้เป็นผู้จัดหาแบ็กเอนด์และรับผิดชอบว่าจะคำนวณ OCR ที่ใด

Type and schema-validate raw key-value pairs
<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Intelligence\StructuredExtractor;
use NextPDF\Enterprise\Intelligence\ExtractionSchema;
/**
* Type raw pairs against a schema and list any missing required fields.
*
* @param list<array{key: string, value: string, confidence?: float}> $rawPairs Upstream key-value data.
*
* @return list<string> Missing required field names (empty when compliant).
*/
function validate(array $rawPairs, ExtractionSchema $schema): array
{
$extractor = new StructuredExtractor();
$pairs = $extractor->extract($rawPairs, $schema);
return $extractor->validateSchema($schema, $pairs);
}

ตัวสกัดกำหนดชนิดและกรองข้อมูลที่ขั้นตอนต้นน้ำสร้างขึ้นแล้ว มันไม่ได้ทำการรู้จำใด ๆ ด้วยตัวเอง

Searchable-overlay orchestration with safe logging
<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Accelerator\OcrStrategyInterface;
use NextPDF\Enterprise\Intelligence\OverlayConfig;
use NextPDF\Enterprise\Intelligence\SearchableOverlay;
use Psr\Log\LoggerInterface;
final readonly class OverlayJob
{
public function __construct(
private OcrStrategyInterface $ocr,
private LoggerInterface $logger,
) {}
/**
* Generate a searchable PDF from a scanned input.
*
* @param string $pdfData Scanned or mixed PDF bytes.
*
* @return string The derived searchable PDF bytes.
*/
public function run(string $pdfData): string
{
try {
$result = (new SearchableOverlay($this->ocr))
->generate($pdfData, new OverlayConfig(language: 'eng'));
$this->logger->info('Overlay complete', [
'pages' => $result->pageCount,
'words' => $result->wordCount,
]);
return $result->pdfData;
} catch (\Throwable $e) {
$this->logger->error('Overlay failed', ['error' => $e->getMessage()]);
throw $e;
}
}
}

บันทึกพกพาเฉพาะจำนวนหน้าและจำนวนคำเท่านั้น ไม่ได้พกพาข้อความที่รู้จำได้หรือไบต์ของเอกสาร ส่วน catch จะ rethrow มันไม่ได้กลืนความล้มเหลวไว้

  • ตัวสกัดแบบมีโครงสร้างและตัวสกัดตารางใช้ข้อมูลที่ถูกสกัดมาแล้ว มันไม่ได้แยกวิเคราะห์ PDF รันโมเดล หรือวัดความแม่นยำ ค่าความเชื่อมั่นเป็นค่าที่ส่งผ่านมาหรือค่าเริ่มต้นแบบคงที่
  • bounding box ของตารางที่สังเคราะห์ขึ้นเป็นการแบ่งย่อยกริดอย่างสม่ำเสมอ ไม่ใช่เค้าโครงที่วัดได้ ผู้เรียกใช้ที่ต้องการเรขาคณิตจริงต้องไปหามาจากที่อื่น
  • การซ้อนชั้นที่ค้นหาได้คือเอกสารที่สืบทอดมา ลายเซ็นดิจิทัลเดิมใด ๆ จะถูกทำให้เป็นโมฆะ ต้องตรวจสอบสถานะการปฏิบัติตามข้อกำหนดใหม่หลังการซ้อนชั้น
  • เมื่อแบ็กเอนด์ OCR ไม่พร้อมใช้งาน หน้าที่ได้รับผลกระทบจะให้คำเป็นศูนย์แทนที่จะทำให้ทั้งการรันล้มเหลวอย่างเงียบ ๆ ให้ตรวจสอบผลลัพธ์ต่อหน้า
  • หน้าที่มีชั้นข้อความ native ที่ใช้งานได้อยู่แล้วจะถูกข้ามตามค่าเริ่มต้น ปิดการข้ามในการกำหนดค่าหากคุณจำเป็นต้องทำ OCR ซ้ำ
  • ความแม่นยำของ OCR ขึ้นอยู่กับแบ็กเอนด์ที่จัดหา คุณภาพของอินพุต และคำใบ้ภาษาทั้งหมด NextPDF ไม่ได้ยืนยันความแม่นยำในการรู้จำหรือ recall ของการสกัดข้อมูล

การสกัดแบบมีโครงสร้างและการสกัดตารางเป็นแบบเชิงเส้นตามขนาดอินพุต ต้นทุนการซ้อนชั้นที่ค้นหาได้ถูกครอบงำโดยแบ็กเอนด์ OCR และการแรสเตอร์ไรซ์ของ sidecar ที่ DPI ที่กำหนดค่าไว้ ส่วนค่าใช้จ่ายในการประสานนั้นเล็กน้อย อินพุตหน้าและขนาดมีขอบเขตและ fail closed เมื่อล้น โปรไฟล์ความสามารถในการทำซ้ำได้คือ structural คือ การสกัดเป็นแบบกำหนดได้แน่นอนสำหรับอินพุตคงที่ ในขณะที่ผลลัพธ์การซ้อนชั้นขึ้นอยู่กับแบ็กเอนด์ OCR และอาจแตกต่างกันระหว่างแบ็กเอนด์หรือเวอร์ชัน

ตัวสกัดเป็นขั้นตอนการจัดโครงสร้างแบบอ่านอย่างเดียว พื้นผิวการซ้อนชั้นสร้างเอกสารที่สืบทอดมาและจำกัดขอบเขตขนาดอินพุตและจำนวนหน้า โดย fail closed เมื่อล้น แบ็กเอนด์ OCR เป็นจุดผสานการทำงาน ไม่ใช่ส่วนหนึ่งของขอบเขตความเชื่อถือ การปรับใช้เป็นผู้เลือกและดำเนินการมัน ไม่มีการดำเนินการทางการเข้ารหัสในโมดูลนี้ ดังนั้นจึงไม่มีการอ้าง FIPS

การสกัดแบบมีโครงสร้างและการสกัดตารางทำงานในกระบวนการบนโฮสต์ การประสานการซ้อนชั้นที่ค้นหาได้ขับเคลื่อนแบ็กเอนด์ OCR ที่ถูกฉีดเข้ามา ว่าแบ็กเอนด์นั้นทำงานที่ใด ไม่ว่าจะในกระบวนการ sidecar ในเครื่อง หรือบริการระยะไกล และดังนั้นจึงรวมถึงว่ารูปภาพเอกสารและข้อความที่รู้จำได้ถูกคำนวณและจัดเก็บที่ใด เป็นความรับผิดชอบของการปรับใช้ซึ่งอยู่นอกขอบเขตของไลบรารี หากอินพุตมีข้อมูลส่วนบุคคล ชั้นข้อความที่รู้จำได้ก็จะมีด้วย ให้ปฏิบัติต่อเอกสารที่สืบทอดมาตามนั้น

การวัดและส่งข้อมูลที่ปลอดภัยและการขัดล้างบันทึก

หัวข้อที่มีชื่อว่า “การวัดและส่งข้อมูลที่ปลอดภัยและการขัดล้างบันทึก”

ไลบรารียก exception ที่มีชนิดพร้อมข้อความเชิงโครงสร้าง และไม่ได้ใส่ไบต์ของเอกสารหรือข้อความที่รู้จำได้ไว้ในข้อความ exception การปรับใช้ที่บันทึกรอบ ๆ พื้นผิวนี้ควรบันทึกจำนวนและการกำหนดค่า ตามที่แสดงในตัวอย่างการใช้งานจริง และต้องไม่บันทึก payload PDF แบบดิบหรือข้อความที่รู้จำได้ไปยังบันทึกหรือแบ็กเอนด์ APM

ไม่มีการดำเนินการทางการเข้ารหัสในโมดูลนี้ ดังนั้นจึงไม่มีพฤติกรรมเฉพาะของโหมด FIPS

ClaimStandardClause
Text rendering mode ควบคุมว่าสัญลักษณ์จะถูกเติม ตีเส้น หรือไม่ทั้งสองอย่าง (พื้นฐานของข้อความ OCR ที่มองไม่เห็น)ISO 32000-2:2020§9.3.3
Text-showing operator วางสัญลักษณ์ในกระแสเนื้อหาISO 32000-2:2020§9.4
ลำดับชั้นของโครงสร้างเชิงตรรกะแมปเนื้อหาไปยังลำดับการอ่านISO 32000-2:2020§14.7
โครงสร้างที่กำกับไว้รองรับการนำเนื้อหากลับมาใช้ซ้ำISO 32000-2:2020§14.8
อิลิเมนต์โครงสร้างตารางอธิบายแถวและเซลล์ISO 32000-2:2020§14.8
structure tree แมปเนื้อหาไปยังลำดับการอ่านISO 32000-2:2020§14.7

ทุกข้อเป็นการถอดความ NextPDF ไม่ได้ทำซ้ำข้อความเชิงบรรทัดฐาน โปรดดูมาตรฐานที่เผยแพร่เพื่อถ้อยคำที่เป็นทางการ NextPDF ไม่ได้อ้างความแม่นยำของ OCR หรือ recall ของการสกัดข้อมูล หน้านี้ระบุโครงสร้างที่สร้างขึ้นและขอบเขตของการประสาน ไม่ใช่การรับประกันคุณภาพ

  • ตัวสกัดแบบมีโครงสร้างและตัวสกัดตารางใช้ข้อมูลที่ถูกสกัดมาแล้ว มันไม่ได้แยกวิเคราะห์ PDF รันโมเดล หรือวัดความแม่นยำ ค่าความเชื่อมั่นเป็นค่าที่ส่งผ่านมาหรือค่าเริ่มต้นแบบคงที่
  • ตัวกรองสคีมาคงไว้เฉพาะคู่ที่ key ตรงกับฟิลด์ของสคีมาและรายงานฟิลด์ที่จำเป็นที่ขาดหายไป bounding box ของตารางที่สังเคราะห์ขึ้นเป็นการแบ่งย่อยกริดอย่างสม่ำเสมอ ไม่ใช่เค้าโครงที่วัดได้
  • การซ้อนชั้นที่ค้นหาได้คือเอกสารที่สืบทอดมา คือ ลายเซ็นดิจิทัลเดิมใด ๆ จะถูกทำให้เป็นโมฆะ และต้องตรวจสอบสถานะการปฏิบัติตามข้อกำหนดใหม่
  • เมื่อแบ็กเอนด์ OCR ไม่พร้อมใช้งาน หน้าที่ได้รับผลกระทบจะให้คำเป็นศูนย์แทนที่จะทำให้ทั้งการรันล้มเหลวอย่างเงียบ ๆ หน้าที่มีชั้นข้อความ native ที่ใช้งานได้จะถูกข้ามตามค่าเริ่มต้น
  • อินพุตหน้าและขนาดมีขอบเขตและ fail closed เมื่อล้น การสกัดเป็นแบบกำหนดได้แน่นอนสำหรับอินพุตคงที่ ผลลัพธ์การซ้อนชั้นขึ้นอยู่กับแบ็กเอนด์ OCR ที่จัดหา

หน้านี้บันทึกเฉพาะพฤติกรรมที่สังเกตได้จากภายนอกและพื้นผิว API สาธารณะที่รองรับเท่านั้น เส้นทาง namespace ภายใน คลาสตัวช่วย ตารางกลไก ชื่อไฟล์ runbook และคำนำหน้า ticket อยู่นอกขอบเขต

NextPDF Core (Apache-2.0) ไม่มีการประสานการซ้อนชั้นที่ค้นหาได้และไม่มีพื้นผิวการจัดโครงสร้างที่ตรวจสอบตามสคีมา — ไม่มีเลย ความสามารถนี้ไม่มีสิ่งเทียบเท่าในระดับ Core โมเดล AST ของ Core เป็นฐานเอกสารที่ถูกแยกวิเคราะห์ ไม่ใช่พื้นผิวการสกัดหรือ OCR

NextPDF Pro จัดส่งการสกัดข้อมูลแบบเชิงโครงสร้างที่ขับเคลื่อนด้วย AST สำหรับเอกสารที่ถูกแยกวิเคราะห์แล้ว มันไม่ได้จัดหาการจัดโครงสร้าง key-value ที่ตรวจสอบตามสคีมา การสร้างตารางใหม่จากกริดดิบ หรือการประสานการซ้อนชั้นที่ค้นหาได้ซึ่งขับเคลื่อนด้วย OCR สิ่งเหล่านั้นจัดส่งในแพ็กเกจ nextpdf/enterprise เท่านั้น

ตัวสกัดแบบมีโครงสร้าง/ตารางและตัวประสานการซ้อนชั้นถูกอธิบายในระดับพฤติกรรม การแรสเตอร์ไรซ์จริงและการแทรกข้อความที่มองไม่เห็นทำงานในกระบวนการ sidecar แยกต่างหาก รายละเอียดภายในของ sidecar โมเดล OCR และรายละเอียดการประสานภายในใด ๆ อยู่นอกขอบเขตของพื้นผิวสาธารณะ แบ็กเอนด์ OCR เป็นสัญญาที่ถูกฉีดเข้ามาซึ่งจัดหาโดยการปรับใช้

การปรับใช้จัดหาและดำเนินการแบ็กเอนด์ OCR และเลือกว่าจะคำนวณ OCR ที่ใด (ในกระบวนการ sidecar ในเครื่อง หรือบริการระยะไกล) และดังนั้นจึงรวมถึงว่ารูปภาพเอกสารและข้อความที่รู้จำได้ถูกคำนวณและจัดเก็บที่ใด NextPDF Enterprise ประสานเวิร์กโฟลว์และสร้างข้อมูลเมตาของผลลัพธ์ มันไม่ได้ฝังโมเดล OCR หรือรับประกันความแม่นยำในการรู้จำหรือ recall ของการสกัดข้อมูล

ไม่มีข้อจำกัดด้านการควบคุมการส่งออกที่มีผลกับพื้นผิว Intelligence ไลบรารีไม่ได้ยืนยันการรับประกันความแม่นยำของ OCR หรือ recall ของการสกัดข้อมูล และไม่ได้ยืนยันสถานะการปฏิบัติตามกฎระเบียบ เอกสารนี้ไม่ใช่ความเห็นทางกฎหมาย โปรดปรึกษาที่ปรึกษาด้านการปฏิบัติตามกฎและด้านกฎหมายของคุณเอง

  • เอกสารอ้างอิง Intelligence — เอกสารอ้างอิง API เชิงลึกสำหรับความสามารถนี้
  • Pro extraction — บล็อกการอ้างอิงเชิงโครงสร้างที่ขับเคลื่อนด้วย AST
  • Privacy — การตรวจจับ PII เหนือข้อความที่สกัดได้
  • NextPDF Enterprise — พื้นผิวฟีเจอร์ Enterprise ทั้งหมด
  • Core AST — โมเดลเอกสารที่ถูกแยกวิเคราะห์
  • Tagged PDF · OCR · Searchable PDF — คำศัพท์ในอภิธานศัพท์