Enterprise รุ่น
ระบบอัจฉริยะ
ภาพรวมโดยสังเขป
หัวข้อที่มีชื่อว่า “ภาพรวมโดยสังเขป”NextPDF Enterprise Intelligence แปลงข้อมูล key-value และตารางแบบดิบให้เป็นโครงสร้างที่มีชนิดและตรวจสอบตามสคีมาได้ตามต้องการ และประสานการสร้าง PDF ที่ค้นหาได้โดยขับเคลื่อนแบ็กเอนด์ OCR ทับหน้าที่สแกนมา โมดูลนี้อธิบายโครงสร้างที่ตนสร้างขึ้น แต่ไม่ได้ยืนยันความแม่นยำของ OCR หรือ recall ของการสกัดข้อมูล
ความพร้อมใช้งานและการอนุญาต
หัวข้อที่มีชื่อว่า “ความพร้อมใช้งานและการอนุญาต”ความสามารถนี้จัดส่งใน NextPDF Enterprise (nextpdf/enterprise) และเปิดใช้งานด้วย license envelope ระดับ Enterprise การปรับใช้ที่ไม่มีสิทธิ์นั้นจะไม่โหลดคลาสของความสามารถนี้ การปรับใช้ที่ไม่มีสิทธิ์ Enterprise ที่ใช้งานอยู่จะไม่โหลดคลาสเหล่านี้ เปรียบเทียบรุ่นและรับใบอนุญาต
การติดตั้ง
หัวข้อที่มีชื่อว่า “การติดตั้ง”composer require nextpdf/enterprise:^3ภาพรวมเชิงแนวคิด
หัวข้อที่มีชื่อว่า “ภาพรวมเชิงแนวคิด”ตัวสกัดข้อมูลแบบมีโครงสร้างรับคู่ key-value แบบดิบ ซึ่งสร้างขึ้นต้นน้ำโดย accelerator หรือตัวแยกวิเคราะห์เชิงฮิวริสติก แล้วส่งออกอ็อบเจกต์คู่ที่มีชนิด เมื่อมีการระบุสคีมา ตัวสกัดจะคงไว้เฉพาะคู่ที่ key ตรงกับฟิลด์ของสคีมา และรายงานว่าฟิลด์ที่จำเป็นใดขาดหายไป คู่ที่ไม่มีค่าความเชื่อมั่นชัดเจนจะได้รับค่าเริ่มต้นแบบคงที่ นี่เป็นขั้นตอนการกำหนดชนิดและการตรวจสอบเหนือข้อมูลที่ถูกสกัดมาแล้ว มันไม่ใช่เอนจินการสกัดหรือการรู้จำในตัวเอง และไม่ได้กำหนดค่าความแม่นยำที่คำนวณขึ้น
ตัวสกัดตารางรับกริดแถวแบบดิบและสร้างผลลัพธ์ตารางแบบมีโครงสร้างพร้อมอ็อบเจกต์ต่อเซลล์ และ bounding box ที่สังเคราะห์ขึ้นอย่างสม่ำเสมอซึ่งได้มาจากการแบ่งย่อยพื้นที่หน้าที่ทำให้เป็นรูปแบบมาตรฐาน แถวที่สั้นจะถูกเติมให้เต็มเพื่อให้ทุกแถวมีจำนวนคอลัมน์ที่กว้างที่สุด ตารางที่ไม่มีแถวหรือไม่มีคอลัมน์จะถูกข้าม bounding box เป็นการสังเคราะห์กริดอย่างสม่ำเสมอ ไม่ใช่เค้าโครงที่วัดได้
ตัวประสานการซ้อนชั้นที่ค้นหาได้รับ PDF ที่สแกนมาหรือแบบผสม ตรวจหาว่าหน้าใดขาดชั้นข้อความที่ใช้งานได้ ขับเคลื่อนแบ็กเอนด์ OCR ที่กำหนดค่าไว้ และสร้างผลลัพธ์ที่อธิบายจำนวนคำต่อหน้าและค่าความเชื่อมั่นเฉลี่ย ข้อความที่มองไม่เห็นคือกลไกของหน้าที่สแกนมาแล้วค้นหาได้ คือ text-showing operator สามารถวางสัญลักษณ์ได้ในขณะที่ text rendering mode ถูกตั้งค่าให้ข้อความไม่ถูกเติมและไม่ถูกตีเส้น — ISO 32000-2:2020 §9.3.3 — และ text-showing operator วางสัญลักษณ์ในกระแสเนื้อหา — ISO 32000-2:2020 §9.4 เมื่อแหล่งที่มามีการกำกับโครงสร้าง ลำดับชั้นของโครงสร้างเชิงตรรกะจะแมปเนื้อหาไปยังลำดับการอ่าน — ISO 32000-2:2020 §14.7 โครงสร้างที่กำกับไว้รองรับการนำเนื้อหากลับมาใช้ซ้ำ — ISO 32000-2:2020 §14.8 และอิลิเมนต์โครงสร้างตารางอธิบายแถวและเซลล์ — ISO 32000-2:2020 §14.8
การแรสเตอร์ไรซ์จริงและการแทรกข้อความที่มองไม่เห็นดำเนินการโดยกระบวนการ sidecar แยกต่างหาก พื้นผิว PHP ประสานเวิร์กโฟลว์และสร้างข้อมูลเมตาของผลลัพธ์ ผลลัพธ์ของการรันการซ้อนชั้นคือเอกสารที่สืบทอดมา คือ ลายเซ็นเดิมใด ๆ จะถูกทำให้เป็นโมฆะ และสถานะการปฏิบัติตามข้อกำหนดต้องตรวจสอบใหม่ ค่าความเชื่อมั่นเป็นค่าที่ส่งผ่านมาหรือค่าเริ่มต้นแบบคงที่ ไม่ใช่ตัวเลขความแม่นยำที่รับประกัน
เหตุใดจึงทำงานเช่นนี้
หัวข้อที่มีชื่อว่า “เหตุใดจึงทำงานเช่นนี้”พื้นผิวนี้ขีดเส้นแบ่งชัดเจนระหว่างการจัดโครงสร้างและการรู้จำ การกำหนดชนิดและการตรวจสอบตามสคีมาทำงานในกระบวนการ เพราะเป็นแบบกำหนดได้แน่นอนและต้นทุนต่ำ ส่วนการรู้จำ ได้แก่ การแรสเตอร์ไรซ์และการแทรกข้อความที่มองไม่เห็น ถูกมอบหมายให้แบ็กเอนด์ OCR ที่ถูกฉีดเข้ามาและ sidecar แยกต่างหาก เพราะมันหนัก ขึ้นกับแบ็กเอนด์ และควรเก็บไว้นอกขอบเขตความเชื่อถือของ PHP การแยกนี้ทำให้การปรับใช้เลือกได้ว่าจะคำนวณและจัดเก็บรูปภาพเอกสารและข้อความที่รู้จำได้ที่ใด โดยไม่ต้องเปลี่ยนโค้ดที่เรียกใช้ โมดูลยังปฏิเสธที่จะสร้างตัวเลขความแม่นยำขึ้นมาเอง คือ คู่ที่ไม่มีป้ายกำกับจะได้รับค่าเริ่มต้นแบบคงที่ และค่าความเชื่อมั่นที่รายงานเป็นค่าที่ส่งผ่านมามากกว่าที่คำนวณขึ้น ผู้เรียกใช้จะไม่ได้รับตัวเลขความแม่นยำที่ถูกกุขึ้นเลย
ภูมิหลังการออกแบบ: API ที่ปฏิเสธการเดา
พื้นผิว API
หัวข้อที่มีชื่อว่า “พื้นผิว API”| Type | Kind | Role | Stability | Since |
|---|---|---|---|---|
StructuredExtractor | class | กำหนดชนิดให้คู่ key-value แบบดิบ พร้อมตัวกรองสคีมาและการตรวจสอบฟิลด์ที่จำเป็น | stable | 2.2.0 |
ExtractionSchema / SchemaField | classes | คำนิยามฟิลด์และชุดฟิลด์ที่จำเป็น | stable | 2.2.0 |
KeyValuePair | class | คู่ key-value ที่มีชนิดหนึ่งคู่พร้อมค่าความเชื่อมั่น | stable | 2.2.0 |
TableExtractor | class | สร้างตารางแบบมีโครงสร้างจากกริดแถวดิบ | stable | 2.2.0 |
TableResult / TableCell | classes | รูปทรงของตารางพร้อมข้อความ ค่าความเชื่อมั่น และ bounding box ต่อเซลล์ | stable | 2.2.0 |
SearchableOverlay | class | ประสานการสร้าง PDF ที่ค้นหาได้ซึ่งขับเคลื่อนด้วย OCR | stable | 2.2.0 |
OverlayConfig / OverlayQuality | classes | คำใบ้ภาษา DPI ค่าพรีเซ็ตคุณภาพ และการข้ามหน้าแบบ native | stable | 2.2.0 |
SearchableOverlayResult / PageOverlayInfo | classes | จำนวนคำต่อหน้าและค่าความเชื่อมั่นเฉลี่ย | stable | 2.2.0 |
ExtractionConfig / ExtractionStrategy | classes | กลยุทธ์แบบฮิวริสติกเทียบกับแบบ OCR-assisted และคำใบ้ OCR | stable | 2.2.0 |
แบ็กเอนด์ OCR เป็นสัญญาที่ถูกฉีดเข้ามา ตัวประสานไม่ได้ฝังโมเดล OCR ไว้ การปรับใช้เป็นผู้จัดหาแบ็กเอนด์และรับผิดชอบว่าจะคำนวณ OCR ที่ใด
ตัวอย่างโค้ด — เริ่มต้นใช้งานอย่างรวดเร็ว
หัวข้อที่มีชื่อว่า “ตัวอย่างโค้ด — เริ่มต้นใช้งานอย่างรวดเร็ว”<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Intelligence\StructuredExtractor;use NextPDF\Enterprise\Intelligence\ExtractionSchema;
/** * Type raw pairs against a schema and list any missing required fields. * * @param list<array{key: string, value: string, confidence?: float}> $rawPairs Upstream key-value data. * * @return list<string> Missing required field names (empty when compliant). */function validate(array $rawPairs, ExtractionSchema $schema): array{ $extractor = new StructuredExtractor(); $pairs = $extractor->extract($rawPairs, $schema);
return $extractor->validateSchema($schema, $pairs);}ตัวสกัดกำหนดชนิดและกรองข้อมูลที่ขั้นตอนต้นน้ำสร้างขึ้นแล้ว มันไม่ได้ทำการรู้จำใด ๆ ด้วยตัวเอง
ตัวอย่างโค้ด — การใช้งานจริง
หัวข้อที่มีชื่อว่า “ตัวอย่างโค้ด — การใช้งานจริง”<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Accelerator\OcrStrategyInterface;use NextPDF\Enterprise\Intelligence\OverlayConfig;use NextPDF\Enterprise\Intelligence\SearchableOverlay;use Psr\Log\LoggerInterface;
final readonly class OverlayJob{ public function __construct( private OcrStrategyInterface $ocr, private LoggerInterface $logger, ) {}
/** * Generate a searchable PDF from a scanned input. * * @param string $pdfData Scanned or mixed PDF bytes. * * @return string The derived searchable PDF bytes. */ public function run(string $pdfData): string { try { $result = (new SearchableOverlay($this->ocr)) ->generate($pdfData, new OverlayConfig(language: 'eng'));
$this->logger->info('Overlay complete', [ 'pages' => $result->pageCount, 'words' => $result->wordCount, ]);
return $result->pdfData; } catch (\Throwable $e) { $this->logger->error('Overlay failed', ['error' => $e->getMessage()]);
throw $e; } }}บันทึกพกพาเฉพาะจำนวนหน้าและจำนวนคำเท่านั้น ไม่ได้พกพาข้อความที่รู้จำได้หรือไบต์ของเอกสาร ส่วน catch จะ rethrow มันไม่ได้กลืนความล้มเหลวไว้
กรณีขอบและข้อควรระวัง
หัวข้อที่มีชื่อว่า “กรณีขอบและข้อควรระวัง”- ตัวสกัดแบบมีโครงสร้างและตัวสกัดตารางใช้ข้อมูลที่ถูกสกัดมาแล้ว มันไม่ได้แยกวิเคราะห์ PDF รันโมเดล หรือวัดความแม่นยำ ค่าความเชื่อมั่นเป็นค่าที่ส่งผ่านมาหรือค่าเริ่มต้นแบบคงที่
- bounding box ของตารางที่สังเคราะห์ขึ้นเป็นการแบ่งย่อยกริดอย่างสม่ำเสมอ ไม่ใช่เค้าโครงที่วัดได้ ผู้เรียกใช้ที่ต้องการเรขาคณิตจริงต้องไปหามาจากที่อื่น
- การซ้อนชั้นที่ค้นหาได้คือเอกสารที่สืบทอดมา ลายเซ็นดิจิทัลเดิมใด ๆ จะถูกทำให้เป็นโมฆะ ต้องตรวจสอบสถานะการปฏิบัติตามข้อกำหนดใหม่หลังการซ้อนชั้น
- เมื่อแบ็กเอนด์ OCR ไม่พร้อมใช้งาน หน้าที่ได้รับผลกระทบจะให้คำเป็นศูนย์แทนที่จะทำให้ทั้งการรันล้มเหลวอย่างเงียบ ๆ ให้ตรวจสอบผลลัพธ์ต่อหน้า
- หน้าที่มีชั้นข้อความ native ที่ใช้งานได้อยู่แล้วจะถูกข้ามตามค่าเริ่มต้น ปิดการข้ามในการกำหนดค่าหากคุณจำเป็นต้องทำ OCR ซ้ำ
- ความแม่นยำของ OCR ขึ้นอยู่กับแบ็กเอนด์ที่จัดหา คุณภาพของอินพุต และคำใบ้ภาษาทั้งหมด NextPDF ไม่ได้ยืนยันความแม่นยำในการรู้จำหรือ recall ของการสกัดข้อมูล
ประสิทธิภาพ
หัวข้อที่มีชื่อว่า “ประสิทธิภาพ”การสกัดแบบมีโครงสร้างและการสกัดตารางเป็นแบบเชิงเส้นตามขนาดอินพุต ต้นทุนการซ้อนชั้นที่ค้นหาได้ถูกครอบงำโดยแบ็กเอนด์ OCR และการแรสเตอร์ไรซ์ของ sidecar ที่ DPI ที่กำหนดค่าไว้ ส่วนค่าใช้จ่ายในการประสานนั้นเล็กน้อย อินพุตหน้าและขนาดมีขอบเขตและ fail closed เมื่อล้น โปรไฟล์ความสามารถในการทำซ้ำได้คือ structural คือ การสกัดเป็นแบบกำหนดได้แน่นอนสำหรับอินพุตคงที่ ในขณะที่ผลลัพธ์การซ้อนชั้นขึ้นอยู่กับแบ็กเอนด์ OCR และอาจแตกต่างกันระหว่างแบ็กเอนด์หรือเวอร์ชัน
บันทึกด้านความปลอดภัย
หัวข้อที่มีชื่อว่า “บันทึกด้านความปลอดภัย”ตัวสกัดเป็นขั้นตอนการจัดโครงสร้างแบบอ่านอย่างเดียว พื้นผิวการซ้อนชั้นสร้างเอกสารที่สืบทอดมาและจำกัดขอบเขตขนาดอินพุตและจำนวนหน้า โดย fail closed เมื่อล้น แบ็กเอนด์ OCR เป็นจุดผสานการทำงาน ไม่ใช่ส่วนหนึ่งของขอบเขตความเชื่อถือ การปรับใช้เป็นผู้เลือกและดำเนินการมัน ไม่มีการดำเนินการทางการเข้ารหัสในโมดูลนี้ ดังนั้นจึงไม่มีการอ้าง FIPS
Data residency และการลดผลกระทบ PII
หัวข้อที่มีชื่อว่า “Data residency และการลดผลกระทบ PII”การสกัดแบบมีโครงสร้างและการสกัดตารางทำงานในกระบวนการบนโฮสต์ การประสานการซ้อนชั้นที่ค้นหาได้ขับเคลื่อนแบ็กเอนด์ OCR ที่ถูกฉีดเข้ามา ว่าแบ็กเอนด์นั้นทำงานที่ใด ไม่ว่าจะในกระบวนการ sidecar ในเครื่อง หรือบริการระยะไกล และดังนั้นจึงรวมถึงว่ารูปภาพเอกสารและข้อความที่รู้จำได้ถูกคำนวณและจัดเก็บที่ใด เป็นความรับผิดชอบของการปรับใช้ซึ่งอยู่นอกขอบเขตของไลบรารี หากอินพุตมีข้อมูลส่วนบุคคล ชั้นข้อความที่รู้จำได้ก็จะมีด้วย ให้ปฏิบัติต่อเอกสารที่สืบทอดมาตามนั้น
การวัดและส่งข้อมูลที่ปลอดภัยและการขัดล้างบันทึก
หัวข้อที่มีชื่อว่า “การวัดและส่งข้อมูลที่ปลอดภัยและการขัดล้างบันทึก”ไลบรารียก exception ที่มีชนิดพร้อมข้อความเชิงโครงสร้าง และไม่ได้ใส่ไบต์ของเอกสารหรือข้อความที่รู้จำได้ไว้ในข้อความ exception การปรับใช้ที่บันทึกรอบ ๆ พื้นผิวนี้ควรบันทึกจำนวนและการกำหนดค่า ตามที่แสดงในตัวอย่างการใช้งานจริง และต้องไม่บันทึก payload PDF แบบดิบหรือข้อความที่รู้จำได้ไปยังบันทึกหรือแบ็กเอนด์ APM
พฤติกรรมในโหมด FIPS
หัวข้อที่มีชื่อว่า “พฤติกรรมในโหมด FIPS”ไม่มีการดำเนินการทางการเข้ารหัสในโมดูลนี้ ดังนั้นจึงไม่มีพฤติกรรมเฉพาะของโหมด FIPS
ความสอดคล้อง
หัวข้อที่มีชื่อว่า “ความสอดคล้อง”| Claim | Standard | Clause |
|---|---|---|
| Text rendering mode ควบคุมว่าสัญลักษณ์จะถูกเติม ตีเส้น หรือไม่ทั้งสองอย่าง (พื้นฐานของข้อความ OCR ที่มองไม่เห็น) | ISO 32000-2:2020 | §9.3.3 |
| Text-showing operator วางสัญลักษณ์ในกระแสเนื้อหา | ISO 32000-2:2020 | §9.4 |
| ลำดับชั้นของโครงสร้างเชิงตรรกะแมปเนื้อหาไปยังลำดับการอ่าน | ISO 32000-2:2020 | §14.7 |
| โครงสร้างที่กำกับไว้รองรับการนำเนื้อหากลับมาใช้ซ้ำ | ISO 32000-2:2020 | §14.8 |
| อิลิเมนต์โครงสร้างตารางอธิบายแถวและเซลล์ | ISO 32000-2:2020 | §14.8 |
| structure tree แมปเนื้อหาไปยังลำดับการอ่าน | ISO 32000-2:2020 | §14.7 |
ทุกข้อเป็นการถอดความ NextPDF ไม่ได้ทำซ้ำข้อความเชิงบรรทัดฐาน โปรดดูมาตรฐานที่เผยแพร่เพื่อถ้อยคำที่เป็นทางการ NextPDF ไม่ได้อ้างความแม่นยำของ OCR หรือ recall ของการสกัดข้อมูล หน้านี้ระบุโครงสร้างที่สร้างขึ้นและขอบเขตของการประสาน ไม่ใช่การรับประกันคุณภาพ
สัญญาด้านพฤติกรรม
หัวข้อที่มีชื่อว่า “สัญญาด้านพฤติกรรม”- ตัวสกัดแบบมีโครงสร้างและตัวสกัดตารางใช้ข้อมูลที่ถูกสกัดมาแล้ว มันไม่ได้แยกวิเคราะห์ PDF รันโมเดล หรือวัดความแม่นยำ ค่าความเชื่อมั่นเป็นค่าที่ส่งผ่านมาหรือค่าเริ่มต้นแบบคงที่
- ตัวกรองสคีมาคงไว้เฉพาะคู่ที่ key ตรงกับฟิลด์ของสคีมาและรายงานฟิลด์ที่จำเป็นที่ขาดหายไป bounding box ของตารางที่สังเคราะห์ขึ้นเป็นการแบ่งย่อยกริดอย่างสม่ำเสมอ ไม่ใช่เค้าโครงที่วัดได้
- การซ้อนชั้นที่ค้นหาได้คือเอกสารที่สืบทอดมา คือ ลายเซ็นดิจิทัลเดิมใด ๆ จะถูกทำให้เป็นโมฆะ และต้องตรวจสอบสถานะการปฏิบัติตามข้อกำหนดใหม่
- เมื่อแบ็กเอนด์ OCR ไม่พร้อมใช้งาน หน้าที่ได้รับผลกระทบจะให้คำเป็นศูนย์แทนที่จะทำให้ทั้งการรันล้มเหลวอย่างเงียบ ๆ หน้าที่มีชั้นข้อความ native ที่ใช้งานได้จะถูกข้ามตามค่าเริ่มต้น
- อินพุตหน้าและขนาดมีขอบเขตและ fail closed เมื่อล้น การสกัดเป็นแบบกำหนดได้แน่นอนสำหรับอินพุตคงที่ ผลลัพธ์การซ้อนชั้นขึ้นอยู่กับแบ็กเอนด์ OCR ที่จัดหา
ขอบเขตการเผยแพร่
หัวข้อที่มีชื่อว่า “ขอบเขตการเผยแพร่”หน้านี้บันทึกเฉพาะพฤติกรรมที่สังเกตได้จากภายนอกและพื้นผิว API สาธารณะที่รองรับเท่านั้น เส้นทาง namespace ภายใน คลาสตัวช่วย ตารางกลไก ชื่อไฟล์ runbook และคำนำหน้า ticket อยู่นอกขอบเขต
การถอยกลับไปใช้ Core
หัวข้อที่มีชื่อว่า “การถอยกลับไปใช้ Core”NextPDF Core (Apache-2.0) ไม่มีการประสานการซ้อนชั้นที่ค้นหาได้และไม่มีพื้นผิวการจัดโครงสร้างที่ตรวจสอบตามสคีมา — ไม่มีเลย ความสามารถนี้ไม่มีสิ่งเทียบเท่าในระดับ Core โมเดล AST ของ Core เป็นฐานเอกสารที่ถูกแยกวิเคราะห์ ไม่ใช่พื้นผิวการสกัดหรือ OCR
การถอยกลับไปใช้ Pro
หัวข้อที่มีชื่อว่า “การถอยกลับไปใช้ Pro”NextPDF Pro จัดส่งการสกัดข้อมูลแบบเชิงโครงสร้างที่ขับเคลื่อนด้วย AST สำหรับเอกสารที่ถูกแยกวิเคราะห์แล้ว มันไม่ได้จัดหาการจัดโครงสร้าง key-value ที่ตรวจสอบตามสคีมา การสร้างตารางใหม่จากกริดดิบ หรือการประสานการซ้อนชั้นที่ค้นหาได้ซึ่งขับเคลื่อนด้วย OCR สิ่งเหล่านั้นจัดส่งในแพ็กเกจ nextpdf/enterprise เท่านั้น
บันทึกขอบเขตของ Enterprise
หัวข้อที่มีชื่อว่า “บันทึกขอบเขตของ Enterprise”ตัวสกัดแบบมีโครงสร้าง/ตารางและตัวประสานการซ้อนชั้นถูกอธิบายในระดับพฤติกรรม การแรสเตอร์ไรซ์จริงและการแทรกข้อความที่มองไม่เห็นทำงานในกระบวนการ sidecar แยกต่างหาก รายละเอียดภายในของ sidecar โมเดล OCR และรายละเอียดการประสานภายในใด ๆ อยู่นอกขอบเขตของพื้นผิวสาธารณะ แบ็กเอนด์ OCR เป็นสัญญาที่ถูกฉีดเข้ามาซึ่งจัดหาโดยการปรับใช้
ขอบเขตการปรับใช้
หัวข้อที่มีชื่อว่า “ขอบเขตการปรับใช้”การปรับใช้จัดหาและดำเนินการแบ็กเอนด์ OCR และเลือกว่าจะคำนวณ OCR ที่ใด (ในกระบวนการ sidecar ในเครื่อง หรือบริการระยะไกล) และดังนั้นจึงรวมถึงว่ารูปภาพเอกสารและข้อความที่รู้จำได้ถูกคำนวณและจัดเก็บที่ใด NextPDF Enterprise ประสานเวิร์กโฟลว์และสร้างข้อมูลเมตาของผลลัพธ์ มันไม่ได้ฝังโมเดล OCR หรือรับประกันความแม่นยำในการรู้จำหรือ recall ของการสกัดข้อมูล
ขอบเขตการปฏิบัติตามกฎหมาย
หัวข้อที่มีชื่อว่า “ขอบเขตการปฏิบัติตามกฎหมาย”ไม่มีข้อจำกัดด้านการควบคุมการส่งออกที่มีผลกับพื้นผิว Intelligence ไลบรารีไม่ได้ยืนยันการรับประกันความแม่นยำของ OCR หรือ recall ของการสกัดข้อมูล และไม่ได้ยืนยันสถานะการปฏิบัติตามกฎระเบียบ เอกสารนี้ไม่ใช่ความเห็นทางกฎหมาย โปรดปรึกษาที่ปรึกษาด้านการปฏิบัติตามกฎและด้านกฎหมายของคุณเอง
ดูเพิ่มเติม
หัวข้อที่มีชื่อว่า “ดูเพิ่มเติม”- เอกสารอ้างอิง Intelligence — เอกสารอ้างอิง API เชิงลึกสำหรับความสามารถนี้
- Pro extraction — บล็อกการอ้างอิงเชิงโครงสร้างที่ขับเคลื่อนด้วย AST
- Privacy — การตรวจจับ PII เหนือข้อความที่สกัดได้
- NextPDF Enterprise — พื้นผิวฟีเจอร์ Enterprise ทั้งหมด
- Core AST — โมเดลเอกสารที่ถูกแยกวิเคราะห์
- Tagged PDF · OCR · Searchable PDF — คำศัพท์ในอภิธานศัพท์