Enterprise รุ่น
Intelligence — เอกสารอ้างอิงเชิงลึก
ภาพรวมโดยสรุป
หัวข้อที่มีชื่อว่า “ภาพรวมโดยสรุป”เอกสารอ้างอิงเชิงลึกนี้บันทึกการระบุชนิดของ key-value และการตรวจสอบ schema การสังเคราะห์กริดของตาราง และขอบเขตของการประสานงาน searchable-overlay
ความพร้อมใช้งานและการอนุญาต
หัวข้อที่มีชื่อว่า “ความพร้อมใช้งานและการอนุญาต”ความสามารถนี้จัดส่งใน NextPDF Enterprise (nextpdf/enterprise) และเปิดใช้งานด้วย envelope ของสิทธิ์ระดับ Enterprise การนำไปใช้งานที่ไม่มีสิทธิ์นั้นจะไม่โหลดคลาสของความสามารถนี้ เปรียบเทียบรุ่นและรับ license
สัญญาพฤติกรรม
หัวข้อที่มีชื่อว่า “สัญญาพฤติกรรม”StructuredExtractor::extract ระบุชนิดของอินพุต key-value ดิบ เมื่อมีการจัดหา schema จะเก็บเฉพาะคู่ที่คีย์ตรงกับฟิลด์ของ schema ส่วนคู่ที่ไม่มีค่าความเชื่อมั่นชัดเจนจะได้รับค่าเริ่มต้นตายตัว validateSchema คืนค่าชื่อฟิลด์ที่จำเป็นซึ่งไม่ถูกพบ (ค่าว่างหมายถึงสอดคล้อง) ขั้นตอนนี้ระบุชนิดและตรวจสอบข้อมูลที่ถูกสกัดแล้ว มันไม่รู้จำข้อความและไม่กำหนดความแม่นยำที่คำนวณได้ใด ๆ
TableExtractor::extract สร้างตารางที่มีโครงสร้างจากกริดแถวดิบ จำนวนคอลัมน์คือแถวที่กว้างที่สุด แถวสั้นจะถูกเติมด้วยเซลล์ว่าง แต่ละเซลล์ได้รับ bounding box ที่สังเคราะห์ขึ้นจากการแบ่งย่อยแบบสม่ำเสมอของพื้นที่หน้าที่ทำให้เป็นค่าปกติ และค่าความเชื่อมั่นเริ่มต้นตายตัว ตารางที่ไม่มีแถวหรือไม่มีคอลัมน์จะถูกข้าม bounding boxes เป็นการสังเคราะห์กริด ไม่ใช่เค้าโครงที่วัดได้
SearchableOverlay::generate ตรวจสอบ header ของ PDF จำกัดขอบเขตขนาดอินพุตและจำนวนหน้า (ล้มเหลวแบบ fail closed เมื่อล้น) ตรวจหาหน้าที่ขาด text layer ที่ใช้งานได้ ขับเคลื่อน OCR backend ที่กำหนดค่าไว้ และคืนค่าจำนวนคำต่อหน้าและค่าความเชื่อมั่นเฉลี่ย หน้าที่มี native text layer ที่ใช้งานได้จะถูกข้ามโดยค่าเริ่มต้น ข้อความ OCR ที่มองไม่เห็นอาศัย text rendering mode ที่ไม่ทั้ง fill และ stroke กลีฟ (ISO 32000-2:2020 §9.3.3) เมื่อต้นฉบับถูก tag ไว้ structure tree จะแมปเนื้อหากับลำดับการอ่าน (§14.7) และ table structure elements อธิบายแถวและเซลล์ (§14.8) การ rasterize จริงและการฉีดข้อความที่มองไม่เห็นถูกมอบหมายให้แก่ sidecar process แยกต่างหาก พื้นผิว PHP ประสานงานและคืนค่า metadata ของผลลัพธ์ ผลลัพธ์ overlay เป็นเอกสารที่ได้มา — ลายเซ็นที่มีอยู่จะถูกทำให้ใช้ไม่ได้และต้องตรวจสอบความสอดคล้องใหม่ ความเชื่อมั่นเป็นค่าส่งผ่านหรือค่าเริ่มต้นตายตัว พื้นผิวไม่ยืนยันความแม่นยำของ OCR หรือ recall ของการสกัด
พื้นผิว API สาธารณะ
หัวข้อที่มีชื่อว่า “พื้นผิว API สาธารณะ”NextPDF\Enterprise\Intelligence\StructuredExtractor,
NextPDF\Enterprise\Intelligence\ExtractionSchema,
NextPDF\Enterprise\Intelligence\SchemaField,
NextPDF\Enterprise\Intelligence\KeyValuePair,
NextPDF\Enterprise\Intelligence\TableExtractor,
NextPDF\Enterprise\Intelligence\TableResult,
NextPDF\Enterprise\Intelligence\TableCell,
NextPDF\Enterprise\Intelligence\SearchableOverlay,
NextPDF\Enterprise\Intelligence\OverlayConfig,
NextPDF\Enterprise\Intelligence\SearchableOverlayResult,
NextPDF\Enterprise\Intelligence\PageOverlayInfo,
NextPDF\Enterprise\Intelligence\ExtractionConfig และ enum
ExtractionStrategy / OverlayQuality ส่วน OCR backend เป็นสัญญาที่ถูก inject ซึ่งจัดหาโดยการนำไปใช้งาน ลายเซ็นต่าง ๆ ระบุไว้ในหน้าสาธารณะ
ความสอดคล้อง
หัวข้อที่มีชื่อว่า “ความสอดคล้อง”กลไก overlay แมปกับ ISO 32000-2:2020 §9.3.3 (text rendering mode) และสำหรับต้นฉบับที่ถูก tag คือ §14.7–§14.8 (structure tree และ table elements) ขั้นตอนการจัดโครงสร้างใช้ข้อมูลที่ถูกสกัดแล้ว คุณภาพถูกจำกัดด้วยตัวสกัดต้นทางและ OCR backend
กรณีขอบและพฤติกรรมในโหมด FIPS
หัวข้อที่มีชื่อว่า “กรณีขอบและพฤติกรรมในโหมด FIPS”- bounding boxes ของตารางที่สังเคราะห์ขึ้นเป็นการแบ่งย่อยกริดแบบสม่ำเสมอ ไม่ใช่เค้าโครงที่วัดได้
- เมื่อ OCR backend ไม่พร้อมใช้งาน หน้าที่ได้รับผลกระทบจะให้คำเป็นศูนย์แทนที่จะทำให้การรันทั้งหมดล้มเหลวแบบเงียบ ๆ ตรวจสอบผลลัพธ์ต่อหน้า
- ผลลัพธ์ overlay เป็นเอกสารที่ได้มา ตรวจสอบลายเซ็นและสถานะความสอดคล้องใหม่
- ไม่มีการดำเนินการเชิงการเข้ารหัสลับเกิดขึ้นในโมดูลนี้ จึงไม่มีพฤติกรรมเฉพาะของโหมด FIPS
ขอบเขตการเผยแพร่
หัวข้อที่มีชื่อว่า “ขอบเขตการเผยแพร่”หน้านี้บันทึกเฉพาะพฤติกรรมที่สังเกตได้จากภายนอกและพื้นผิว public API ที่รองรับเท่านั้น internal namespace paths คลาสตัวช่วย ตารางกลไก ชื่อไฟล์ runbook และ ticket prefixes อยู่นอกขอบเขต
การถอยกลับไปใช้ Core
หัวข้อที่มีชื่อว่า “การถอยกลับไปใช้ Core”NextPDF Core (Apache-2.0) ไม่มีการประสานงาน searchable-overlay และไม่มีพื้นผิวการจัดโครงสร้างที่ตรวจสอบ schema — ไม่มี ความสามารถนี้ไม่มีรายการเทียบเท่าในขั้น Core
การถอยกลับไปใช้ Pro
หัวข้อที่มีชื่อว่า “การถอยกลับไปใช้ Pro”NextPDF Pro จัดส่งการสกัดที่ขับเคลื่อนด้วย AST เชิงโครงสร้างเหนือเอกสารที่ถูกแจงแล้ว มันไม่ให้การจัดโครงสร้าง key-value ที่ตรวจสอบ schema การสร้างตารางใหม่จากกริดดิบ หรือการประสานงาน searchable-overlay ที่ใช้ OCR สิ่งเหล่านั้นจัดส่งมาในแพ็กเกจ nextpdf/enterprise เท่านั้น
หมายเหตุขอบเขต Enterprise
หัวข้อที่มีชื่อว่า “หมายเหตุขอบเขต Enterprise”การระบุชนิดของ key-value การตรวจสอบ schema การสังเคราะห์กริดของตาราง และการประสานงาน overlay อธิบายในระดับพฤติกรรม การ rasterize จริงและการฉีดข้อความที่มองไม่เห็นรันใน sidecar process แยกต่างหาก ส่วน sidecar ภายใน OCR model และรายละเอียดการประสานงานภายในใด ๆ อยู่นอกขอบเขตและไม่ถูกนำมาแสดงซ้ำที่นี่ OCR backend เป็นสัญญาที่ถูก inject ซึ่งจัดหาโดยการนำไปใช้งาน
ขอบเขตการนำไปใช้งาน
หัวข้อที่มีชื่อว่า “ขอบเขตการนำไปใช้งาน”การนำไปใช้งานจัดหาและดำเนินการ OCR backend และเลือกว่า OCR ถูกคำนวณที่ใด — และดังนั้นภาพเอกสารและข้อความที่รู้จำถูกคำนวณและจัดเก็บที่ใด พื้นผิวจำกัดขอบเขตขนาดอินพุตและจำนวนหน้า และล้มเหลวแบบ fail closed เมื่อล้น NextPDF Enterprise ประสานงานเวิร์กโฟลว์และคืนค่า metadata ของผลลัพธ์ มันไม่ฝัง OCR model และไม่รับประกันความแม่นยำของการรู้จำหรือ recall ของการสกัด
ขอบเขตการปฏิบัติตามกฎหมาย
หัวข้อที่มีชื่อว่า “ขอบเขตการปฏิบัติตามกฎหมาย”ไม่มีข้อจำกัดด้านการควบคุมการส่งออกที่นำมาใช้กับพื้นผิวนี้ พื้นผิวไม่ยืนยันการรับประกันความแม่นยำของ OCR หรือ recall ของการสกัด และไม่ยืนยันสถานะความสอดคล้องตามการกำกับดูแล เอกสารอ้างอิงนี้ไม่ใช่ความเห็นทางกฎหมาย