تخطَّ إلى المحتوى
getnextpdf.com

Enterprise الإصدار

الذكاء

يحوّل ⁨NextPDF Enterprise Intelligence⁩ بيانات المفتاح-القيمة والجداول الخام إلى بُنى مُصنَّفة ومُتحقَّق منها اختياريًا وفق مخطط، ويُنسّق توليد ملفات ⁨PDF⁩ قابلة للبحث بقيادة خلفية ⁨OCR⁩ على الصفحات الممسوحة ضوئيًا. يصف البُنى التي يُنتجها؛ ولا يؤكّد دقة ⁨OCR⁩ ولا معدّل استرجاع الاستخراج.

تُشحن هذه القدرة في ⁨NextPDF Enterprise⁩ (nextpdf/enterprise) وتُفعَّل بمظروف ترخيص من فئة ⁨Enterprise⁩. والنشر الذي لا يملك ذلك الاستحقاق لا يُحمّل أصناف القدرة. والنشر الذي لا يملك استحقاق ⁨Enterprise⁩ نشطًا لا يُحمّل هذه الأصناف. قارن الإصدارات واحصل على ترخيص.

Terminal window
composer require nextpdf/enterprise:^3

يأخذ المُستخرِج المُنظَّم أزواج المفتاح-القيمة الخام — التي يُنتجها مُسرِّع أو مُحلِّل إرشادي في المراحل السابقة — ويُصدر كائنات أزواج مُصنَّفة. وعند تزويده بمخطط، يحتفظ فقط بالأزواج التي يطابق مفتاحها حقلًا في المخطط، ويُبلِّغ عن الحقول المطلوبة المفقودة. ويتلقّى أي زوج بلا ثقة صريحة قيمة افتراضية ثابتة. هذه خطوة تصنيف وتحقّق على بيانات مُستخرَجة سلفًا؛ وهي ليست بذاتها محرك استخراج أو تعرّف ولا تُسنِد أي دقة محسوبة.

يأخذ مُستخرِج الجداول شبكات الصفوف الخام ويبني نتائج جداول مُنظَّمة بكائنات لكل خلية وأطر إحاطة مُركَّبة ومنتظمة مُشتقّة بتقسيم مساحة صفحة مُسوّاة. تُحشى الصفوف القصيرة بحيث يحمل كل صف أوسع عدد أعمدة. ويُتخطّى أي جدول بلا صفوف أو بلا أعمدة. أطر الإحاطة هي تركيب شبكة منتظمة، لا تخطيطًا مقيسًا.

يقبل مُنسِّق الطبقة القابلة للبحث ملف ⁨PDF⁩ ممسوحًا ضوئيًا أو مختلطًا، ويكتشف الصفحات التي تفتقر إلى طبقة نص قابلة للاستخدام، ويقود خلفية ⁨OCR⁩ المُهيّأة، ويُنتج نتيجة تصف عدد الكلمات لكل صفحة ومتوسط الثقة. النص الخفي هو آلية الصفحة الممسوحة القابلة للبحث: يمكن لمُشغِّل إظهار النص أن يضع المحارف بينما يُضبط وضع تصيير النص بحيث لا يُملأ النص ولا يُحبَّر — ⁨ISO 32000-2:2020⁩ §⁨9.3.3⁩ — وتضع مُشغِّلات إظهار النص المحارف في دفق المحتوى — ⁨ISO 32000-2:2020⁩ §9.4. وحين يكون المصدر مُوسَّمًا، تُسنِد بنية البنية المنطقية المحتوى إلى ترتيب قراءة — ⁨ISO 32000-2:2020⁩ §⁨14.7⁩، وتدعم البنية المُوسَّمة إعادة استخدام المحتوى — ⁨ISO 32000-2:2020⁩ §⁨14.8⁩، وتصف عناصر بنية الجدول الصفوف والخلايا — ⁨ISO 32000-2:2020⁩ §14.8.

تُنفَّذ التنقيط الفعلي وحقن النص الخفي بعملية مرافِقة منفصلة؛ ويُنسّق سطح ⁨PHP⁩ سير العمل ويُنتج بيانات النتيجة الوصفية. ناتج تشغيل الطبقة مستند مُشتق: يُبطَل أي توقيع قائم وتتطلّب حالة المطابقة إعادة تحقّق. وقيم الثقة هي قيم تمريرية أو قيم افتراضية ثابتة، لا رقم دقة مضمون.

يرسم السطح خطًا فاصلًا حاسمًا بين البنية والتعرّف. يجري التصنيف والتحقّق من المخطط داخل العملية، لأنهما حتميّان وزهيدا التكلفة. أما التعرّف — التنقيط وحقن النص الخفي — فيُفوَّض إلى خلفية ⁨OCR⁩ محقونة ومرافِق منفصل، لأنه ثقيل وخاص بالخلفية ويُفضَّل إبقاؤه خارج حدود ثقة ⁨PHP⁩. ويتيح ذلك الفصل للنشر أن يختار موضع حساب صور المستند والنص المُتعرَّف عليه وتخزينهما، دون تغيير شيفرة الاستدعاء. كما ترفض الوحدة اختلاق رقم دقة: يتلقّى الزوج غير المُعنوَن قيمة افتراضية ثابتة، وتُمرَّر الثقة المُبلَّغة بدلًا من حسابها. ولا يُسلَّم المستدعي أبدًا رقم دقة مُختلَقًا.

خلفية التصميم: واجهة برمجية ترفض التخمين.

النوعالصنفالدورالاستقرارمنذ
StructuredExtractorclassيُصنِّف أزواج المفتاح-القيمة الخام؛ ومرشّح المخطط وفحص الحقول المطلوبةstable2.2.0
ExtractionSchema / SchemaFieldclassesتعريفات الحقول ومجموعة الحقول المطلوبةstable2.2.0
KeyValuePairclassزوج مفتاح-قيمة مُصنَّف واحد مع ثقةstable2.2.0
TableExtractorclassيبني جداول مُنظَّمة من شبكات الصفوف الخامstable2.2.0
TableResult / TableCellclassesشكل الجدول بنص لكل خلية وثقة وإطار إحاطةstable2.2.0
SearchableOverlayclassيُنسّق توليد ملفات ⁨PDF⁩ القابلة للبحث المدعومة بـ ⁨OCR⁩stable2.2.0
OverlayConfig / OverlayQualityclassesتلميح اللغة، والـ ⁨DPI⁩، وضبط مُسبق للجودة، وتخطّي الصفحات الأصليةstable2.2.0
SearchableOverlayResult / PageOverlayInfoclassesعدد الكلمات لكل صفحة ومتوسط الثقةstable2.2.0
ExtractionConfig / ExtractionStrategyclassesاستراتيجية إرشادية مقابل مدعومة بـ ⁨OCR⁩ وتلميحات ⁨OCR⁩stable2.2.0

خلفية ⁨OCR⁩ عقد مُحقَن. لا يُضمِّن المُنسِّق نموذج ⁨OCR⁩؛ بل يزوّد النشرُ الخلفيةَ وهو مسؤول عن موضع حساب ⁨OCR⁩.

Type and schema-validate raw key-value pairs
<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Intelligence\StructuredExtractor;
use NextPDF\Enterprise\Intelligence\ExtractionSchema;
/**
* Type raw pairs against a schema and list any missing required fields.
*
* @param list<array{key: string, value: string, confidence?: float}> $rawPairs Upstream key-value data.
*
* @return list<string> Missing required field names (empty when compliant).
*/
function validate(array $rawPairs, ExtractionSchema $schema): array
{
$extractor = new StructuredExtractor();
$pairs = $extractor->extract($rawPairs, $schema);
return $extractor->validateSchema($schema, $pairs);
}

يُصنِّف المُستخرِج البياناتِ ويُرشِّحها وهي بيانات أنتجتها خطوة سابقة سلفًا. ولا يُجري أي تعرّف بنفسه.

Searchable-overlay orchestration with safe logging
<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Accelerator\OcrStrategyInterface;
use NextPDF\Enterprise\Intelligence\OverlayConfig;
use NextPDF\Enterprise\Intelligence\SearchableOverlay;
use Psr\Log\LoggerInterface;
final readonly class OverlayJob
{
public function __construct(
private OcrStrategyInterface $ocr,
private LoggerInterface $logger,
) {}
/**
* Generate a searchable PDF from a scanned input.
*
* @param string $pdfData Scanned or mixed PDF bytes.
*
* @return string The derived searchable PDF bytes.
*/
public function run(string $pdfData): string
{
try {
$result = (new SearchableOverlay($this->ocr))
->generate($pdfData, new OverlayConfig(language: 'eng'));
$this->logger->info('Overlay complete', [
'pages' => $result->pageCount,
'words' => $result->wordCount,
]);
return $result->pdfData;
} catch (\Throwable $e) {
$this->logger->error('Overlay failed', ['error' => $e->getMessage()]);
throw $e;
}
}
}

يحمل السجلّ عدد الصفحات والكلمات فقط. ولا يحمل النص المُتعرَّف عليه ولا بايتات المستند. والـ ⁨catch⁩ يُعيد الطرح؛ ولا يبتلع الفشل.

  • يستهلك المُستخرِجان المُنظَّم والجدولي بياناتٍ مُستخرَجة سلفًا. ولا يُحلِّلان ⁨PDF⁩، ولا يُشغِّلان نموذجًا، ولا يقيسان دقة. والثقة قيمة تمريرية أو افتراضية ثابتة.
  • أطر إحاطة الجداول المُركَّبة هي تقسيم شبكة منتظمة، لا تخطيطًا مقيسًا. والمستدعي الذي يحتاج هندسة حقيقية عليه الحصول عليها من مكان آخر.
  • الطبقة القابلة للبحث مستند مُشتق. يُبطَل أي توقيع رقمي قائم؛ ويجب إعادة التحقّق من حالة المطابقة بعد الطبقة.
  • حين تكون خلفية ⁨OCR⁩ غير متاحة، تسهم الصفحات المتأثرة بصفر كلمة بدلًا من إفشال التشغيل كله بصمت — افحص نتيجة كل صفحة.
  • تُتخطّى افتراضيًا أي صفحة تحمل سلفًا طبقة نص أصلية قابلة للاستخدام. عطِّل التخطّي في التهيئة إذا توجّب عليك إعادة ⁨OCR⁩.
  • تعتمد دقة ⁨OCR⁩ كليًا على الخلفية المُزوَّدة وجودة المُدخَل وتلميح اللغة. لا يؤكّد ⁨NextPDF⁩ دقة التعرّف ولا معدّل استرجاع الاستخراج.

الاستخراج المُنظَّم والجدولي خطيّان في حجم المُدخَل. وتهيمن خلفية ⁨OCR⁩ وتنقيط المرافِق عند الـ ⁨DPI⁩ المُهيّأ على تكلفة الطبقة القابلة للبحث؛ وعبء التنسيق صغير. ومُدخَلا الصفحة والحجم محدودان ويفشلان فشلًا مغلقًا عند الفيض. سمة قابلية الاستنساخ هي structural: الاستخراج حتمي لمُدخَل ثابت، بينما يعتمد ناتج الطبقة على خلفية ⁨OCR⁩ وقد يتباين بين الخلفيات أو الإصدارات.

المُستخرِجان خطوتا بنية للقراءة فقط. ويُنتج سطح الطبقة مستندًا مُشتقًا ويحدّ حجم المُدخَل وعدد الصفحات، فاشلًا فشلًا مغلقًا عند الفيض. وخلفية ⁨OCR⁩ نقطة تكامل، لا جزءًا من حدود الثقة؛ يختارها النشرُ ويُشغِّلها. ولا تجري أي عملية تشفيرية في هذه الوحدة، لذا لا تطرح أي ادعاء ⁨FIPS⁩.

إقامة البيانات وتخفيفات المعلومات الشخصية

قسم بعنوان «إقامة البيانات وتخفيفات المعلومات الشخصية»

يجري الاستخراج المُنظَّم والجدولي داخل العملية على المضيف. ويقود تنسيقُ الطبقة القابلة للبحث خلفيةَ ⁨OCR⁩ محقونة: موضع تشغيل تلك الخلفية — داخل العملية، أو مرافِق محلي، أو خدمة بعيدة — وبالتالي موضع حساب صور المستند والنص المُتعرَّف عليه وتخزينهما، مسؤولية نشر خارج حدود المكتبة. وإذا احتوى المُدخَل بيانات شخصية، فستحتويها أيضًا طبقة النص المُتعرَّف عليه؛ فعامِل المستند المُشتق وفقًا لذلك.

القياس الآمن وتنقية السجلات

قسم بعنوان «القياس الآمن وتنقية السجلات»

تثير المكتبة استثناءات مُصنَّفة برسائل بنيوية ولا تضع بايتات المستند ولا النص المُتعرَّف عليه في نص الاستثناء. والنشر الذي يُسجّل حول هذا السطح ينبغي أن يُسجّل الأعداد والتهيئة — كما هو مبيَّن في عيّنة الإنتاج — ويجب ألّا يُسجّل حمولة ⁨PDF⁩ الخام ولا النص المُتعرَّف عليه في السجلات أو في خلفية مراقبة أداء التطبيقات (⁨APM⁩).

لا تجري أي عملية تشفيرية في هذه الوحدة، لذا لا يوجد سلوك خاص بوضع ⁨FIPS⁩.

الادعاءالمعيارالبند
يتحكّم وضع تصيير النص في ما إذا كانت المحارف مملوءة أم مُحبَّرة أم لا هذا ولا ذاك (أساس نص ⁨OCR⁩ الخفي).ISO 32000-2:2020§9.3.3
تضع مُشغِّلات إظهار النص المحارف في دفق المحتوى.ISO 32000-2:2020§9.4
تُسنِد بنية البنية المنطقية المحتوى إلى ترتيب قراءة.ISO 32000-2:2020§14.7
تدعم البنية المُوسَّمة إعادة استخدام المحتوى.ISO 32000-2:2020§14.8
تصف عناصر بنية الجدول الصفوف والخلايا.ISO 32000-2:2020§14.8
تُسنِد شجرة البنية المحتوى إلى ترتيب قراءة.ISO 32000-2:2020§14.7

جميع البنود مُعاد صياغتها. لا يُعيد ⁨NextPDF⁩ إنتاج النص المعياري. راجع المعيار المنشور للصياغة المرجعية. لا يطرح ⁨NextPDF⁩ أي ادعاء بدقة ⁨OCR⁩ ولا بمعدّل استرجاع الاستخراج؛ تذكر هذه الصفحة البُنى المُنتَجة وحدود التنسيق، لا ضمان جودة.

  • يستهلك المُستخرِجان المُنظَّم والجدولي بياناتٍ مُستخرَجة سلفًا؛ ولا يُحلِّلان ⁨PDF⁩، ولا يُشغِّلان نموذجًا، ولا يقيسان دقة. والثقة قيمة تمريرية أو افتراضية ثابتة.
  • يحتفظ مرشّح المخطط فقط بالأزواج التي يطابق مفتاحها حقلًا في المخطط ويُبلِّغ عن الحقول المطلوبة المفقودة؛ وأطر إحاطة الجداول المُركَّبة هي تقسيم شبكة منتظمة، لا تخطيطًا مقيسًا.
  • الطبقة القابلة للبحث مستند مُشتق: يُبطَل أي توقيع رقمي قائم ويجب إعادة التحقّق من حالة المطابقة.
  • حين تكون خلفية ⁨OCR⁩ غير متاحة، تسهم الصفحات المتأثرة بصفر كلمة بدلًا من إفشال التشغيل كله بصمت؛ وتُتخطّى افتراضيًا أي صفحة تحمل طبقة نص أصلية قابلة للاستخدام.
  • مُدخَلا الصفحة والحجم محدودان ويفشلان فشلًا مغلقًا عند الفيض. الاستخراج حتمي لمُدخَل ثابت؛ ويعتمد ناتج الطبقة على خلفية ⁨OCR⁩ المُزوَّدة.

توثّق هذه الصفحة السلوك القابل للملاحظة خارجيًا والسطح البرمجي العام المدعوم فقط. أما مسارات فضاء الأسماء الداخلية، وأصناف المساعِدة، وجداول الآليات، وأسماء ملفات أدلة التشغيل، وبادئات التذاكر، فخارج النطاق.

لا يملك ⁨NextPDF Core⁩ (⁨Apache-2.0⁩) أي تنسيق طبقة قابلة للبحث ولا سطح بنية مُتحقَّق منها وفق مخطط — لا شيء؛ فهذه القدرة بلا مكافئ على مستوى ⁨Core⁩. ونموذج ⁨AST⁩ في ⁨Core⁩ هو قاعدة المستند المُحلَّل، لا سطح استخراج أو ⁨OCR⁩.

يشحن ⁨NextPDF Pro⁩ استخراجًا بنيويًا مدفوعًا بـ ⁨AST⁩ على مستند مُحلَّل سلفًا؛ ولا يوفّر بنية مفتاح-قيمة مُتحقَّقًا منها وفق مخطط، ولا إعادة بناء الجداول من الشبكات الخام، ولا تنسيق طبقة قابلة للبحث مدعومة بـ ⁨OCR⁩. تُشحن تلك في حزمة nextpdf/enterprise فقط.

يُوصَف المُستخرِجان المُنظَّم/الجدولي ومُنسِّق الطبقة على مستوى السلوك. وتجري التنقيط الفعلية وحقن النص الخفي بعملية مرافِق منفصلة؛ وأجزاء المرافِق الداخلية ونموذج ⁨OCR⁩ وأي تفصيل تنسيق داخلي خارج نطاق السطح العام. وخلفية ⁨OCR⁩ عقد مُحقَن يزوّده النشر.

يزوّد النشرُ خلفيةَ ⁨OCR⁩ ويُشغِّلها ويختار موضع حساب ⁨OCR⁩ (داخل العملية، أو مرافِق محلي، أو خدمة بعيدة) — وبالتالي موضع حساب صور المستند والنص المُتعرَّف عليه وتخزينهما. يُنسّق ⁨NextPDF Enterprise⁩ سير العمل ويُنتج بيانات النتيجة الوصفية؛ ولا يُضمِّن نموذج ⁨OCR⁩ ولا يضمن دقة التعرّف ولا معدّل استرجاع الاستخراج.

لا ينطبق أي قيد لمراقبة التصدير على سطح ⁨Intelligence⁩. لا تؤكّد المكتبة أي ضمان لدقة ⁨OCR⁩ ولا لمعدّل استرجاع الاستخراج ولا أي حالة امتثال تنظيمي. هذه الوثائق ليست رأيًا قانونيًا؛ استشر مستشاري الامتثال والشؤون القانونية لديك.