Enterprise 에디션
Intelligence — 심층 참조
한눈에 보기
섹션 제목: “한눈에 보기”이 심층 참조는 키-값 타이핑 및 스키마 검증, 테이블 그리드 합성, 그리고 검색 가능 오버레이 오케스트레이션 경계를 문서화합니다.
가용성 및 라이선스
섹션 제목: “가용성 및 라이선스”이 기능은 NextPDF Enterprise(nextpdf/enterprise)에 포함되며 Enterprise 등급 라이선스 봉투로 활성화됩니다. 해당 엔타이틀먼트가 없는 배포에서는 기능의 클래스가 로드되지 않습니다. 에디션 비교 및 라이선스 받기.
동작 계약
섹션 제목: “동작 계약”StructuredExtractor::extract는 원시 키-값 입력에 타입을 부여합니다.
스키마가 제공되면 키가 스키마 필드와 일치하는 쌍만 유지되며, 명시적
신뢰도가 없는 쌍은 고정 기본값을 받습니다. validateSchema는
발견되지 않은 필수 필드 이름을 반환합니다(비어 있으면 적합). 이
단계는 이미 추출된 데이터에 타입을 부여하고 검증하며, 텍스트를
인식하지 않고 계산된 정밀도를 부여하지 않습니다.
TableExtractor::extract는 원시 행 그리드에서 구조화된 테이블을
빌드합니다. 열 개수는 가장 넓은 행이며, 짧은 행은 빈 셀로
패딩됩니다. 각 셀은 정규화된 페이지 영역의 균일 분할에서 합성된
경계 상자와 고정 기본 신뢰도를 받습니다. 행이나 열이 없는 테이블은
건너뜁니다. 경계 상자는 측정된 레이아웃이 아니라 그리드 합성입니다.
SearchableOverlay::generate는 PDF 헤더를 검증하고, 입력 크기와
페이지 수를 한정하며(오버플로 시 실패-차단), 사용 가능한 텍스트
레이어가 없는 페이지를 탐지하고, 구성된 OCR 백엔드를 구동하며,
페이지별 단어 수와 평균 신뢰도를 반환합니다. 사용 가능한 네이티브
텍스트 레이어가 있는 페이지는 기본적으로 건너뜁니다. 보이지 않는
OCR 텍스트는 글리프를 채우지도 윤곽선을 그리지도 않는 텍스트 렌더링
모드에 의존합니다(ISO 32000-2:2020 §9.3.3). 소스가 태깅된 경우
구조 트리가 콘텐츠를 읽기 순서에 매핑하며(§14.7) 테이블 구조 요소가
행과 셀을 기술합니다(§14.8). 실제 래스터화와 보이지 않는 텍스트
주입은 별도의 사이드카 프로세스에 위임됩니다. PHP 표면은 이를
오케스트레이션하고 결과 메타데이터를 반환합니다. 오버레이 출력은
파생 문서입니다 — 기존 서명은 무효화되며 적합성은 재검증되어야
합니다. 신뢰도는 패스스루이거나 고정 기본값이며, 이 표면은 어떠한 OCR
정확도나 추출 재현율도 단언하지 않습니다.
공개 API 표면
섹션 제목: “공개 API 표면”NextPDF\Enterprise\Intelligence\StructuredExtractor,
NextPDF\Enterprise\Intelligence\ExtractionSchema,
NextPDF\Enterprise\Intelligence\SchemaField,
NextPDF\Enterprise\Intelligence\KeyValuePair,
NextPDF\Enterprise\Intelligence\TableExtractor,
NextPDF\Enterprise\Intelligence\TableResult,
NextPDF\Enterprise\Intelligence\TableCell,
NextPDF\Enterprise\Intelligence\SearchableOverlay,
NextPDF\Enterprise\Intelligence\OverlayConfig,
NextPDF\Enterprise\Intelligence\SearchableOverlayResult,
NextPDF\Enterprise\Intelligence\PageOverlayInfo,
NextPDF\Enterprise\Intelligence\ExtractionConfig, 그리고
ExtractionStrategy / OverlayQuality enum. OCR 백엔드는 배포가
공급하는 주입된 계약입니다. 시그니처는 공개
페이지에 나열되어 있습니다.
적합성
섹션 제목: “적합성”오버레이 메커니즘은 ISO 32000-2:2020 §9.3.3(텍스트 렌더링 모드)에 매핑되며, 태깅된 소스의 경우 §14.7–§14.8(구조 트리 및 테이블 요소)에 매핑됩니다. 구조화 단계는 이미 추출된 데이터를 소비합니다. 품질은 상위 추출기와 OCR 백엔드에 의해 한정됩니다.
엣지 케이스 및 FIPS 모드 동작
섹션 제목: “엣지 케이스 및 FIPS 모드 동작”- 합성된 테이블 경계 상자는 측정된 레이아웃이 아니라 균일 그리드 분할입니다.
- OCR 백엔드를 사용할 수 없을 때, 영향을 받는 페이지는 전체 실행을 조용히 실패시키는 대신 0개의 단어를 기여합니다. 페이지별 결과를 확인하십시오.
- 오버레이 출력은 파생 문서입니다. 서명과 적합성 상태를 재검증하십시오.
- 이 모듈에서는 어떠한 암호화 연산도 일어나지 않으므로 FIPS 모드별 동작이 없습니다.
게시 경계
섹션 제목: “게시 경계”이 페이지는 외부에서 관찰 가능한 동작과 지원되는 공개 API 표면만을 문서화합니다. 내부 네임스페이스 경로, 헬퍼 클래스, 메커니즘 테이블, 런북 파일명, 티켓 접두사는 범위 밖입니다.
Core 대체 수단
섹션 제목: “Core 대체 수단”NextPDF Core(Apache-2.0)에는 검색 가능 오버레이 오케스트레이션도 스키마 검증 구조화 표면도 없습니다 — 전무합니다. 이 기능에는 Core 등급에 해당하는 것이 없습니다.
Pro 대체 수단
섹션 제목: “Pro 대체 수단”NextPDF Pro는 이미 파싱된 문서에 대한 구조적 AST 기반 추출을 제공합니다. 스키마 검증 키-값 구조화, 원시 그리드로부터의 테이블 재구성, OCR 기반 검색 가능 오버레이 오케스트레이션은 제공하지 않습니다. 이러한 기능은 nextpdf/enterprise 패키지에만 포함됩니다.
Enterprise 경계 노트
섹션 제목: “Enterprise 경계 노트”키-값 타이핑, 스키마 검증, 테이블 그리드 합성, 오버레이 오케스트레이션은 동작 수준에서 설명됩니다. 실제 래스터화와 보이지 않는 텍스트 주입은 별도의 사이드카 프로세스에서 실행됩니다. 사이드카 내부, OCR 모델, 모든 내부 오케스트레이션 세부 정보는 범위 밖이며 여기에서 재현하지 않습니다. OCR 백엔드는 배포가 공급하는 주입된 계약입니다.
배포 경계
섹션 제목: “배포 경계”배포가 OCR 백엔드를 공급 및 운영하고 OCR이 계산되는 위치 — 따라서 문서 이미지와 인식된 텍스트가 계산되고 저장되는 위치 — 를 선택합니다. 이 표면은 입력 크기와 페이지 수를 한정하고 오버플로 시 실패-차단됩니다. NextPDF Enterprise는 워크플로를 오케스트레이션하고 결과 메타데이터를 반환합니다. OCR 모델을 임베드하거나 인식 정확도 또는 추출 재현율을 보장하지 않습니다.
법적 준수 경계
섹션 제목: “법적 준수 경계”이 표면에는 어떠한 수출 통제 제한도 적용되지 않습니다. 이 표면은 어떠한 OCR 정확도나 추출 재현율 보장도 단언하지 않으며 어떠한 규제 준수 상태도 단언하지 않습니다. 이 참조는 법률 의견이 아닙니다.