Przejdź do głównej zawartości
getnextpdf.com

Enterprise edycja

Prywatność

NextPDF Enterprise Privacy wykrywa tekst pasujący do skonfigurowanych wzorców PII i albo go redaguje, albo ukrywa wiersze, które go zawierają, albo zastępuje go odwracalnymi, deterministycznymi pseudonimami zabezpieczonymi zaszyfrowaną w spoczynku mapą. Usuwa treść pasującą do skonfigurowanych reguł w testowanym zakresie. Nie gwarantuje całkowitego usunięcia PII i nie jest oświadczeniem o zgodności regulacyjnej.

Ta możliwość jest dostarczana w NextPDF Enterprise (nextpdf/enterprise) i aktywuje się wraz z kopertą licencyjną poziomu Enterprise. Wdrożenie bez tego uprawnienia nie wczytuje klas tej możliwości. Porównaj edycje i uzyskaj licencję.

Okno terminala
composer require nextpdf/enterprise:^3

Wykrywanie jest oparte na wzorcach. Detektor skanuje tekst względem rejestru wzorców wyrażeń regularnych i dostarcza wbudowane wzorce dla adresów e-mail, numerów telefonów, numerów Social Security Stanów Zjednoczonych, numerów kart kredytowych oraz tajwańskich krajowych numerów identyfikacyjnych. Wdrożenie może zarejestrować dodatkowe wzorce. Wykrywanie znajduje wyłącznie skonfigurowane typy; wartość, której żaden wzorzec nie dopasuje, nie jest wykrywana, a zeskanowana strona bez warstwy tekstowej nie daje żadnych dopasowań.

Polityka redakcji steruje zachowaniem. W trybie tylko wykrywania silnik zwraca ustalenia bez zmiany treści. W trybie redakcji zastępuje każdy dopasowany fragment zamianą na czarny prostokąt, biały prostokąt lub tekst. De-identyfikator dodaje strategię ukrywania, która usuwa całe wiersze zawierające dopasowanie zamiast maskować pojedyncze fragmenty. Każdy przebieg zwraca SHA-256 oryginalnego tekstu, zmodyfikowaną treść, raport szczegółowy oraz flagę modyfikacji.

Pseudonimizacja jest odwracalna z założenia. Silnik zastępuje wykryte encje deterministycznymi, świadomymi formatu pseudonimami wyprowadzonymi z HMAC nad oryginalną wartością oraz ziarna dla danej sesji, dzięki czemu ta sama wartość odwzorowuje się spójnie w obrębie sesji, podczas gdy między sesjami tokeny nie korelują przez deterministyczną równość. Mapa oryginał-do-pseudonimu jest serializowana i szyfrowana w spoczynku za pomocą AES-256-GCM oraz wersjonowanego klucza, co wspiera rotację kluczy. Rehydracja przywraca oryginalne wartości, ale tylko z poprawnym kluczem oraz pasującą zaszyfrowaną mapą; bez nich oryginalne wartości nie są odtwarzalne z samego spseudonimizowanego tekstu.

Te operacje realizują de-identyfikację, która usuwa powiązanie między danymi a osobą — ISO/IEC 29100:2024 §2. Pseudonimizacja zastępuje identyfikator aliasem i jest z definicji odwracalna przy osobno przechowywanym odwzorowaniu — ISO/IEC 29100:2024 §2. Anonimizacja dąży do nieodwracalnego uniemożliwienia identyfikacji — ISO/IEC 29100:2024 §2; ta powierzchnia Enterprise wykonuje redakcję ograniczoną wzorcem, ukrywanie oraz odwracalną pseudonimizację, a nie anonimizację. Resztkowe ryzyko ponownej identyfikacji zależy od atrybutów, które pozostają po de-identyfikacji — ISO/IEC 29100:2024 §2, a de-identyfikacja zmniejsza, lecz nie eliminuje tego ryzyka — ISO/IEC 29151:2017. Traktuj wynik jako treść pasującą do skonfigurowanych reguł usuniętą lub zastąpioną w testowanym zakresie, a nie jako gwarancję całkowitego usunięcia PII, nieodwracalności ani zgodności regulacyjnej.

Odwracalność jest nośnym wyborem. Pseudonimy to wyniki HMAC-SHA256 nad oryginalną wartością oraz ziarnem dla danej sesji, dzięki czemu ta sama wartość odwzorowuje się na ten sam token przez całą sesję, a wewnętrzne relacje dokumentu zostają zachowane. Świeże losowe ziarno na sesję oznacza, że ta sama wartość nie odwzorowuje się na ten sam token między sesjami, więc pseudonimy nie korelują przez deterministyczną równość tokenów między sesjami, co zmniejsza deterministyczną możliwość powiązania bez centralnego wyszukiwania. Odwzorowanie jest celowo zachowywane — szyfrowane w spoczynku za pomocą AES-256-GCM — aby autoryzowana rehydracja mogła przywrócić oryginały; ta odwracalność jest tym, co czyni to pseudonimizacją zgodnie z ISO/IEC 29100:2024 §2, a nie anonimizacją. Kompromis jest przyjęty: to zaszyfrowana mapa, a nie spseudonimizowany tekst, staje się wrażliwym artefaktem, więc poufność sprowadza się do pieczy nad kluczem. Świadome formatu tokeny zachowują kształt każdej encji, więc parsery po stronie odbiorcy nadal działają, kosztem tego, że walidatory sum kontrolnych mogą odrzucić ukształtowaną, lecz syntetyczną wartość.

Tło projektowe: Redakcja to nie czarny prostokąt.

TypRodzajRolaStabilnośćOd wersji
PiiDetectorklasaWykrywanie PII oparte na wzorcach; obsługuje rejestrację niestandardowych wzorcówstable2.2.0
RedactionEngineklasaRedakcja tekstu tylko wykrywająca lub destrukcyjna, według politykistable2.2.0
DeIdentifierklasaRozdział strategii redakcji lub ukrywania wierszystable2.2.0
RedactionPolicyklasaDocelowe typy encji, przełącznik redakcji, styl zamianystable2.2.0
PseudonymizationEngineklasaDeterministyczna, świadoma formatu zamiana na pseudonimystable2.2.0
PrivacyGatewayklasaPseudonimizacja/rehydracja w zakresie dokumentu z audytemstable2.2.0
RehydrationServiceklasaPrzywraca oryginały z zaszyfrowanej mapystable2.2.0
EncryptedMapSerializerklasaSerializacja mapy w spoczynku w AES-256-GCM z wersjonowaniem kluczystable2.2.0
PrivacyAuditTrailklasaDziennik tylko do dopisywania operacji pseudonimizacji/rehydracjistable2.2.0
EntityType / RedactionStyle / DeIdentificationStrategyenumySłownictwo encji, stylu i strategiistable2.2.0

Ścieżka audytu jest z kontraktu tylko do dopisywania: rejestruje identyfikator sesji, operację, liczbę encji, skrót polityki, znacznik czasu oraz identyfikator najemcy. Nie zapisuje wykrytych wartości.

Detect and redact configured PII
<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Privacy\PiiDetector;
use NextPDF\Enterprise\Privacy\RedactionEngine;
use NextPDF\Enterprise\Privacy\RedactionPolicy;
/**
* Redact every configured entity type from text content.
*
* @param string $content The text to process.
*
* @return string The redacted text.
*/
function redactAll(string $content): string
{
$engine = new RedactionEngine(new PiiDetector());
return $engine->redact($content, RedactionPolicy::allEntities())
->redactedContent;
}

RedactionPolicy::allEntities() obejmuje wbudowane typy. Wartość, której żaden skonfigurowany wzorzec nie dopasuje, nie jest redagowana.

Reversible pseudonymization with audit and safe logging
<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Privacy\PrivacyGateway;
use NextPDF\Enterprise\Privacy\PrivacyPolicy;
use NextPDF\Enterprise\Privacy\EntityType;
use Psr\Log\LoggerInterface;
final readonly class DocumentDeidentifier
{
public function __construct(
private PrivacyGateway $gateway,
private LoggerInterface $logger,
) {}
/**
* Pseudonymize a document and return the encrypted reversal map.
*
* @param non-empty-string $text Document text.
* @param list<array{text: non-empty-string, type: EntityType}> $entities Detected entities.
*
* @return array{text: string, encrypted_map: non-empty-string}
*/
public function process(string $text, array $entities): array
{
$policy = PrivacyPolicy::piiOnly('session-' . bin2hex(random_bytes(6)));
$result = $this->gateway->pseudonymize($text, $entities, $policy);
$this->logger->info('Pseudonymization complete', [
'entityCount' => $result['entity_count'],
]);
return ['text' => $result['text'], 'encrypted_map' => $result['encrypted_map']];
}
}

Rekord logu niesie wyłącznie licznik. Nie niesie tekstu dokumentu, wykrytych wartości ani zaszyfrowanej mapy.

  • Wykrywanie jest ograniczone wzorcem. Wartość, której żaden wzorzec nie dopasuje, nie jest wykrywana. Silnik nie twierdzi, że znaleziono wszystkie dane osobowe, a wynik nie jest gwarancją całkowitego usunięcia PII.
  • Zeskanowane strony nie mają warstwy tekstowej. Wykrywanie wzorców tekstowych nie daje dopasowań; jeśli najpierw potrzebny jest tekst, połącz to z powierzchnią nakładki z możliwością wyszukiwania z modułu Intelligence.
  • Pseudonimizacja jest z definicji odwracalna. Każdy, kto ma poprawny klucz oraz pasującą zaszyfrowaną mapę, może przywrócić oryginały. To nie jest anonimizacja; nie przedstawiaj spseudonimizowanego wyniku jako nieodwracalnego.
  • Świadome formatu pseudonimy zachowują kształt (na przykład token przypominający identyfikator lub adres e-mail). System po stronie odbiorcy, który waliduje sumy kontrolne, może odrzucić pseudonim; jest to oczekiwane.
  • Zaszyfrowana mapa jest wrażliwym artefaktem. Jej utrata uniemożliwia rehydrację; jej wyciek wraz z kluczem sprawia, że pseudonimizacja staje się odwracalna przez stronę trzecią. Traktuj pieczę nad kluczem oraz przechowywanie mapy jako odpowiedzialność wdrożenia.
  • Redakcja działa na przekazanej do niej treści tekstowej. Sama z siebie nie spłaszcza obrazu, nie usuwa miniatury ani nie usuwa metadanych dokumentu; odpowiednio dobierz zakres potoku.

Koszt wykrywania skaluje się wraz z liczbą wzorców oraz długością tekstu. Pseudonimizacja dodaje jeden HMAC na unikatową encję oraz pieczętowanie mapy w AES-256-GCM. Budżet czasu 1500 ms obejmuje typowy dokument biznesowy. Profil odtwarzalności to structural: pseudonimy są deterministyczne dla ustalonego ziarna, ale znacznik czasu audytu oraz losowe ziarno sesji różnią się między przebiegami, więc dwa przebiegi różnią się w tych polach.

Mapa w spoczynku korzysta z szyfrowania uwierzytelnionego. Mapa jest pieczętowana za pomocą AES-256-GCM oraz wersjonowanego klucza; rehydracja jest niemożliwa bez poprawnej wersji klucza. Generowanie, piecza oraz rotacja klucza należą do odpowiedzialności wdrożenia; biblioteka konsumuje klucz, a nie zarządza magazynem kluczy. Ścieżka audytu jest tylko do dopisywania i rejestruje metadane, nigdy wykrytych wartości. Każde źródło normatywne jest parafrazowane i żadne nie jest odtwarzane.

Wykrywanie, redakcja oraz pseudonimizacja działają w procesie na hoście. Przy żadnej z tych operacji treść dokumentu nie opuszcza hosta. Zaszyfrowana mapa oraz wszelki rehydrowany wynik to dane osobowe; to, gdzie są przechowywane i która jurysdykcja je przetwarza, należy do odpowiedzialności wdrożenia, poza granicą biblioteki. Biblioteka wykonuje de-identyfikację ograniczoną wzorcem w testowanym zakresie; nie certyfikuje zgodności z RODO, HIPAA ani żadną inną regulacją i nie wykonuje anonimizacji. Resztkowe ryzyko ponownej identyfikacji zależy od atrybutów, które pozostają — ISO/IEC 29151:2017.

Biblioteka zgłasza typowane wyjątki z komunikatami strukturalnymi i nigdy nie umieszcza wykrytych wartości, bajtów dokumentu ani zaszyfrowanej mapy w treści wyjątku. Wdrożenie, które loguje wokół tej powierzchni, musi logować liczniki oraz skrót polityki — jak pokazano w przykładzie produkcyjnym — i nie może logować surowego ładunku PDF, tekstu wykrytych encji ani mapy pseudonimów do logów ani do backendu APM. Bezpiecznym rekordem do zachowania jest ścieżka audytu tylko do dopisywania.

Mapa w spoczynku korzysta z AES-256-GCM za pośrednictwem dostawcy kryptografii platformy. Gdy host uruchamia dostawcę zwalidowanego zgodnie z FIPS, ta operacja działa w zwalidowanej granicy. NextPDF Enterprise wykonuje montaż strukturalny i sam nie jest modułem kryptograficznym zwalidowanym zgodnie z FIPS oraz nie wysuwa żadnej deklaracji certyfikacji FIPS.

StwierdzenieStandardKlauzula
De-identyfikacja usuwa powiązanie między danymi a osobą.ISO/IEC 29100:2024§2
Pseudonimizacja zastępuje identyfikator aliasem i jest odwracalna przy osobnym odwzorowaniu.ISO/IEC 29100:2024§2
Anonimizacja dąży do nieodwracalnego uniemożliwienia identyfikacji (ta powierzchnia nie anonimizuje).ISO/IEC 29100:2024§2
Resztkowe ryzyko ponownej identyfikacji zależy od pozostałych atrybutów.ISO/IEC 29100:2024§2
Mechanizmy kontroli prywatności są stosowane do PII.ISO/IEC 29100:2024§6.5
De-identyfikacja zmniejsza, lecz nie eliminuje resztkowego ryzyka.ISO/IEC 29151:2017de-identification controls
Minimalizuj możliwość powiązania danych po de-identyfikacji.ISO/IEC 29151:2017PII minimization
Mechanizmy kontroli są stosowane w celu ochrony PII.ISO/IEC 29151:2017controls

Wszystkie klauzule są parafrazowane. NextPDF nie odtwarza tekstu normatywnego. W sprawie wiążącego brzmienia zapoznaj się z opublikowanymi standardami. NextPDF nie wysuwa żadnej deklaracji zgodności z regulacją dotyczącą prywatności; ta strona przedstawia testowane zachowanie de-identyfikacji oraz jego granice, a nie certyfikowany stan zgodności.

  • Wykrywanie jest ograniczone wzorcem: znajduje wyłącznie skonfigurowane typy; wartość, której żaden wzorzec nie dopasuje, nie jest wykrywana, a strona bez warstwy tekstowej nie daje dopasowań.
  • Polityka redakcji wybiera tryb tylko wykrywania, zamianę fragmentu (czarny prostokąt / biały prostokąt / tekst) lub ukrywanie całych wierszy; każdy przebieg zwraca SHA-256 oryginalnego tekstu, zmodyfikowaną treść, raport szczegółowy oraz flagę modyfikacji.
  • Pseudonimizacja jest odwracalna z założenia: deterministyczne pseudonimy wyprowadzone z HMAC są spójne w obrębie sesji, a rehydracja wymaga poprawnej wersji klucza oraz pasującej mapy w spoczynku w AES-256-GCM.
  • Ścieżka audytu tylko do dopisywania rejestruje identyfikator sesji, operację, liczbę encji, skrót polityki, znacznik czasu oraz identyfikator najemcy — nigdy wykrytych wartości.
  • Wynik to treść pasująca do skonfigurowanych reguł usunięta lub zastąpiona w testowanym zakresie, a nie gwarancja całkowitego usunięcia PII, nieodwracalności ani zgodności regulacyjnej.

Ta strona dokumentuje wyłącznie zewnętrznie obserwowalne zachowanie oraz obsługiwaną publiczną powierzchnię API. Wewnętrzne ścieżki przestrzeni nazw, klasy pomocnicze, tabele mechanizmów, nazwy plików runbooków oraz prefiksy zgłoszeń są poza zakresem.

NextPDF Core (Apache-2.0) nie ma powierzchni wykrywania PII, redakcji ani pseudonimizacji — żadnej; ta możliwość nie ma odpowiednika na poziomie Core.

NextPDF Pro dostarcza powierzchnię wykrywania PII w warstwie tekstowej oraz maskowanie w czasie generowania; nie zapewnia odwracalnej pseudonimizacji, zaszyfrowanej mapy w spoczynku, ukrywania wierszy ani ścieżki audytu tylko do dopisywania. Te elementy są dostarczane wyłącznie w pakiecie nextpdf/enterprise.

Wykrywanie, redakcja, ukrywanie oraz pseudonimizacja są opisane na poziomie zachowania. Biblioteka konsumuje klucz szyfrowania; nie zarządza magazynem kluczy, a wewnętrzne mechanizmy generowania, pieczy oraz rotacji klucza są poza zakresem powierzchni publicznej.

Zaszyfrowana mapa oraz wszelki rehydrowany wynik to dane osobowe; to, gdzie są przechowywane i która jurysdykcja je przetwarza, należy do odpowiedzialności wdrożenia, poza granicą biblioteki. Generowanie, piecza oraz rotacja klucza należą do odpowiedzialności wdrożenia — biblioteka konsumuje wersję klucza, a nie zarządza magazynem kluczy. Utrata mapy uniemożliwia rehydrację; jej wyciek wraz z kluczem sprawia, że pseudonimizacja staje się odwracalna przez stronę trzecią.

Mapa w spoczynku korzysta z szyfrowania uwierzytelnionego. Biblioteka wykonuje de-identyfikację ograniczoną wzorcem w testowanym zakresie i nie certyfikuje zgodności z RODO, HIPAA ani żadną inną regulacją oraz nie wykonuje anonimizacji. Niniejsza dokumentacja nie jest opinią prawną; skonsultuj się z własnymi doradcami ds. zgodności i prawnymi.