Enterprise édition
Confidentialité
NextPDF Enterprise Privacy détecte le texte qui correspond aux motifs de données personnelles configurés et soit le caviarde, soit supprime les lignes qui le contiennent, soit le remplace par des pseudonymes déterministes réversibles adossés à une table chiffrée au repos. Il supprime le contenu correspondant aux règles configurées telles que testées. Il ne garantit pas la suppression complète des données personnelles et ne constitue pas une déclaration de conformité réglementaire.
Disponibilité et licence
Section intitulée « Disponibilité et licence »Cette capacité est livrée dans NextPDF Enterprise (nextpdf/enterprise) et s’active avec une enveloppe de licence de palier Enterprise. Un déploiement sans ce droit ne charge pas les classes de la capacité. Comparer les éditions et obtenir une licence.
Installation
Section intitulée « Installation »composer require nextpdf/enterprise:^3Aperçu conceptuel
Section intitulée « Aperçu conceptuel »La détection est fondée sur des motifs. Un détecteur scanne le texte par rapport à un registre de motifs d’expressions régulières et fournit des motifs intégrés pour les adresses e-mail, les numéros de téléphone, les numéros de sécurité sociale des États-Unis, les numéros de carte de crédit et les numéros d’identification nationale de Taïwan. Un déploiement peut enregistrer des motifs supplémentaires. La détection ne trouve que les types configurés ; une valeur qu’aucun motif ne reconnaît n’est pas détectée, et une page numérisée sans couche de texte ne produit aucune correspondance.
Une politique de caviardage contrôle le comportement. En mode détection seule, le moteur renvoie les constats sans modifier le contenu. En mode caviardage, il remplace chaque plage reconnue par un remplacement en boîte noire, en boîte blanche ou par du texte. Le dés-identificateur ajoute une stratégie de suppression qui retire des lignes entières contenant une correspondance au lieu de masquer des plages individuelles. Chaque exécution renvoie le SHA-256 du texte d’origine, le contenu modifié, un rapport détaillé et un drapeau de modification.
La pseudonymisation est réversible par conception. Le moteur remplace les entités détectées par des pseudonymes déterministes, conscients du format, dérivés d’un HMAC sur la valeur d’origine et d’une graine par session, de sorte que la même valeur se mappe de manière cohérente au sein d’une session, tandis que d’une session à l’autre les jetons ne corrèlent pas par égalité déterministe. La table d’origine-vers-pseudonyme est sérialisée et chiffrée au repos avec AES-256-GCM et une clé versionnée, prenant en charge la rotation des clés. La réhydratation restaure les valeurs d’origine, mais seulement avec la clé correcte et la table chiffrée correspondante ; sans elles, les valeurs d’origine ne sont pas récupérables à partir du seul texte pseudonymisé.
Ces opérations mettent en œuvre la dés-identification, qui supprime l’association entre les données et la personne — ISO/IEC 29100:2024 §2. La pseudonymisation remplace un identifiant par un alias et est, par définition, réversible avec le mappage détenu séparément — ISO/IEC 29100:2024 §2. L’anonymisation vise à empêcher l’identification de manière irréversible — ISO/IEC 29100:2024 §2 ; cette surface Enterprise effectue un caviardage, une suppression et une pseudonymisation réversible à portée de motif, pas une anonymisation. Le risque résiduel de ré-identification dépend des attributs qui subsistent après la dés-identification — ISO/IEC 29100:2024 §2, et la dés-identification réduit ce risque mais ne l’élimine pas — ISO/IEC 29151:2017. Traite la sortie comme un contenu correspondant aux règles configurées supprimé ou remplacé tel que testé, et non comme une garantie de suppression complète des données personnelles, d’irréversibilité ou de conformité réglementaire.
Pourquoi cela fonctionne ainsi
Section intitulée « Pourquoi cela fonctionne ainsi »La réversibilité est le choix porteur. Les pseudonymes sont des sorties HMAC-SHA256 sur la valeur d’origine et une graine par session, de sorte que la même valeur se mappe au même jeton tout au long d’une session et que les relations internes du document survivent. Une nouvelle graine aléatoire par session signifie que la même valeur ne se mappe pas au même jeton d’une session à l’autre, de sorte que les pseudonymes ne corrèlent pas par égalité déterministe de jeton entre les sessions, ce qui réduit la corrélabilité déterministe sans recherche centralisée. Le mappage est délibérément conservé — chiffré au repos avec AES-256-GCM — afin qu’une réhydratation autorisée puisse restaurer les originaux ; c’est cette réversibilité qui fait de ceci une pseudonymisation au sens de l’ISO/IEC 29100:2024 §2, et non une anonymisation. Le compromis est accepté : la table chiffrée, et non le texte pseudonymisé, devient l’artefact sensible, de sorte que la confidentialité se réduit à la garde des clés. Les jetons conscients du format préservent la forme de chaque entité, de sorte que les analyseurs en aval continuent de fonctionner, au prix que des validateurs de somme de contrôle puissent rejeter une valeur mise en forme mais synthétique.
Contexte de conception : Le caviardage n’est pas un rectangle noir.
Surface d’API
Section intitulée « Surface d’API »| Type | Genre | Rôle | Stabilité | Depuis |
|---|---|---|---|---|
PiiDetector | classe | Détection de données personnelles fondée sur des motifs ; prend en charge l’enregistrement de motifs personnalisés | stable | 2.2.0 |
RedactionEngine | classe | Caviardage de texte en détection seule ou destructif selon une politique | stable | 2.2.0 |
DeIdentifier | classe | Aiguillage de stratégie caviardage ou suppression de lignes | stable | 2.2.0 |
RedactionPolicy | classe | Types d’entités cibles, bascule de caviardage, style de remplacement | stable | 2.2.0 |
PseudonymizationEngine | classe | Remplacement déterministe par pseudonyme conscient du format | stable | 2.2.0 |
PrivacyGateway | classe | Pseudonymisation/réhydratation à portée de document avec audit | stable | 2.2.0 |
RehydrationService | classe | Restaure les originaux à partir d’une table chiffrée | stable | 2.2.0 |
EncryptedMapSerializer | classe | Sérialisation de la table au repos AES-256-GCM avec versionnement de clé | stable | 2.2.0 |
PrivacyAuditTrail | classe | Journal en ajout seul des opérations de pseudonymisation/réhydratation | stable | 2.2.0 |
EntityType / RedactionStyle / DeIdentificationStrategy | énumérations | Vocabulaire d’entité, de style et de stratégie | stable | 2.2.0 |
Le journal d’audit est en ajout seul par contrat : il journalise un id de session, une opération, un nombre d’entités, un hash de politique, un horodatage et un id de locataire. Il n’enregistre pas les valeurs détectées.
Exemple de code — Démarrage rapide
Section intitulée « Exemple de code — Démarrage rapide »<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Privacy\PiiDetector;use NextPDF\Enterprise\Privacy\RedactionEngine;use NextPDF\Enterprise\Privacy\RedactionPolicy;
/** * Redact every configured entity type from text content. * * @param string $content The text to process. * * @return string The redacted text. */function redactAll(string $content): string{ $engine = new RedactionEngine(new PiiDetector());
return $engine->redact($content, RedactionPolicy::allEntities()) ->redactedContent;}RedactionPolicy::allEntities() cible les types intégrés. Une valeur qu’aucun motif configuré ne reconnaît n’est pas caviardée.
Exemple de code — Production
Section intitulée « Exemple de code — Production »<?php
declare(strict_types=1);
require_once __DIR__ . '/vendor/autoload.php';
use NextPDF\Enterprise\Privacy\PrivacyGateway;use NextPDF\Enterprise\Privacy\PrivacyPolicy;use NextPDF\Enterprise\Privacy\EntityType;use Psr\Log\LoggerInterface;
final readonly class DocumentDeidentifier{ public function __construct( private PrivacyGateway $gateway, private LoggerInterface $logger, ) {}
/** * Pseudonymize a document and return the encrypted reversal map. * * @param non-empty-string $text Document text. * @param list<array{text: non-empty-string, type: EntityType}> $entities Detected entities. * * @return array{text: string, encrypted_map: non-empty-string} */ public function process(string $text, array $entities): array { $policy = PrivacyPolicy::piiOnly('session-' . bin2hex(random_bytes(6))); $result = $this->gateway->pseudonymize($text, $entities, $policy);
$this->logger->info('Pseudonymization complete', [ 'entityCount' => $result['entity_count'], ]);
return ['text' => $result['text'], 'encrypted_map' => $result['encrypted_map']]; }}L’enregistrement de journal ne porte qu’un décompte. Il ne porte ni le texte du document, ni les valeurs détectées, ni la table chiffrée.
Cas limites et pièges
Section intitulée « Cas limites et pièges »- La détection est à portée de motif. Une valeur qu’aucun motif ne reconnaît n’est pas détectée. Le moteur n’affirme pas que toutes les données personnelles sont trouvées, et le résultat n’est pas une garantie de suppression complète des données personnelles.
- Les pages numérisées n’ont pas de couche de texte. La détection par motif de texte ne produit aucune correspondance ; combine-la avec la surface de calque interrogeable d’Intelligence si du texte est d’abord requis.
- La pseudonymisation est réversible par définition. Quiconque possède la clé correcte et la table chiffrée correspondante peut restaurer les originaux. Ce n’est pas de l’anonymisation ; ne présente pas la sortie pseudonymisée comme irréversible.
- Les pseudonymes conscients du format préservent une forme (par exemple, un jeton de type identifiant ou de type e-mail). Un système en aval qui valide des sommes de contrôle peut rejeter un pseudonyme ; c’est attendu.
- La table chiffrée est l’artefact sensible. La perdre rend la réhydratation impossible ; la divulguer avec sa clé rend la pseudonymisation réversible par un tiers. Traite la garde des clés et le stockage de la table comme une responsabilité de déploiement.
- Le caviardage opère sur le contenu textuel qui lui est passé. Il n’aplatit pas à lui seul une image, ne retire pas une vignette et ne supprime pas les métadonnées du document ; délimite le pipeline en conséquence.
Performance
Section intitulée « Performance »Le coût de détection évolue avec le nombre de motifs et la longueur du texte. La pseudonymisation ajoute un HMAC par entité unique et un scellement AES-256-GCM de la table. Le budget de paroi de 1500 ms couvre un document métier typique. Le profil de reproductibilité est structural : les pseudonymes sont déterministes pour une graine fixe, mais l’horodatage d’audit et la graine de session aléatoire varient d’une exécution à l’autre, de sorte que deux exécutions diffèrent sur ces champs.
Notes de sécurité
Section intitulée « Notes de sécurité »La table au repos utilise un chiffrement authentifié. La table est scellée avec AES-256-GCM et une clé versionnée ; la réhydratation est impossible sans la version de clé correcte. La génération, la garde et la rotation des clés relèvent de la responsabilité du déploiement ; la bibliothèque consomme une clé, elle ne gère pas de magasin de clés. Le journal d’audit est en ajout seul et enregistre des métadonnées, jamais les valeurs détectées. Toute source normative est paraphrasée et aucune n’est reproduite.
Résidence des données et atténuations des données personnelles
Section intitulée « Résidence des données et atténuations des données personnelles »La détection, le caviardage et la pseudonymisation s’exécutent en cours de processus sur l’hôte. Aucun contenu de document ne quitte l’hôte pour aucune de ces opérations. La table chiffrée et toute sortie réhydratée sont des données personnelles ; l’endroit où elles sont stockées, et la juridiction qui les traite, relèvent d’une responsabilité de déploiement hors de la frontière de la bibliothèque. La bibliothèque effectue une dés-identification à portée de motif telle que testée ; elle ne certifie pas la conformité au RGPD, à HIPAA ni à aucune autre réglementation, et elle n’effectue pas d’anonymisation. Le risque résiduel de ré-identification dépend des attributs qui subsistent — ISO/IEC 29151:2017.
Télémétrie sûre et nettoyage des journaux
Section intitulée « Télémétrie sûre et nettoyage des journaux »La bibliothèque lève des exceptions typées avec des messages structurels et ne place jamais de valeurs détectées, d’octets de document ou de table chiffrée dans le texte d’exception. Un déploiement qui journalise autour de cette surface doit journaliser des décomptes et le hash de politique — comme le montre l’exemple de production — et ne doit pas journaliser la charge PDF brute, le texte d’entité détecté ou la table de pseudonymes vers des journaux ou un backend APM. Le journal d’audit en ajout seul est l’enregistrement sûr à conserver.
Comportement en mode FIPS
Section intitulée « Comportement en mode FIPS »La table au repos utilise AES-256-GCM via le fournisseur cryptographique de la plateforme. Lorsque l’hôte exécute un fournisseur validé FIPS, cette opération s’exécute dans la frontière validée. NextPDF Enterprise effectue l’assemblage structurel et n’est pas lui-même un module cryptographique validé FIPS et ne formule aucune revendication de certification FIPS.
Conformité
Section intitulée « Conformité »| Revendication | Norme | Clause |
|---|---|---|
| La dés-identification supprime l’association entre les données et la personne. | ISO/IEC 29100:2024 | §2 |
| La pseudonymisation remplace un identifiant par un alias et est réversible avec le mappage séparé. | ISO/IEC 29100:2024 | §2 |
| L’anonymisation vise à empêcher l’identification de manière irréversible (cette surface n’anonymise pas). | ISO/IEC 29100:2024 | §2 |
| Le risque résiduel de ré-identification dépend des attributs restants. | ISO/IEC 29100:2024 | §2 |
| Des contrôles de confidentialité sont appliqués aux données personnelles. | ISO/IEC 29100:2024 | §6.5 |
| La dés-identification réduit le risque résiduel mais ne l’élimine pas. | ISO/IEC 29151:2017 | contrôles de dés-identification |
| Minimiser la corrélabilité des données dés-identifiées. | ISO/IEC 29151:2017 | minimisation des données personnelles |
| Des contrôles sont appliqués pour protéger les données personnelles. | ISO/IEC 29151:2017 | contrôles |
Toutes les clauses sont paraphrasées. NextPDF ne reproduit pas de texte normatif. Consulte les normes publiées pour la formulation faisant autorité. NextPDF ne formule aucune revendication de conformité à une réglementation de confidentialité ; cette page énonce le comportement de dés-identification testé et ses limites, pas un statut de conformité certifié.
Contrat de comportement
Section intitulée « Contrat de comportement »- La détection est à portée de motif : elle ne trouve que les types configurés ; une valeur qu’aucun motif ne reconnaît n’est pas détectée et une page sans couche de texte ne produit aucune correspondance.
- Une politique de caviardage sélectionne la détection seule, le remplacement de plage (boîte noire / boîte blanche / texte) ou la suppression de ligne entière ; chaque exécution renvoie le SHA-256 du texte d’origine, le contenu modifié, un rapport détaillé et un drapeau de modification.
- La pseudonymisation est réversible par conception : des pseudonymes déterministes dérivés par HMAC sont cohérents au sein d’une session, et la réhydratation exige la version de clé correcte et la table au repos AES-256-GCM correspondante.
- Le journal d’audit en ajout seul enregistre l’id de session, l’opération, le nombre d’entités, le hash de politique, l’horodatage et l’id de locataire — jamais les valeurs détectées.
- La sortie est un contenu correspondant aux règles configurées supprimé ou remplacé tel que testé, pas une garantie de suppression complète des données personnelles, d’irréversibilité ou de conformité réglementaire.
Frontière de publication
Section intitulée « Frontière de publication »Cette page ne documente que le comportement observable de l’extérieur et la surface d’API publique prise en charge. Les chemins d’espace de noms internes, les classes utilitaires, les tables de mécanismes, les noms de fichiers de runbook et les préfixes de ticket sont hors périmètre.
Repli Core
Section intitulée « Repli Core »NextPDF Core (Apache-2.0) n’a aucune surface de détection, de caviardage ou de pseudonymisation de données personnelles — aucune ; cette capacité n’a pas d’équivalent de palier Core.
Repli Pro
Section intitulée « Repli Pro »NextPDF Pro fournit une surface de détection de données personnelles dans la couche de texte et un masquage au moment de la génération ; il ne fournit pas la pseudonymisation réversible, la table chiffrée au repos, la suppression de lignes ni le journal d’audit en ajout seul. Celles-ci sont livrées dans le seul paquet nextpdf/enterprise.
Note sur la frontière Enterprise
Section intitulée « Note sur la frontière Enterprise »La détection, le caviardage, la suppression et la pseudonymisation sont décrits au niveau du comportement. La bibliothèque consomme une clé de chiffrement ; elle ne gère pas de magasin de clés, et les détails internes de génération, de garde et de rotation des clés sont hors du périmètre de la surface publique.
Frontière de déploiement
Section intitulée « Frontière de déploiement »La table chiffrée et toute sortie réhydratée sont des données personnelles ; l’endroit où elles sont stockées et la juridiction qui les traite relèvent d’une responsabilité de déploiement hors de la frontière de la bibliothèque. La génération, la garde et la rotation des clés relèvent de la responsabilité du déploiement — la bibliothèque consomme une version de clé, elle ne gère pas de magasin de clés. Perdre la table rend la réhydratation impossible ; la divulguer avec sa clé rend la pseudonymisation réversible par un tiers.
Frontière de conformité légale
Section intitulée « Frontière de conformité légale »La table au repos utilise un chiffrement authentifié. La bibliothèque effectue une dés-identification à portée de motif telle que testée et ne certifie pas la conformité au RGPD, à HIPAA ni à aucune autre réglementation, et elle n’effectue pas d’anonymisation. Cette documentation n’est pas un avis juridique ; consulte tes propres conseillers en conformité et juridiques.
Voir aussi
Section intitulée « Voir aussi »- Référence Privacy — la surface d’API publique complète du module Privacy.
- Sécurité Pro — masquage Pro et détection de données personnelles dans la couche de texte.
- Forensics — analyse de l’historique des révisions en lecture seule.
- NextPDF Enterprise — la surface complète des fonctionnalités Enterprise.
- Politique de confidentialité — la gestion des données du programme de documentation lui-même.
- Données personnelles · Pseudonymisation · Dés-identification · AES-GCM — termes du glossaire.