सामग्री पर जाएँ
दस्तावेज़

DataMask

Referential integrity खोए बिना production data को dev/staging में mask करें। KMS-derived deterministic seeds (HKDF fallback), ML-based PII detection, dry-run preview, k-anonymity verification, और Ed25519-signed audit handshake।

यह क्या है

एक workspace + engine जो source से target तक LGPD-grade masking job चलाता है। संवेदनशील fields एक 3-signal classifier (regex + heuristics + ML) के माध्यम से पता लगाए जाते हैं, फिर deterministic functions (HKDF-derived per field) के साथ transform किए जाते हैं ताकि वही source value हमेशा उसी masked value पर map हो — collections के बीच referential integrity preserved है।

कब उपयोग करें

Production से dev / staging refresh करने से पहले चलाएँ। Masked target तक पहुँच रखने वाला कोई भी व्यक्ति production का वही schema और statistical distribution पाता है, लेकिन हर PII column बदल दिया जाता है — DPO / ANPD / external dev teams LGPD breach के बिना data का उपयोग कर सकते हैं।

इसे कैसे खोलें

  1. NoSqlStudio desktop ऐप में, Tools menu → Migrate and Diff → Data Mask खोलें, या Ctrl+Alt+K दबाएँ।
  2. एक workspace tab शीर्ष पर source / target picker, center में field policy editor, और दाहिनी ओर dry-run preview के साथ खुलता है।
  3. Source और target connections चुनें, फिर mask करने के लिए database और collections चुनें।

एक mask plan बनाना

  1. Scanner — एक sample पर PII detector चलाने के लिए "Scan source" क्लिक करें। Output एक per-field classification है: not_sensitive / personal_low / personal_medium / personal_high / checksum_match।
  2. Policy — हर flagged field के लिए, engine एक transform प्रस्तावित करता है (hash / shuffle / format-preserving / nullify / leave)। आप per field override कर सकते हैं।
  3. Audit handshake — आवश्यक tiers के लिए, engine एक license-server-signed handshake (Ed25519) fire करता है। Signed token हर audit line में embed होता है ताकि एक external auditor run को cryptographically verify कर सके।
  4. Dry-run — memory में 100 sample documents mask करने और side by side before/after render करने के लिए "Preview" क्लिक करें। Target पर अभी तक कुछ नहीं लिखा गया है।
  5. k-anonymity — एक न्यूनतम k सेट करें। यदि quasi-identifiers (zipcode + age + gender) का कोई भी combination k से छोटा group उत्पन्न करता है तो engine mask लागू करने से इनकार करता है।
  6. Justification — संवेदनशील fields के लिए, engine audit log में stored एक free-text justification की आवश्यकता करता है।
  7. Apply — "Start mask" क्लिक करें। Engine progress bar, throughput, और built-in resume-on-failure के साथ masked documents को target में लिखता है। Audit log policy fingerprint, target namespaces, और outcome रिकॉर्ड करता है।

KMS-derived seeds

Deterministic masking के लिए, हर field HKDF के माध्यम से एक root secret से derived per-field seed का उपयोग करता है। Root secret HashiCorp Vault, AWS KMS, Azure Key Vault, या GCP KMS में रह सकता है — workstation पर एक बार configured। बिना KMS के, engine local HKDF seed पर fall back करता है (अभी भी deterministic, लेकिन rotation manual key replacement की आवश्यकता होती है)।

Right-to-be-Forgotten executor

LGPD Art. 18 erasure requests के लिए एक अलग sub-workflow। पूर्ण flow के लिए RTBF Wizard doc देखें — DataMask engine substrate है जो वास्तव में erase करता है।

सीमाएँ (v1)

  • KMS providers वैकल्पिक हैं। एक के बिना, local HKDF seed userData में रहता है और rotation manual है। Tier-gated।
  • Schema-drift detection केवल last snapshot के बाद से changes पकड़ता है। यदि source schema scan और apply के बीच बदला, engine चेतावनी देता है; policy को auto-evolve नहीं करता।
  • k-anonymity check sample-based है (default 10k docs)। Ironclad guarantees के लिए k को high सेट करें और per-bucket report की समीक्षा करें।