Data & More er en multi-tenant GDPR- og datagovernance-platform. Den forbinder sig til en organisations e-mail, fillagring og chatsystemer, læser alt, den finder, klassificerer hvert dokument for personlige og følsomme data og hjælper dataejeren med at handle på det. Denne side er kortet: hvad platformen gør, hvordan delene passer sammen, og hvor De kan læse detaljerne.
Man kan ikke forvalte det, man ikke først har læst, klassificeret og forstået.
~42mikrotjenester
2kernesprog: Python, Java
7pipelinestadier, fra kilde til rapport
1fælles lager: Elasticsearch
Afsnit 01Sådan fungerer det
Klassificer, Verificer, Slet,altid aktiv
Platformen kører kontinuerligt og ikke efter et fast kvartalsmæssigt forløb. Processen har et navn,Klassificer, Verificer, Slet: platformen klassificerer det, der befinder sig i arkivet, dataejeren verificerer fundene på egne præmisser, og resultatet er sletning (eller arkivering, redigering eller begrænsning) udført i kildesystemet. Kilder og undtagelser er den engangskonfiguration, der driver løkken.
Klassificer – platformens opgaveVerificer – dataejerens opgaveSlet – det kontinuerlige mål
Hvor dataene kommer fra
Tilsluttede kilder
Hver kilde er forbundet via én af platformens indsugningsconnectorer. Cyklussen starter her og skriver også fund tilbage hertil.
Sletning er aldrig automatisk. Dataejeren gennemgår hvert fund lokalt og vælger én af tre handlinger, som registreres i revisionsloggen.
Begræns, posten forbliver på sin plads, men markeres til begrænset adgang.
Arkivér (opbevaring), posten flyttes til et arkiv med en defineret opbevaringsregel.
Slet, posten fjernes permanent fra kildesystemet.
Afsnit 02Konceptuel model
Hvordan delene passersammen
Alle forespørgsler indgår via én TLS-terminerende NGINX-proxy og routes til applikationsniveauet: Vue-klienten, den primære Flask API samt IAM-, analyse- og LLM-tjenesterne. API'en sender tidskrævende opgaver videre til en asynkron rygrad af Celery-arbejdere via RabbitMQ, som også transporterer scan-, indsugnings- og håndhævelsesevent til Java-niveauet. Det tunge arbejde (crawling af kilder, udtrækning af tekst og håndhævelse af politik) kører i dette Java-niveau. Under det hele befinder datalaget sig, med Elasticsearch som det dokumentlager, alle tjenester deler.
Anmodnings- og datastiVedvarende lager / outputUnderkomponent inden for et niveau
Den fulde servicestruktur, gateway, lejemål og leveringsmodel er beskrevet i Platformsarkitektur nedenfor.
Afsnit 03Ende til ende
Fra en rå kilde til en håndhævet politik
Et dokument gennemgår den samme proces hver gang. En kilde konfigureres én gang; herefter crawler platformen den, udtrækker teksten, profilerer den for personoplysninger, kontrollerer den mod lejerens politikker, handler på baggrund af afgørelsen og rapporterer resultatet. Billige, deterministiske trin udføres først; de omkostningstunge AI- og håndhævelsestrin udføres kun på de dokumenter, der når frem til dem.
Primær pipeline-stiDelt lager, berørt på hvert stadieOutput til brugeren
Hvad platformen gør, i seks verber
01 · Tilslut
Tilslut
Integrer e-mail, fillagring og chat via ét connector-modul pr. kilde.
02 · Scan
Scan og læs
Gennemgå hver kilde og udtræk tekst, herunder OCR for billeder og scanninger.
03 · Klassificer
Klassificer
Profiler hvert dokument for personlige og følsomme data op imod taksonomien.
04 · Beslut
Beslut
Kontroller fund op imod lejers opbevarings- og følsomhedspolitikker.
05 · Handl
Handl
Rediger, arkiver, begræns eller slet – altid bekræftet af dataejeren.
06 · Rapportér
Rapportér
Dashboards, advarsler og eksporterbare rapporter til dokumentation og revision.
Afsnit 04Læs detaljerne
Inde i dette dybt dyk
Kortet ovenfor er bevidst overfladisk. Feltmanualerne nedenfor indeholder detaljerne – hver enkelt dækker et distinkt lag af platformen uden overlap imellem dem.
Dette overblik er indgangspunktet til afsnittet Dybt Dyk. Læs det for at få et billede af hele platformen, og følg derefter et link ovenfor til det lag, De har behov for. Hvert dybt dyk er selvstændigt og forudsætter kun det, der fremgår af denne side.