Data & MoreTeknikDybdegående indeks

Hele platformen, på étkort.

Data & More er en multi-tenant GDPR- og datagovernance-platform. Den forbinder sig til en organisations e-mail, fillagring og chatsystemer, læser alt, den finder, klassificerer hvert dokument for personlige og følsomme data og hjælper dataejeren med at handle på det. Denne side er kortet: hvad platformen gør, hvordan delene passer sammen, og hvor De kan læse detaljerne.

Man kan ikke forvalte det, man ikke først har læst, klassificeret og forstået.

~42mikrotjenester
2kernesprog: Python, Java
7pipelinestadier, fra kilde til rapport
1fælles lager: Elasticsearch
Afsnit 01Sådan fungerer det

Klassificer, Verificer, Slet,altid aktiv

Platformen kører kontinuerligt og ikke efter et fast kvartalsmæssigt forløb. Processen har et navn,Klassificer, Verificer, Slet: platformen klassificerer det, der befinder sig i arkivet, dataejeren verificerer fundene på egne præmisser, og resultatet er sletning (eller arkivering, redigering eller begrænsning) udført i kildesystemet. Kilder og undtagelser er den engangskonfiguration, der driver løkken.

ALTID AKTIV VERIFICER KLASSIFICER SLET
Klassificer – platformens opgave Verificer – dataejerens opgave Slet – det kontinuerlige mål
Hvor dataene kommer fra

Tilsluttede kilder

Hver kilde er forbundet via én af platformens indsugningsconnectorer. Cyklussen starter her og skriver også fund tilbage hertil.

Office 365ExchangeSharePointOneDrive TeamsOutlookGmailGoogle DriveFildeling
Hvad Slet betyder i praksis

Tre måder at slette på

Sletning er aldrig automatisk. Dataejeren gennemgår hvert fund lokalt og vælger én af tre handlinger, som registreres i revisionsloggen.

  • Begræns, posten forbliver på sin plads, men markeres til begrænset adgang.
  • Arkivér (opbevaring), posten flyttes til et arkiv med en defineret opbevaringsregel.
  • Slet, posten fjernes permanent fra kildesystemet.
Afsnit 02Konceptuel model

Hvordan delene passersammen

Alle forespørgsler indgår via én TLS-terminerende NGINX-proxy og routes til applikationsniveauet: Vue-klienten, den primære Flask API samt IAM-, analyse- og LLM-tjenesterne. API'en sender tidskrævende opgaver videre til en asynkron rygrad af Celery-arbejdere via RabbitMQ, som også transporterer scan-, indsugnings- og håndhævelsesevent til Java-niveauet. Det tunge arbejde (crawling af kilder, udtrækning af tekst og håndhævelse af politik) kører i dette Java-niveau. Under det hele befinder datalaget sig, med Elasticsearch som det dokumentlager, alle tjenester deler.

KANT APPLIKATIONSNIVEAU BESKEDER LAGER TJENESTER INDSUGNING KONCEPTUEL MODEL ikke 100 % præcis NGINX TLS 1.2/1.3 · omvendt proxy · hastighedsbegrænsning · IP-tilladelsesliste Klient Vue 3 SPA 281 komponenter · 24+ sprog API Flask 3 · Celery · :8000 det centrale knudepunkt IAM Flask · JWT · :5000 LDAP / Active Directory Analyse Flask · pandas · :6000 rapporter, diagrammer, PDF asynkront arbejde synkron HTTP Celery-arbejdere genindeksering · masseoperationer · advarsler RabbitMQ opgavemægler · v4.2 Opgavearbejder asynkron jobafvikler skriver resultater Elasticsearch 9.x · delt dokumentlager PostgreSQL 17.x · IAM · pgvector Sikkerhedskopi daglige sikkerhedskopier · 180d læsninger · skrivninger skrivninger skrivninger Tjenester java_core scanning · indtagelse · håndhævelse java_profiler regex · NER · FastText Enforcer politikhandlinger OCR billede · tekst · MRZ Data Subject Mgr personopslag feeds Indtagelse Graf-indtagelse Microsoft Graph EWS-indtagelse Exchange Web Services SP-indtagelse SharePoint Google-indtagelse Workspace · Drive Web-indtagelse URL'er · skrabning
Anmodnings- og datasti Vedvarende lager / output Underkomponent inden for et niveau

Den fulde servicestruktur, gateway, lejemål og leveringsmodel er beskrevet i Platformsarkitektur nedenfor.

Afsnit 03Ende til ende

Fra en rå kilde til en håndhævet politik

Et dokument gennemgår den samme proces hver gang. En kilde konfigureres én gang; herefter crawler platformen den, udtrækker teksten, profilerer den for personoplysninger, kontrollerer den mod lejerens politikker, handler på baggrund af afgørelsen og rapporterer resultatet. Billige, deterministiske trin udføres først; de omkostningstunge AI- og håndhævelsestrin udføres kun på de dokumenter, der når frem til dem.

INDTAGELSE PROFILERING VALIDERING HÅNDHÆVELSE RAPPORTERING 1 · Indtagelse java_core SCANNING + INDTAGELSE indsamler · graf ews · google Apache Tika · OCR 2 · Profilering klassificér indhold Logisk profilering java_profiler AI-profilering ai-profiler (spaCy) 3 · Validering PolicyValidator opbevaringsregler følsomhedsklasse træf afgørelse om handling 4 · Håndhævelse PolicyEnforcer slet flyt · arkivér mærk · ingen handling 5 · Rapportering analyser dashboards advarsler · notifikationer PDF / Excel alle stadier læser og skriver Elasticsearch
Primær pipeline-sti Delt lager, berørt på hvert stadie Output til brugeren

Hvad platformen gør, i seks verber

01 · Tilslut

Tilslut

Integrer e-mail, fillagring og chat via ét connector-modul pr. kilde.

02 · Scan

Scan og læs

Gennemgå hver kilde og udtræk tekst, herunder OCR for billeder og scanninger.

03 · Klassificer

Klassificer

Profiler hvert dokument for personlige og følsomme data op imod taksonomien.

04 · Beslut

Beslut

Kontroller fund op imod lejers opbevarings- og følsomhedspolitikker.

05 · Handl

Handl

Rediger, arkiver, begræns eller slet – altid bekræftet af dataejeren.

06 · Rapportér

Rapportér

Dashboards, advarsler og eksporterbare rapporter til dokumentation og revision.

Afsnit 04Læs detaljerne

Inde i dette dybt dyk

Kortet ovenfor er bevidst overfladisk. Feltmanualerne nedenfor indeholder detaljerne – hver enkelt dækker et distinkt lag af platformen uden overlap imellem dem.

Hvor dette passer indStart her

Ét kort, derefter feltmanualerne.

Dette overblik er indgangspunktet til afsnittet Dybt Dyk. Læs det for at få et billede af hele platformen, og følg derefter et link ovenfor til det lag, De har behov for. Hvert dybt dyk er selvstændigt og forudsætter kun det, der fremgår af denne side.

deep-dive · support.dataandmore.com/en/knowledge/deep-dive