Data & More är en multitenantplattform för GDPR och datastyrning. Den ansluter till en organisations e-post, fillagring och chattsystem, läser allt den hittar, klassificerar varje dokument avseende personuppgifter och känsliga uppgifter, och hjälper dataägaren att agera på resultaten. Den här sidan är kartan: vad plattformen gör, hur delarna hänger ihop och var ni kan läsa detaljerna.
Ni kan inte styra det ni inte först har läst, klassificerat och förstått.
~42mikrotjänster
2kärnspråk: Python, Java
7pipelinesteg, från källa till rapport
1gemensamt datalager: Elasticsearch
Avsnitt 01Så här fungerar det
Klassificera, Verifiera, Radera,alltid aktivt
Plattformen körs kontinuerligt, inte enligt ett fast kvartalscykelschema. Processen har ett namn,Klassificera, Verifiera, Radera: plattformen klassificerar det som finns i arkivet, dataägaren verifierar resultaten på eget håll, och resultatet är radering (eller arkivering, redigering eller begränsning) som utförs i källsystemet. Källor och undantag är den engångskonfiguration som driver loopen.
Radering sker aldrig automatiskt. Dataägaren granskar varje fynd lokalt och väljer en av tre åtgärder, som registreras i granskningsloggen.
Begränsa– posten finns kvar men flaggas för begränsad åtkomst.
Arkivera (kvarhållning)– posten flyttas till ett arkiv med en definierad kvarhållningsregel.
Radera– posten tas permanent bort från källsystemet.
Avsnitt 02Konceptuell modell
Hur delarna passarihop
Varje förfrågan går in via en TLS-avslutande NGINX-proxy och dirigeras till applikationslagret: Vue-klienten, huvud-Flask-API:et samt IAM-, analys- och LLM-tjänsterna. API:et överlämnar tidskrävande arbete till en asynkron processkedja med Celery-workers via RabbitMQ, som även hanterar skanning, inmatning och verkställighetshändelser för Java-lagret. Det tunga arbetet – att genomsöka källor, extrahera text och tillämpa policy – körs i det Java-lagret. Under allt detta finns datalagret, med Elasticsearch som det dokumentlager alla tjänster delar.
Förfrågnings- och dataflödeBeständigt lager / utdataDelkomponent inom ett skikt
Hela tjänstebeståndet, gateway, klienthantering och leveransmodell behandlas i Plattformsarkitektur nedan.
Avsnitt 03Från början till slut
Från en rå källa till en tillämpad policy
Ett dokument genomgår samma resa varje gång. En källa konfigureras en gång; därefter crawlar plattformen den, extraherar dess text, profilerar den för personuppgifter, kontrollerar den mot klientens policyer, agerar på utfallet och rapporterar resultatet. Enkla, deterministiska steg körs först; de kostnadskrävande AI- och tillämpningsstegen körs endast på det som når dem.
HuvudpipelineflödeDelat datalager, berörs i varje stegUtdata till användaren
Vad plattformen gör, i sex verb
01 · Anslut
Anslut
Koppla in e-post, fillagring och chatt via ett anslutningsgränssnitt per källa.
02 · Skanna
Skanna och läs
Genomsök varje källa och extrahera text, inklusive OCR för bilder och skannade dokument.
03 · Klassificera
Klassificera
Profilera varje dokument avseende personuppgifter och känsliga data enligt taxonomin.
04 · Besluta
Besluta
Kontrollera fynd mot klientens policy för lagring och informationskänslighet.
05 · Agera
Agera
Redigera, arkivera, begränsa eller radera – alltid med dataägarens bekräftelse.
06 · Rapportera
Rapportera
Instrumentpaneler, aviseringar och exporterbara rapporter för bevis och revision.
Avsnitt 04Läs detaljerna
Inuti detta fördjupningsavsnitt
Kartan ovan är avsiktligt förenklad. Fälthandböckerna nedan innehåller detaljerna, där var och en äger ett distinkt lager av plattformen utan överlappning dem emellan.
Denna översikt är ingångspunkten till fördjupningsavsnittet. Läs den för att få en bild av hela plattformen och följ sedan en länk ovan till det lager ni behöver. Varje fördjupning är fristående och förutsätter endast vad som finns på denna sida.