Hvordan data bevæger sig, fra kilde tilhåndhævet politik.
Syv lag fører et dokument fra en ekstern kilde gennem automatisk klassificering til politikhåndhævelse og revision. Eksterne systemer crawles af kildespecifikke connectorer, indekseres via den centrale API, beriges af en pulje af arbejdere, gemmes i et fælles lager, overvåges af monitorering og præsenteres i Vue-klienten.
Hvert lag overgiver til det næste via en navngiven transport. Kilder crawles af connectorer, connectorer skriver til den centrale API og Elasticsearch, API'en sender asynkront arbejde til arbejderpuljen via RabbitMQ, og hvert lag læser fra og skriver til det fælles lager.
Overdragelse mellem lagBehandlings-/connectortierEdge- eller lagringstier
Lag 01Eksterne datakilderOprindelse af kundedata der skal administreres
Microsoft 365
Outlook / SharePoint / OneDrive / Teams
Primær virksomhedskilde: e-mail, dokumenter, fillager og teamchat.
proto EWS / Graph API · auth OAuth 2.0 / Azure AD
Google Workspace
Gmail / Drive
Workspace-mail og Drive-indhold.
proto Google APIs · auth OAuth 2.0 / tjenestekonto
Netværksfildeling
SMB / NFS
Filer, mapper og tilladelser på fildelinger.
Azure AD
Brugere / Grupper
Identiteter og gruppemedlemskaber.
proto Microsoft Graph API
Websites
HTTP-crawling
Publicerede websider og indhold.
API-kald og crawlingOAuth-tokensInkrementel synkronisering
Lag 02ConnectortjenesterKildespecifikke indtagelsesadaptere
ews
Java / Spring Boot
Exchange Web Services til Outlook, OneDrive, SharePoint, Teams. Gennemgang, flytning, sletning, validering, tilbagerulning.
ud Elasticsearch
graph-ingestion
Scala / Maven
MS Graph med graph-management, dm-graph-ingestion og graph-enforcer.
forbinder ES + RabbitMQ
google
Python
Scanning af Gmail og Google Drev.
ud Elasticsearch
fileshare-service
Java
Netværksfilscanning via SMB / NFS.
ud Elasticsearch
collector
Java / Gradle
Universel batch-indsamler til generiske kildetyper.
ud API derefter Elasticsearch
website-source
Python
HTTP / HTTPS-webgennemgang.
ud ES + RabbitMQ
HTTP batch-indlæsningDirekte ES-indeksering
Lag 03Centralt API-lagCentral orkestrering og godkendelse
api
Python / Flask :8000
REST API med 20+ blueprint-moduler: dokumenter, kilder, politikker, tags, rapporter, brugere, konfiguration.
forbinder ES, PostgreSQL, RabbitMQ, IAM
task-worker
Python / Celery
Asynkron jobprocessor via RabbitMQ-brokeren.
broker RabbitMQ :5672 · overvågning Flower :5555
iam
Python / Flask :5000
Identitets- og adgangsstyring med JWT og virksomhedsscopet isolation.
forbinder PostgreSQL
dlp
Python / Flask + Celery :5050
Forebyggelse af datatab med en dedikeret PostgreSQL-database (dlp_dam).
forbinder ES, PostgreSQL, RabbitMQ
chat-api
Python
LLM-drevet dokument-Q&A til chatbaseret compliance.
forbinder ES, IAM, llm-management
Celery-opgaver via AMQP :5672Periodiske planlagte job
Lag 04Behandlende arbejdsprocesserCelery-opgaver afhentet fra RabbitMQ
Klassifikation
Celery-opgave
PII-registrering, følsomhedsvurdering og sprogidentifikation.
ud DS_PiiScore, DS_SensitivityScore
ai-profiler
Python / spaCy / Celery
NLP-enhedsudtrækning og dokumentprofilering.
ud ES profiler-resultater
Håndhævelse af politikker
Celery-opgave
Opbevaringsregler: sletning, arkivering og karantæne med fuld revision.
revision deleted_data ES-indeks
Tildeling af tags
Celery-opgave
Delta-tagging og tildeling af dokumentklasse.
ud DS_Tags, DS_DocumentClass
ocr
Python
Tekstudtrækning fra scannede dokumenter og billeder.
ud beriget dokument i ES
DataSubject Manager
Java
VIP- og enhedsmatching mod databasen over kendte personer.
ud ES-metadata for registrerede
ES / PG-synkronisering
Celery-opgave
Tovejs-synkronisering mellem Elasticsearch og PostgreSQL.
opgaver es2postgre, syncpostgres
Backup-arbejder
Celery-opgave
Daglige S3-eksporter som JSON-batches (750 dokumenter/fil).
mål S3, 180-dages opbevaring
REST :9200SQL :5432AMQP :5672S3 API
Lag 05DatalagerInfrastruktur til persistens og meddelelser
Elasticsearch 9.x
Primært indeks :9200
Dokumentsøgning, klassifikationsdata, revisionslog og systemhændelser. Platformens centrale lager.
version 9.3.1 · backup månedlige SLM-snapshots til S3
PostgreSQL 17.x
Relationel tilstand :5432
Brugere, konfiguration, DLP-tilstand, IAM-konti, PowerBI-datasæt og vektorindlejringer.
defaultdlp_damiampowerbivector
version 17.6 (ECR) · volumen postgres_data
RabbitMQ 4.x
Meddelelsesmægler :5672
Celery-opgavekø via AMQP. Administrations-UI på :15672.
version 4.2.2 · volumen rabbitmq_4
AWS S3
Backup-lager
Daglige JSON-indekseksporter pr. virksomhed/arbejdsområde samt månedlige ES-snapshots.
opbevaring 180 dage, automatisk oprydning
SundhedsforespørgslerE-mailnotifikationerIndsamling af målinger
Lag 06Overvågning og advarslerObserverbarhed og systemsundhed
Administrationsværktøj, Advarsler
Python / 40+ advarselstyper
Overvåger indtagelseshastighed, politikforløb, ES-indekssundhed, certifikatudløb og Azure-synkronisering.
forbinder ES, RabbitMQ
py-dm-notify
Python
E-maillevering til compliancenotifikationer og rapporter.
analytics
Python / Flask
Aggregering af compliancemålinger og KPI-rapportering.
forbinder Elasticsearch
flower
Web UI :5555
Realtidsdashboard for Celery-arbejdere og opgaver.
metricbeat
Elastic Stack
Indsamler system- og containermålinger til overvågning af ES.
HTTP / JSON RESTJWT-godkendelse via IAM
Layer 07Frontend og brugergrænsefladeBrugervendte applikationer
client
Vue 3 / TypeScript / Vite :9000
Primær webapplikation: dokumentsøgning, klassifikationsstyring, politikadministration, rapporter og sagslog.
stack Vue 3, TS, Vite, Vuex, Chart.js
chat-client
Frontend
LLM-chatgrænseflade til dokument-Q&A.
backend chat-api
nginx
Omvendt proxy :443 :80
SSL-terminering via Let's Encrypt. Ruter / til client, /api til api, /iam til iam.
version 1.24.0
Section 02Dokumentlivscyklus
Ét dokument, én sti
Kilde→Connector gennemsøger→API indekserer til ES→Arbejdere klassificerer→Tags og politikker anvendes→Politikhåndhævelse→Revisionsspor→S3-sikkerhedskopi