En flerspråkig NLP-motor som skannar dokument som redan indexerats i Elasticsearch, identifierar namn, platser och datum, klassificerar sedan känsligt språk i GDPR:s särskilda kategorier och skriver varje fynd tillbaka på dokumentet. Datan lämnar aldrig kundens eget sökkluster.
Hämta, profilera, spara. Upprepa.
Samma detektionskärna (handle_doc) driver en högvolymsbakgrundspipeline och en realtidsslutpunkt. Batcharbete flödar från vänster till höger genom schemaläggaren, en begränsad kö och en pool av spaCy-processer; realtidsslutpunkten matar ett enstaka textstycke direkt in i kärnan och returnerar JSON.
Profileraren läser dokument som redan indexerats i Elasticsearch. För vart och ett identifierar den namn, platser och datum, och söker sedan efter språk som avslöjar särskilda kategorier av personuppgifter: hälsa, religion, politik, sexuell läggning, etnicitet, kriminellt förflutet, fackligt medlemskap och arbetsrelaterade åtgärder. Varje träff taggas med en typ, den matchade texten och dess position, och sparas sedan tillbaka på dokumentet – så att efterlevnadsarbetet utgår från fakta snarare än gissningar.
En bakgrundstråd söker kontinuerligt i Elasticsearch efter dokument som flaggatsDS_Status: REQUEST_AI och matar dem till en pool av processer. Detta är hur bulkarkiv profileras.
EnPOST /profile-text väg profilerar ett enstaka textstycke på begäran och returnerar färgkodade träffar som JSON. En/health väg rapporterar driftstatus.
Vid uppstart väntar applikationen på att Elasticsearch-klustret ska bli tillgängligt, och lanserar sedan schemaläggaren och processpoolen. Cykeln nedan upprepas i det oändliga.
data indexet efter dokument där DS_Status = REQUEST_AI, sidväxling 50 åt gången med search-after.handle_doc, utökat nedan.FINISHED. Även vid fel växlar statusen till FINISHED, så att ingenting ombearbetas i oändlighet.Innan någon modell körs handle_doc filtrerar bort arbete som inte ska utföras, och väljer sedan rätt verktyg för språket. Först därefter aktiveras matcharna.
Endast vitlistade dokumenttyper profileras (doc, docx, pdf, eml, txt med flera). Strukturerade format som json, xml och log hoppas över. Text längre än 20 000 tecken flaggas och trunkeras, och innehåll med okänt språk ignoreras.
Om ett språk har grammatiska beroendemönster analyseras hela texten på en gång. Annars delas texten upp i meningar och varje mening analyseras i tur och ordning, med den flerspråkiga modellen som universell reservlösning.
Varje fynd bär en prefixad etikett så att nedströmssystem vet hur det hittades. De tre perspektiven körs över samma mening och deras resultat sammanfogas.
spaCy:s statistiska modell identifierar personer, organisationer, platser, datum och tider. Namn med rätt form (två till tre distinkta alfabetiska ord, inga siffror) befordras till fynd med fullständigt namn.
En lemmamedveten frasmatchare söker igenom termer från kundspecifika ordlistor med känsligt vokabulär och fångar därigenom böjda former snarare än enbart exakta strängar.
Grammatiska mönster bekräftar ett verkligt påstående: en person eller ett tillåtet pronomen är subjekt och ett känsligt nyckelord är objekt. Detta minskar antalet falska positiva träffar genom att kräva kontext, inte bara ett ord.
De exakta kategorierna styrs av kundspecifika ordlistor som läses in från Elasticsearch, vilket innebär att varje prenumeration enbart kan aktivera de typer som är relevanta för er verksamhet.
Dedikerade modeller levereras för engelska, danska, tyska, nederländska, franska, italienska, spanska, svenska, norska, finska, polska, portugisiska, litauiska, kroatiska (som även täcker serbiska, bosniska och montenegrinska) samt ukrainska, med en flerspråkig modell som täcker allt övriga och en universell meningsdelare som grund.
AI Profiler omvandlar ett stilla arkiv av dokument till en märkt karta över personuppgifter – allt inom kundens eget sökkluster – så att efterlevnadsarbetet utgår från fakta snarare än antaganden.