Data & MoreTeknikFördjupning 05

Från ett fynd till ettdelete beslut.

Klassificering är det som omvandlar ett profilerat dokument till en åtgärd. En profilering genererar fynd, taggar markerar och förfinar dem, dokumentklasser lyfter dem till dokumentnivå och policyer överlämnar resultatet till en förvaltare som validerar det och beslutar om dokumentet ska bevaras, omklassificeras eller raderas. Så här passar dessa lager ihop, och hur Elasticsearch-indexen bakom dem är utformade.

Identifiering hittar det. Människor beslutar vad som händer med det.

1351detektionsalgoritmer
2320taggar per klient
45dokumentklasser per klient
59policyer per klient
Avsnitt 01Översikt

Fem lager, nedifrån ochupp

Klassificering är en skiktad förfining. Varje lager är en lagrad fråga som läser vad lagret nedanför skrev på dokumentet och sedan skriver sitt eget märke. Kedjan löper från maskindetektering upp till ett mänskligt efterlevnadsbeslut. Det slutar inte vid en Microsoft Purview-etikett: det slutar vid enpolicy, där en förvaltare validerar klassificeringen och beslutar om bevarande eller radering. MIP-märkning är en valfri verkställighetsåtgärd, inget mer.

IDENTIFIERA MARKERA KLASSIFICERA STYRA VALIDERA Posttyper profileringsfynd DS_EntryType_List Taggar markeringar på värdenivå DS_Tags Dokumentklasser på dokumentnivå DS_DocumentClass Policy syfte + bevarande notification_settings scheduled_delete Förvaltare validerar klassificering bevara / RADERA en tagg kan generera en kunskapsposttyp if mip_enabled MIP / Purview-etikett DS_Status = DELETED
Huvuddataväg Villkorsstyrd / återkoppling Utfall / verkställt tillstånd Skriven nyttolast

Identifieringen som producerar posttyper – profileringen som kör sina algoritmer – behandlas iAI Profiler. Denna manual tar vid där fynden landar.

Avsnitt 02Lagren

Vad varje lagergör

Lager 01

Posttyper

De identifieringsfynd som skrivs av profileringen:FULL_NAME,STREET_ADDRESS,S_LOC, och kunskapsfamiljenS_K_*. Var och en bärpii,sensitivityoch en färg. De visas somDS_EntryType_List.

indexentry_types · ~715 · dynamic:false
Lager 02

Taggar

Lagrade frågor, huvudsakligen överDS_Value. De stämplarDS_Tags, kan genereraS_K_*posttyper och kan förändra fynd via flaggor:remove_labels, remove_values, rename_data, set_status, sticky.

index tags · ~2320 · dynamic:false
Layer 03

Dokumentklasser

Lagrade frågor över DS_EntryType_List eller DS_Tags. De besvarar frågan "vilken typ av dokument är detta?" och stämplar DS_DocumentClass. Samma motor som taggar, men med olika inmatnings- och utdatafält.

index document_classes · 45/tenant · dynamic:true
Layer 04

Policyer

Grupperar klassificerade dokument för ett efterlevnadssyfte. Äger custodian-rapporten (notification_settings: fliken felklassificerade, raderingskontroll, cykel) och kvarhållning (scheduled_delete, days_to_delete, duration). Valfria kanaler: MIP, Gmail, GDrive.

index policies · ~59/tenant · dynamic:true
Taggar och klasser är samma motor på två olika nivåer. Båda är lagrade frågor som stämplar ett ID på ett dokument. De skiljer sig endast i vad de läser (taggar läser värden, klasser läser posttyper eller taggar) och vad de skriver (DS_Tags kontra DS_DocumentClass). Det är därför de delar kategorimodellen, översättningsindexet och taggningsuppgiftskoden.
Avsnitt 03Utförd spårning

"Religious Orientation", från början till slut

En verklig spårning från en klient. Den visar en klass som utgår från tags, inte posttyper direkt, och når samma klassificering via två oberoende vägar: en driven av en detekterad posttyp, en av bokstavliga tyska dokumentfraser.

BEVIS TAGGAR KLASS STYRNING RELIGIOUS_ORIENTATION + FULL_NAME, ej exkluderad pii 2 · sensitivity 4 · 3914 nyckelord DS_Value ~ "Kirchenaustritt" bokstavliga tyska fraser jokerteckensmatchning, ingen posttyp UN Religious Orientation veUeLZwBiRR6rBsVr02n posttypsväg GER church resignation1 FOUeLZwBiRR6rBsVs07W nyckelordsväg Religious Orientation kat: Privacy Classification fråga: DS_Tags (A ELLER B) Integritetspolicy custodian-rapport validera och radera sedan
Matchningsväg Till styrning Lagrad frågeobjekt

Klassfrågan består av två OR-kombinerade block, vart och ett med ett enskilt DS_Tags-villkor. Ett dokument som bär någon av taggarna klassificeras, och klass-ID:t skrivs till DS_DocumentClass. Därifrån samlar en integritetspolicy in dokumenten, en custodian granskar dem, avvisar falskt positiva på fliken Felklassificerade, och policyns kvarhållningsfönster styr radering. Kopplingen är konkret: taggutdata (DS_Tags) utgör klassindata.

Klassfråga

DS_Tags = veU... (UN Religious)
ELLER
DS_Tags = FOU... (GER church)

Avsnitt 04Indexmodell

Hur indexen är strukturerade

Varje klassificeringsindex delar ett envelope för flera klienter och prenumerationshärkomst, och lägger sedan till sina egna fält. Alla klienter finns i ett och samma index, separerade av company_id; alla rader är prenumerationssådda från en gemensam baslinje.

IndexAntal / klientDynamiskUtmärkande fält
entry_types~715falsename_normalized, method, keywords, redacted, pii, sensitivity, color
tags~2320falsequery, category_id, remove_labels/values/text, set_status, sticky, report_tag
document_classes45truequery, category_id, tag_document_class, corrective_actions
policies~59truequery, enforcement_*, scheduled_delete, days_to_delete, duration, notification_settings, mip_enabled
tag_category~200truename, active, profile_tag, show_in_treeview
document_class_category~21truename, active, show_in_dashboard
tag_names~3625truetag_id, type (tag|class), translated_field, ~40 lang columns
mip_label~30falselabel_id, name, level, tenant, color

Gemensamt kuvert

  • company_id klientnyckeln (keyword)
  • query den lagrade matchningsfrågan (objekt)
  • status aktiv växling (kategorier använder active)
  • ordning, risk, personal, profiled, total
  • duration / duration_start / duration_end
  • ursprung: defined_from_subscriptions, subscription_source, original_subscription_id

Kategori och översättning

Taggar och klasser organiseras och lokaliseras via parallella sidindex.

Tagggrupperingtag_category
Klassgrupperingdocument_class_category
Lokaliseringtag_names (type tag|class)

tag_names är ett enda i18n-index för båda: ungefär 2 560 rader type:tag och 430 rader type:class per klient.

Avsnitt 05Frågegrammatik

En gemensam grammatik för taggar, klasser och policies

Thequery objektet har samma struktur överallt: ett eller flera block, där vart och ett innehåller en matris med filter. Block kombineras med OR; filter inom ett block kombineras med AND. Denna enkla grammatik är anledningen till att en och samma matchningsmotor kan driva alla tre frågelager.

filterstruktur

{
"field": "DS_EntryType_List",
"type": "terms" | "wildcard",
"compare": "equal" | "not_equal",
"values": ["STREET_ADDRESS", ...]
}

  • field dokumentfältet som ska läsas: DS_Value, DS_EntryType_List, DS_Tags, DS_KnownPersons.
  • type terms för en exakt uppsättning, wildcard för mönster.
  • compare equal eller not_equal (exkluderingsskyddet i spårningen använde not_equal).
  • Flera block kombineras med OR; flera filter kombineras med AND. Det är hela logiken.
Kort sammanfattat

Klassificeringen avslutas vid en person, inte en etikett.

Identifiering matar taggar, taggar matar klasser, klasser matar policyer, och policyer placerar resultatet inför en ansvarig person som validerar det och beslutar om att behålla, omklassificera eller radera. MIP-märkning är ett valfritt utdata, aldrig slutdestinationen. Varje lager är multitenantbaserat per company_id, prenumerationsinitierat och byggt på en gemensam lagrad frågegrafmatik med delade kategori- och översättningslager.

support.dataandmore.com/en/knowledge/deep-dive/classification