Klassificering är det som omvandlar ett profilerat dokument till en åtgärd. En profilering genererar fynd, taggar markerar och förfinar dem, dokumentklasser lyfter dem till dokumentnivå och policyer överlämnar resultatet till en förvaltare som validerar det och beslutar om dokumentet ska bevaras, omklassificeras eller raderas. Så här passar dessa lager ihop, och hur Elasticsearch-indexen bakom dem är utformade.
Identifiering hittar det. Människor beslutar vad som händer med det.
Klassificering är en skiktad förfining. Varje lager är en lagrad fråga som läser vad lagret nedanför skrev på dokumentet och sedan skriver sitt eget märke. Kedjan löper från maskindetektering upp till ett mänskligt efterlevnadsbeslut. Det slutar inte vid en Microsoft Purview-etikett: det slutar vid enpolicy, där en förvaltare validerar klassificeringen och beslutar om bevarande eller radering. MIP-märkning är en valfri verkställighetsåtgärd, inget mer.
Identifieringen som producerar posttyper – profileringen som kör sina algoritmer – behandlas iAI Profiler. Denna manual tar vid där fynden landar.
De identifieringsfynd som skrivs av profileringen:FULL_NAME,STREET_ADDRESS,S_LOC, och kunskapsfamiljenS_K_*. Var och en bärpii,sensitivityoch en färg. De visas somDS_EntryType_List.
Lagrade frågor, huvudsakligen överDS_Value. De stämplarDS_Tags, kan genereraS_K_*posttyper och kan förändra fynd via flaggor:remove_labels, remove_values, rename_data, set_status, sticky.
Lagrade frågor över DS_EntryType_List eller DS_Tags. De besvarar frågan "vilken typ av dokument är detta?" och stämplar DS_DocumentClass. Samma motor som taggar, men med olika inmatnings- och utdatafält.
Grupperar klassificerade dokument för ett efterlevnadssyfte. Äger custodian-rapporten (notification_settings: fliken felklassificerade, raderingskontroll, cykel) och kvarhållning (scheduled_delete, days_to_delete, duration). Valfria kanaler: MIP, Gmail, GDrive.
DS_Tags kontra DS_DocumentClass). Det är därför de delar kategorimodellen, översättningsindexet och taggningsuppgiftskoden.En verklig spårning från en klient. Den visar en klass som utgår från tags, inte posttyper direkt, och når samma klassificering via två oberoende vägar: en driven av en detekterad posttyp, en av bokstavliga tyska dokumentfraser.
Klassfrågan består av två OR-kombinerade block, vart och ett med ett enskilt DS_Tags-villkor. Ett dokument som bär någon av taggarna klassificeras, och klass-ID:t skrivs till DS_DocumentClass. Därifrån samlar en integritetspolicy in dokumenten, en custodian granskar dem, avvisar falskt positiva på fliken Felklassificerade, och policyns kvarhållningsfönster styr radering. Kopplingen är konkret: taggutdata (DS_Tags) utgör klassindata.
DS_Tags = veU... (UN Religious)
ELLER
DS_Tags = FOU... (GER church)
Varje klassificeringsindex delar ett envelope för flera klienter och prenumerationshärkomst, och lägger sedan till sina egna fält. Alla klienter finns i ett och samma index, separerade av company_id; alla rader är prenumerationssådda från en gemensam baslinje.
active)Taggar och klasser organiseras och lokaliseras via parallella sidindex.
| Tagggruppering | tag_category |
| Klassgruppering | document_class_category |
| Lokalisering | tag_names (type tag|class) |
tag_names är ett enda i18n-index för båda: ungefär 2 560 rader type:tag och 430 rader type:class per klient.
Thequery objektet har samma struktur överallt: ett eller flera block, där vart och ett innehåller en matris med filter. Block kombineras med OR; filter inom ett block kombineras med AND. Denna enkla grammatik är anledningen till att en och samma matchningsmotor kan driva alla tre frågelager.
{
"field": "DS_EntryType_List",
"type": "terms" | "wildcard",
"compare": "equal" | "not_equal",
"values": ["STREET_ADDRESS", ...]
}
DS_Value, DS_EntryType_List, DS_Tags, DS_KnownPersons.terms för en exakt uppsättning, wildcard för mönster.equal eller not_equal (exkluderingsskyddet i spårningen använde not_equal).Identifiering matar taggar, taggar matar klasser, klasser matar policyer, och policyer placerar resultatet inför en ansvarig person som validerar det och beslutar om att behålla, omklassificera eller radera. MIP-märkning är ett valfritt utdata, aldrig slutdestinationen. Varje lager är multitenantbaserat per company_id, prenumerationsinitierat och byggt på en gemensam lagrad frågegrafmatik med delade kategori- och översättningslager.