Klassificering er det, der omdanner et profileret dokument til en handling. En profiler udsender fund, tags markerer og forfiner dem, dokumentklasser løfter dem til dokumentniveau, og politikker afleverer resultatet til en forvalter, der validerer det og beslutter, om dokumentet bevares, omklassificeres eller slettes. Dette er, hvordan disse lag passer sammen, og hvordan Elasticsearch-indekserne bag dem er struktureret.
Detektion finder det. Mennesker beslutter, hvad der sker med det.
Klassificering er en lagdelt forfining. Hvert lag er en gemt forespørgsel, der læser, hvad laget nedenfor har skrevet på dokumentet, og derefter skriver sin egen markør. Kæden løber fra maskinbaseret detektion op til en menneskelig compliancebeslutning. Den ender ikke ved en Microsoft Purview-etiket: den ender ved en politik, hvor en forvalter validerer klassificeringen og beslutter opbevaring eller sletning. MIP-mærkning er én valgfri håndhævelseshandling – intet mere.
Den detektion, der producerer posttyper – profileren, der kører sine algoritmer – er dækket i AI Profiler. Denne manual starter, hvor fundene lander.
De detektionsfund, der er skrevet af profileren: FULL_NAME, STREET_ADDRESS, S_LOC, og vidensfamilien S_K_*. Hver bærer pii, sensitivity og en farve. De vises som DS_EntryType_List.
Gemte forespørgsler, primært over DS_Value. De stempler DS_Tags, kan udsende S_K_* posttyper og kan mutere fund via flag:remove_labels, remove_values, rename_data, set_status, sticky.
Gemte forespørgsler over DS_EntryType_List eller DS_Tags. De besvarer "hvilken type dokument er dette?" og stempler DS_DocumentClass. Samme motor som tags, forskelligt input- og outputfelt.
Gruppér klassificerede dokumenter til et compliance-formål. Ejer custodian-rapporten (notification_settings: fanen for fejlklassificerede, sletningskontrol, cyklus) og opbevaring (scheduled_delete, days_to_delete, duration). Valgfrie kanaler: MIP, Gmail, GDrive.
DS_Tags versus DS_DocumentClass). Derfor deler de kategorimodellen, oversættelsesindekset og tagging-opgavekoden.En reel sporing fra én lejer. Den viser en klasse, der nøgler på tags, ikke posttyper direkte, og når frem til den samme klassificering via to uafhængige ruter: én drevet af en detekteret posttype, én af bogstavelige tyske dokumentsætninger.
Klassens forespørgsel er to OR-forbundne blokke, hver med ét enkelt DS_Tags-udtryk. Et dokument, der bærer ét af disse tags, klassificeres, og klasse-ID'et skrives til DS_DocumentClass. Derfra samler en fortrolighedspolitik dokumenterne, en custodian gennemgår dem, afviser falske positive på fanen Fejlklassificerede, og politikkens opbevaringsvindue styrer sletning. Broen er konkret: tag-output (DS_Tags) er klassens input.
DS_Tags = veU... (UN Religious)
ELLER
DS_Tags = FOU... (GER church)
Ethvert klassificeringsindeks deler en multilejer- og abonnementsoprindelseskonvolut og tilføjer derefter sine egne felter. Alle lejere befinder sig i ét indeks, adskilt af company_id; alle rækker er abonnementsbaserede fra en delt grundlinje.
active)Tags og klasser organiseres og lokaliseres via parallelle sideindeks.
| Tag-gruppering | tag_category |
| Klasse-gruppering | document_class_category |
| Lokalisering | tag_names (type tag|class) |
tag_names er et enkelt i18n-indeks for begge: cirka 2560 rækker type:tag og 430 rækker type:class pr. lejer.
Denquery objekt har samme form overalt: én eller flere blokke, som hver indeholder et array af filtre. Blokke OR-kombineres; filtre inden for en blok AND-kombineres. Denne enkle grammatik er årsagen til, at én matchingmaskine kan drive alle tre forespørgselslag.
{
"field": "DS_EntryType_List",
"type": "terms" | "wildcard",
"compare": "equal" | "not_equal",
"values": ["STREET_ADDRESS", ...]
}
DS_Value, DS_EntryType_List, DS_Tags, DS_KnownPersons.terms for et præcist sæt, wildcard for mønstre.equal eller not_equal (eksklusionsvagten i sporet anvendte not_equal).Registrering fodrer tags, tags fodrer klasser, klasser fodrer politikker, og politikker placerer resultatet foran en dataansvarlig, der validerer det og beslutter at bevare, omklassificere eller slette. MIP-mærkning er et valgfrit output, aldrig destinationen. Hvert lag er multi-tenant pr. company_id, abonnementsinitiert og bygget på én grammatik for lagrede forespørgsler med fælles kategori- og oversættelseslag.