Klassifizierung ist das, was ein profiliertes Dokument in eine Handlung überführt. Ein Profiler liefert Befunde, Tags markieren und verfeinern diese, Dokumentklassen heben sie auf die Dokumentebene, und Richtlinien übergeben das Ergebnis an einen Treuhänder, der es validiert und entscheidet, ob das Dokument aufbewahrt, neu klassifiziert oder gelöscht wird. So greifen diese Schichten ineinander – und so sind die dahinterliegenden Elasticsearch-Indizes aufgebaut.
Die Erkennung findet es. Menschen entscheiden, was damit geschieht.
Klassifizierung ist eine stufenweise Verfeinerung. Jede Schicht ist eine gespeicherte Abfrage, die liest, was die darunterliegende Schicht auf das Dokument geschrieben hat, und anschließend ihren eigenen Marker schreibt. Die Kette verläuft von der maschinellen Erkennung bis zur menschlichen Compliance-Entscheidung. Sie endet nicht bei einem Microsoft Purview-Label: Sie endet bei einer Richtlinie, bei der ein Treuhänder die Klassifizierung validiert und über Aufbewahrung oder Löschung entscheidet. Die MIP-Kennzeichnung ist eine optionale Durchsetzungsmaßnahme – nicht mehr.
Die Erkennung, die Eintragstypen erzeugt – der Profiler, der seine Algorithmen ausführt – wird in AI Profiler behandelt. Dieses Handbuch beginnt dort, wo die Befunde eintreffen.
Die vom Profiler geschriebenen Erkennungsbefunde: FULL_NAME, STREET_ADDRESS, S_LOC und die Wissensfamilie S_K_*. Jeder trägt pii, sensitivity und eine Farbe. Sie erscheinen als DS_EntryType_List.
Gespeicherte Abfragen, überwiegend über DS_Value. Sie vergeben DS_Tags, können S_K_*-Eintragstypen erzeugen und Befunde über Flags mutieren:remove_labels, remove_values, rename_data, set_status, sticky.
Gespeicherte Abfragen über DS_EntryType_List oder DS_Tags. Sie beantworten die Frage „Um welche Art von Dokument handelt es sich?" und vergeben DS_DocumentClass. Gleiche Engine wie Tags, unterschiedliche Eingabe- und Ausgabefelder.
Klassifizierte Dokumente für einen Compliance-Zweck zusammenfassen. Verantwortlich für den Custodian-Bericht (notification_settings: Registerkarte „Falsch klassifiziert", Löschsteuerung, Zyklus) sowie die Aufbewahrung (scheduled_delete, days_to_delete, duration). Optionale Kanäle: MIP, Gmail, GDrive.
DS_Tags gegenüber DS_DocumentClass). Aus diesem Grund teilen sie das Kategoriemodell, den Übersetzungsindex und den Tagging-Task-Code.Ein realer Ablauf eines einzelnen Mandanten. Er zeigt eine Klasse, die auf tags basiert – nicht direkt auf Eintragstypen – und über zwei unabhängige Routen zur gleichen Klassifizierung gelangt: eine Route, die durch einen erkannten Eintragstyp gesteuert wird, eine weitere durch wörtliche deutsche Dokumentformulierungen.
Die Klassenabfrage besteht aus zwei mit OR verknüpften Blöcken, von denen jeder ein einzelnes DS_Tags-Term enthält. Ein Dokument, das einen der beiden Tags trägt, wird klassifiziert, und die Klassen-ID wird in DS_DocumentClass geschrieben. Von dort erfasst eine Datenschutzrichtlinie die Dokumente, ein Custodian prüft sie, weist Falschpositive auf der Registerkarte „Falsch klassifiziert" zurück, und das Aufbewahrungsfenster der Richtlinie steuert die Löschung. Die Verbindung ist konkret: Die Tag-Ausgabe (DS_Tags) ist die Klassen-Eingabe.
DS_Tags = veU... (UN Religious)
OR
DS_Tags = FOU... (GER church)
Jeder Klassifizierungsindex teilt einen mandantenfähigen und abonnementbasierten Herkunfts-Rahmen und fügt anschließend eigene Felder hinzu. Alle Mandanten befinden sich in einem Index, getrennt durch company_id; alle Datensätze werden abonnementbasiert aus einer gemeinsamen Ausgangsbasis gespeist.
active)Tags und Klassen werden durch parallele Nebenindizes organisiert und lokalisiert.
| Tag-Gruppierung | tag_category |
| Klassen-Gruppierung | document_class_category |
| Lokalisierung | tag_names (type tag|class) |
tag_names ist ein einzelner i18n-Index für beide: etwa 2560 Einträge type:tag und 430 Einträge type:class pro Mandant.
Dasquery Objekt hat überall dieselbe Struktur: ein oder mehrere Blöcke, von denen jeder ein Array von Filtern enthält. Blöcke werden mit ODER verknüpft; Filter innerhalb eines Blocks werden mit UND verknüpft. Diese einheitliche Grammatik ist der Grund, warum eine einzige Matching-Engine alle drei Abfrageebenen bedienen kann.
{
"field": "DS_EntryType_List",
"type": "terms" | "wildcard",
"compare": "equal" | "not_equal",
"values": ["STREET_ADDRESS", ...]
}
DS_Value, DS_EntryType_List, DS_Tags, DS_KnownPersons.terms für eine exakte Menge, wildcard für Muster.equal oder not_equal (der Ausschluss-Guard im Trace verwendete not_equal).Die Erkennung liefert Tags, Tags speisen Klassen, Klassen speisen Richtlinien, und Richtlinien legen das Ergebnis einem Verwalter vor, der es validiert und über Behalten, Neuklassifizierung oder Löschung entscheidet. MIP-Beschriftung ist eine optionale Ausgabe, niemals das Ziel. Jede Ebene ist mandantenfähig durch company_id, abonnementbasiert initialisiert und auf einer einzigen Stored-Query-Grammatik mit gemeinsamen Kategorie- und Übersetzungsschichten aufgebaut.