Zum Inhalt

Such- und Indizierungsmechanismen

Afi verwendet für unterschiedliche Workload-Arten eigene Analyse-, Indizierungs- und Suchlogiken, die auf den jeweiligen Workload-Typ und dessen durchsuchbare Eigenschaften und Felder abgestimmt sind. Der Dienst kann Abfragebegriffe gleichzeitig in allen durchsuchbaren Feldern abgleichen (Standardmodus) oder gezielt in angegebenen Feldern suchen, beispielsweise nach E-Mails mit einem bestimmten Begriff im Betreff. Bei mehreren Suchbegriffen entspricht ein Element der Abfrage, wenn es alle Begriffe enthält. Zusätzliche Filter können den Suchbereich anhand des Elementdatums und seiner Sichtbarkeit im ausgewählten Sicherungs-Snapshot begrenzen.

Für textbasierte Inhalte bietet der Dienst eine Volltextsuche. Sie unterstützt exakte Begriffsübereinstimmungen sowie Spracherkennung und wortformbasierte Übereinstimmungen für Englisch, Französisch, Deutsch, Spanisch, Portugiesisch, Italienisch und weitere europäische Sprachen. Für die CJK-Sprachgruppe (Chinesisch, Japanisch, Koreanisch) verwendet Afi einen Bigramm-basierten Abgleich.

Bei der Datenindizierung verarbeitet Afi Elementfelder und -eigenschaften abhängig von ihrem Typ vor. Dazu gehören das Bereinigen von Inhalten und Entfernen von Stoppwörtern (kurzen häufigen Wörtern wie the, of, an im Englischen), gegebenenfalls die Spracherkennung sowie Tokenisierung und Stemming (Wortstammerkennung). Dieselbe Vorverarbeitung wird auf die Suchabfragen der Benutzer angewendet. Die Tokenisierungsregeln für verschiedene Feldarten und die dadurch ermöglichten Suchfunktionen werden nachstehend erläutert.

FeldartÜbereinstimmungsregeln
Textbasierte Felder Textbasierte Felder umfassen Betreff und Text von E-Mails, Kalenderereignissen oder Chatnachrichten sowie vergleichbare Felder anderer Workloads mit beliebigen Textinhalten.

Bei der Indizierung werden textbasierte Felder bereinigt und anhand der erkannten Inhaltssprache tokenisiert, um Übereinstimmungen mit Wortformen zu ermöglichen.
E-Mail-Adressen Die Indizierungsregeln für E-Mail-Adressen gelten für Empfänger und Absender von Nachrichten in Gmail, Exchange, Google Chat und Teams-Chats, für E-Mail-Felder anderer Objekttypen (beispielsweise Google- und Exchange-Kontakte) sowie für E-Mail-Adressen in beliebigen Textinhalten.

Bei der Indizierung werden E-Mail-Felder analysiert und tokenisiert, um Übereinstimmungen sowohl mit Namens- als auch mit Domänenbestandteilen zu ermöglichen.

Die E-Mail-Adresse John Doe <john.doe@test.example.com> kann beispielsweise mit folgenden Schlüsselwörtern gefunden werden: john, doe, john.doe, test, example, com, example.com und test.example.com.
Telefonnummern Die Indizierungsregeln für Telefonnummern gelten für die entsprechenden Felder in Google- und Exchange-Kontakten sowie für vergleichbare Felder anderer Workloads, beispielsweise Telefonnummernfelder in Entra-ID-Benutzerelementen (Azure Active Directory).

Bei der Indizierung werden Telefonnummernfelder analysiert, um Durchwahl und Hauptnummer zu erkennen, und so tokenisiert, dass Übereinstimmungen mit Ziffernfolgen der ursprünglichen Nummer möglich sind.

Die Telefonnummer +1-305-200-22-33, ext. 100 kann beispielsweise mit den Schlüsselwörtern 305, 200-22-33, 2233, 100 und weiteren Nummernbestandteilen gefunden werden.
Dateinamen Dateinamenfelder umfassen Datei- und Ordnernamen in Google Drive, OneDrive und SharePoint sowie Anhangsnamen bei allen Workloads, die Anhänge unterstützen (E-Mails, Chatnachrichten, Aufgaben usw.).

Bei der Indizierung werden Dateinamenfelder an Sonderzeichen wie Leerzeichen, Punkten und Kommas in Token zerlegt. Kurze Token wie to oder a werden ausgeschlossen. Übereinstimmungen sind mit jedem resultierenden Token einschließlich der Dateierweiterung oder mit dem exakten Feldwert möglich.

Der Dateiname 2024_Sales reports-2024.06.01.docx kann beispielsweise mit folgenden Schlüsselwörtern gefunden werden: 2024, sales, report, reports, 2024.06.01, docx und 2024_sales reports-2024.06.01.docx.

Verwenden Sie im Dialog für die erweiterte Suche das Feld File extension, um eine exakte Übereinstimmung der Dateierweiterung sicherzustellen.
Zeitfelder Für die Zeitraumfilterung von Suchergebnissen indiziert Afi ausgewählte Zeitstempelfelder in den unterstützten Workloads. Beispiele sind die Empfangszeit von Nachrichten in E-Mail, Google Chat und Microsoft Teams, die Dateiänderungszeit in Drive, OneDrive, SharePoint und Azure Files sowie gegebenenfalls die Erstellungs- oder Änderungszeit anderer unterstützter Elemente.

Eine vollständige Liste der durchsuchbaren Felder und unterstützten Workloads finden Sie im Referenzartikel zu durchsuchbaren Feldern.
Dateikategorie Bei dateibasierten Workloads (Google Drive, OneDrive, SharePoint, Azure Files) klassifiziert Afi Dateien in durchsuchbare Kategorien wie Dokumente, Bilder, Audio, Video, Archive, Quellcode, E-Mail-Dateien, CAD-Dateien, Systemdateien, Datenträgerabbilder oder sonstige Dateien.

Unterstützt für Mandanten, die nach dem 5. Juli 2026 angebunden wurden.
Größenfelder Für die Filterung von Suchergebnissen nach Elementgröße indiziert Afi die Größe von Dateien, E-Mails und Chatnachrichten. Bei E-Mails und Chatnachrichten schließt die indizierte Nachrichtengröße Anhänge ein.

Bei der Indizierung werden Elementgrößen auf ganze Megabyte abgerundet, um exakte Übereinstimmungen und Bereichsabgleiche zu ermöglichen. Elemente unter 1 MB werden als 0 MB indiziert.

Unterstützt für Mandanten, die nach dem 5. Juli 2026 angebunden wurden.
Benutzerdefinierte Schlüsselwortfelder Benutzerdefinierte Felder umfassen Elementnamen außer Datei- und Ordnernamen, Kennungen, Kategorien usw.

Bei der Indizierung werden benutzerdefinierte Felder an Leerzeichen getrennt. Sie unterstützen exakte Übereinstimmungen mit jedem durch Leerzeichen getrennten Bestandteil oder mit dem exakten Feldwert.

Der Kontaktname John Doe kann beispielsweise mit den Schlüsselwörtern john und doe sowie mit john doe gefunden werden.