Mécanismes de recherche et d’indexation¶
Afi possède une logique personnalisée d’analyse, d’indexation et de recherche pour différents types de charges de travail, adaptée à chaque type ainsi qu’aux propriétés et champs pouvant faire l’objet d’une recherche. Le service vous permet de faire correspondre les termes de requête dans tous ces champs à la fois (mode par défaut), ainsi que de rechercher des correspondances dans les champs spécifiés (par exemple, rechercher des e-mails contenant un certain terme dans l’objet). Lorsque plusieurs termes de recherche sont indiqués, une requête correspond aux éléments qui contiennent tous les termes de la requête. Vous pouvez également appliquer des filtres supplémentaires afin de limiter l’étendue de recherche selon la date de l’élément et sa visibilité dans l’instantané de sauvegarde sélectionné.
Pour les contenus textuels, le service propose une recherche en texte intégral prenant en charge à la fois la correspondance exacte des termes, ainsi que la détection de la langue et la correspondance fondée sur les formes de mots pour l’anglais, le français, l’allemand, l’espagnol, le portugais, l’italien et plusieurs autres langues européennes. Pour le groupe de langues CJK (chinois, japonais, coréen), Afi utilise une correspondance basée sur les bigrammes.
Lors de l’indexation des données, Afi prétraite les champs et propriétés des éléments selon leur type, notamment en nettoyant le contenu et en supprimant les mots vides (mots courts et courants comme the, of, an), en détectant sa langue le cas échéant, ainsi qu’en effectuant la segmentation en jetons et la racinisation. Le même prétraitement est appliqué aux requêtes de recherche fournies par un utilisateur. Les règles de segmentation pour les différents types de champs, ainsi que les capacités de recherche activées par ces règles, sont expliquées ci-dessous.
| Type de champ | Règles de correspondance |
|---|---|
| Champs textuels |
Les champs textuels comprennent l’objet et le corps des e-mails, événements de calendrier ou messages de chat, ainsi que des champs similaires pour d’autres charges de travail contenant du contenu textuel arbitraire. Lors de l’indexation, les champs textuels sont nettoyés et segmentés en jetons selon la langue détectée du contenu afin de permettre la correspondance des formes de mots. |
| Adresses e-mail |
Les règles d’indexation des adresses e-mail s’appliquent aux destinataires et expéditeurs des messages Gmail, Exchange, Google Chat et Team Chat, aux champs e-mail dans d’autres types d’objets (par exemple, les champs e-mail pour les objets de contact Google et Exchange), ainsi qu’aux adresses e-mail présentes dans un contenu textuel arbitraire. Lors de l’indexation, les champs e-mail sont analysés et segmentés en jetons pour permettre la correspondance à la fois par composantes de nom et de domaine. Par exemple, une adresse e-mail John Doe <john.doe@test.example.com> peut être recherchée avec les mots-clés suivants : john, doe, john.doe, test, example, com, example.com et test.example.com.
|
| Numéros de téléphone |
Les règles d’indexation des numéros de téléphone s’appliquent aux champs correspondants des contacts Google et Exchange ainsi qu’à des champs similaires pour d’autres charges de travail, par exemple les champs de numéro de téléphone dans les éléments utilisateur Entra ID (Azure Active Directory). Lors de l’indexation, les champs de numéro de téléphone sont analysés afin de détecter l’extension et la partie principale, puis segmentés en jetons afin de permettre la correspondance par une sous-chaîne de chiffres du numéro d’origine. Par exemple, un numéro de téléphone +1-305-200-22-33, ext. 100 peut être recherché avec les mots-clés suivants : 305, 200-22-33, 2233, 100, ainsi que d’autres parties du numéro.
|
| Noms de fichiers |
Les champs de nom de fichier comprennent les noms de fichiers et de dossiers dans Google Drive, OneDrive et SharePoint, ainsi que les noms des pièces jointes d’éléments pour toutes les charges de travail prenant en charge les pièces jointes (e-mails, messages de chat, tâches, etc.). Lors de l’indexation, les champs de nom de fichier sont découpés en jetons à partir de symboles spéciaux (espaces, points, virgules, etc.), à l’exclusion des jetons courts (comme to ou a), et prennent en charge la correspondance par tout jeton obtenu (y compris l’extension de fichier) ou par la valeur exacte du champ.Par exemple, un nom de fichier 2024_Sales reports-2024.06.01.docx peut être recherché avec les mots-clés suivants : 2024, sales, report, reports, 2024.06.01, docx, ainsi que 2024_sales reports-2024.06.01.docx.Pour garantir une correspondance exacte de l’extension de fichier, utilisez le champ File extension dans la boîte de dialogue de recherche avancée. |
| Champs temporels |
Pour permettre le filtrage par plage temporelle dans les résultats de recherche, Afi indexe certains champs d’horodatage dans les charges de travail prises en charge. Citons par exemple l’heure de réception des messages pour les e-mails, Google Chat et Microsoft Teams ; l’heure de modification des fichiers dans Drive, OneDrive, SharePoint et Azure Files ; et l’heure de création ou de modification pour les autres éléments pris en charge, le cas échéant. Pour obtenir la liste complète des champs pouvant faire l’objet d’une recherche et de leurs charges de travail prises en charge, consultez l’article de référence correspondant. |
| Catégorie de fichier |
Pour les charges de travail basées sur les fichiers (Google Drive, OneDrive, SharePoint, Azure files), Afi classe les fichiers dans des catégories pouvant être utilisées dans la recherche, telles que documents, images, audio, vidéo, archives, code source, fichiers de messagerie, fichiers CAO, fichiers système, images disque ou autres fichiers. Pris en charge pour les locataires intégrés après le 5 juillet 2026. |
| Champs de taille |
Pour permettre le filtrage par taille d’élément dans les résultats de recherche, Afi indexe les tailles des fichiers, e-mails et messages de chat. Pour les e-mails et les messages de chat, la taille de message indexée inclut les pièces jointes. Lors de l’indexation, les tailles des éléments sont arrondies à l’entier inférieur en mégaoctets, ce qui permet la correspondance exacte et par plage. Les éléments de moins de 1 Mo sont indexés comme des éléments de 0 Mo. Pris en charge pour les locataires intégrés après le 5 juillet 2026. |
| Champs personnalisés (mots-clés) |
Les champs personnalisés comprennent les noms des éléments (à l’exception des noms de fichiers/dossiers), les identifiants, les catégories, etc. Lors de l’indexation, les champs personnalisés sont séparés par des espaces et prennent en charge la correspondance exacte par toute partie séparée par un espace ou par la valeur exacte du champ. Par exemple, un nom de contact John Doe peut être recherché avec les mots-clés john et doe, ainsi qu’avec john doe.
|