Funcionamiento de la búsqueda y la indexación¶
Afi dispone de una lógica personalizada de análisis, indexación y búsqueda para los distintos tipos de cargas de trabajo, adaptada a cada tipo concreto y a sus propiedades o campos que admiten búsquedas. El servicio permite buscar coincidencias con los términos de una consulta en todos los campos a la vez (modo predeterminado), así como buscar coincidencias en campos concretos (por ejemplo, mensajes de correo electrónico que contengan un término determinado en el asunto). Cuando se especifican varios términos, la consulta coincide con los elementos que contienen todos ellos. Asimismo, puede aplicar filtros adicionales para limitar el ámbito de búsqueda según la fecha del elemento y su visibilidad en la instantánea de copia de seguridad seleccionada.
En el caso del contenido textual, el servicio ofrece búsqueda de texto completo y admite tanto la coincidencia exacta de términos como la detección de idioma y la coincidencia por formas flexionadas en inglés, francés, alemán, español, portugués e italiano, además de otros idiomas europeos. Para el grupo de idiomas CJK (chino, japonés y coreano), Afi utiliza coincidencias basadas en bigramas.
Durante la indexación de datos, Afi preprocesa los campos y las propiedades de los elementos según su tipo, lo que incluye depurar el contenido y quitar palabras vacías (palabras cortas y comunes como the, of y an), detectar el idioma cuando corresponda, y realizar la tokenización y lematización. El mismo preprocesamiento se aplica a las consultas que proporciona el usuario. A continuación se explican las reglas de tokenización para los distintos tipos de campos y las funciones de búsqueda que estas permiten.
| Tipo de campo | Reglas de coincidencia |
|---|---|
| Campos de texto |
Los campos de texto incluyen el asunto y el cuerpo de mensajes de correo electrónico y chat o eventos del calendario, así como campos similares de otras cargas de trabajo que contienen texto arbitrario. Durante la indexación, los campos de texto se depuran y tokenizan según el idioma detectado en el contenido para permitir la coincidencia por formas flexionadas. |
| Direcciones de correo electrónico |
Las reglas de indexación de direcciones de correo electrónico se aplican a los destinatarios y remitentes de mensajes de Gmail, Exchange, Google Chat y Team Chat, a los campos de correo de otros tipos de objetos (por ejemplo, los campos de correo electrónico de los objetos de contacto de Google y Exchange) y a las direcciones presentes en cualquier contenido textual. Durante la indexación, los campos de correo electrónico se analizan y tokenizan para permitir la coincidencia tanto por componentes del nombre como del dominio. Por ejemplo, la dirección de correo electrónico John Doe <john.doe@test.example.com> puede buscarse con las siguientes palabras clave: john, doe, john.doe, test, example, com, example.com y test.example.com.
|
| Números de teléfono |
Las reglas de indexación de números de teléfono se aplican a los campos correspondientes de los contactos de Google y Exchange, así como a campos similares de otras cargas de trabajo, por ejemplo, los campos de número de teléfono de los elementos de usuario de Entra ID (Azure Active Directory). Durante la indexación, los campos de número de teléfono se analizan para detectar la extensión y la parte principal, y se tokenizan para permitir la coincidencia con una subcadena de dígitos del número original. Por ejemplo, el número de teléfono +1-305-200-22-33, ext. 100 puede buscarse con las siguientes palabras clave: 305, 200-22-33, 2233, 100, así como con otras partes del número.
|
| Nombres de archivo |
Los campos de nombre de archivo incluyen nombres de archivos y carpetas de Google Drive, OneDrive y SharePoint, así como nombres de archivos adjuntos para todas las cargas de trabajo que los admiten (mensajes de correo electrónico y chat, tareas, etc.). Durante la indexación, los campos de nombre de archivo se dividen en tokens mediante símbolos especiales (espacios, puntos, comas, etc.), se excluyen los tokens cortos (como to o a) y se permite la coincidencia con cualquier token resultante (incluida la extensión) o con el valor exacto del campo.Por ejemplo, el nombre de archivo 2024_Sales reports-2024.06.01.docx puede buscarse con las siguientes palabras clave: 2024, sales, report, reports, 2024.06.01, docx y 2024_sales reports-2024.06.01.docx.Para garantizar la coincidencia exacta de la extensión de archivo, utilice el campo File extension del cuadro de diálogo de búsqueda avanzada. |
| Campos de tiempo |
Para permitir el filtrado de los resultados de búsqueda por intervalo, Afi indexa determinados campos de marca de tiempo en las cargas de trabajo admitidas. Algunos ejemplos son la hora de recepción de mensajes de correo electrónico, Google Chat y Microsoft Teams; la hora de modificación de archivos de Drive, OneDrive, SharePoint y Azure Files; y la hora de creación o modificación de otros elementos admitidos, cuando corresponda. Para consultar la lista completa de campos que admiten búsquedas y las cargas de trabajo compatibles, consulte el artículo de referencia sobre campos de búsqueda. |
| Categoría de archivo |
En las cargas de trabajo basadas en archivos (Google Drive, OneDrive, SharePoint y Azure Files), Afi clasifica los archivos en categorías que admiten búsquedas, como documentos, imágenes, audio, vídeo, archivos comprimidos, código fuente, archivos de correo, archivos CAD, archivos del sistema, imágenes de disco u otros archivos. Compatible con los inquilinos incorporados después del 5 de julio de 2026. |
| Campos de tamaño |
Para permitir el filtrado de los resultados de búsqueda por tamaño de elemento, Afi indexa el tamaño de los archivos, los mensajes de correo electrónico y los mensajes de chat. En los mensajes de correo electrónico y chat, el tamaño indexado incluye los archivos adjuntos. Durante la indexación, el tamaño de los elementos se redondea hacia abajo a valores enteros de megabytes, lo que permite buscar coincidencias exactas y por intervalos. Los elementos de menos de 1 MB se indexan como elementos de 0 MB. Compatible con los inquilinos incorporados después del 5 de julio de 2026. |
| Campos personalizados (palabras clave) |
Los campos personalizados incluyen nombres de elementos (salvo nombres de archivos o carpetas), identificadores, categorías, etc. Durante la indexación, los campos personalizados se dividen por espacios y admiten la coincidencia exacta con cualquier parte separada por espacios o con el valor exacto del campo. Por ejemplo, un contacto llamado John Doe puede buscarse mediante las palabras clave john y doe, así como mediante john doe.
|