Sécurité
Analyse de contenu : fichiers et e-mails
Dernière mise à jour · 7 octobre 2026
Deux modules optionnels lisent du contenu et non des métadonnées.
Analyse de contenu : fichiers et e-mails
- Ce qui déclenche un scan de fichiers. Le module d’exposition ne tourne que si vous avez accordé les scopes Drive ou SharePoint. Il s’exécute ensuite chaque nuit, et à la demande depuis l’application.
- Ce qui est lu. Nous téléchargeons le fichier et le parcourons en mémoire : documents Office, PDF et texte brut, plafonnés à 512 Ko de texte extrait et 8 Mo par document. Nous ouvrons le fichier ; nous ne le gardons pas.
- Ce qui est écrit. Un niveau de sensibilité et un décompte par catégorie détectée, rien d’autre. Jamais la valeur reconnue, jamais un extrait. Un fichier que nous n’avons pas pu lire est enregistré comme illisible et non comme sain, de sorte qu’un document jamais ouvert n’est jamais présenté comme sûr.
- Qui classe. Des détecteurs déterministes auto-hébergés : Luhn avec une table d’émetteurs pour les numéros de carte, mod-97 pour les IBAN et les numéros de sécurité sociale, et un jeu de règles gitleaks embarqué pour les secrets. Aucune API de classification tierce et aucun modèle de langage. Le contenu de vos fichiers est lu par du code qui tourne sur une machine en France, et n’est envoyé nulle part.
- Tri par mots-clés. Un administrateur peut chercher jusqu’à 30 mots-clés dans 200 fichiers au maximum. Les correspondances sont renvoyées au navigateur de cet administrateur et ne sont jamais stockées.
- La découverte par e-mail est désactivée par défaut. Elle s’active par espace de travail, et elle exige en outre un accès aux boîtes accordé hors bande dans votre propre console d’administration, de sorte qu’elle ne peut pas être activée par accident depuis chez nous.
- Ce que lit la découverte par e-mail. Trois en-têtes côté Gmail, trois champs côté Microsoft Graph, restreints aux objets qui ressemblent à une inscription. Aucun appel que nous faisons ne peut renvoyer un corps. L’objet est classé en mémoire puis jeté, et seul le domaine de l’éditeur est conservé.
- Pour la protection des prompts, l’extension remonte le nom d’hôte de l’outil d’IA même lorsque cet hôte est absent de notre catalogue SaaS, car le filtre du catalogue ferait autrement disparaître l’événement. Le script de contenu ne s’exécute que sur les trois origines d’IA déclarées dans son manifeste.