Tracebit
Une entreprise de sécurité qui travaille sur des leurres et des canaris dans des environnements cloud, y compris une technique qui retourne la propre formation de sécurité d'un modèle d'IA attaquant contre lui.
L’activité normale de Tracebit consiste à implanter de fausses ressources convaincantes dans un compte cloud afin que quiconque les touche se révèle. L’idée est ancienne et fiable : un attaquant ne peut pas distinguer le leurre de la réalité, et les utilisateurs légitimes n’ont aucune raison de s’en approcher.
Il a fait l’actualité de l’IA en 2026 avec une inversion soignée de l’injection de prompt. Au lieu de cacher des instructions qui incitent un modèle à se comporter mal, l’entreprise a caché de courtes chaînes qui déclenchent les propres règles de sécurité d’un modèle attaquant, l’arrêtant en cours de tâche. C’est une défense qui fonctionne précisément parce que l’attaquant utilise un modèle bien aligné.