CourionAI
FR
Newsletter
← Toutes les actus
security 3 min de lecture

Les chercheurs ont chiffré l'attaque afin que Grok ne puisse pas la lire. Grok l'a décrypté lui-même

Adversa AI a caché les instructions dans une page Web à l'aide d'AES-256. Le propre bac à sable de code de Grok les a déverrouillés, puis a divulgué l'historique des discussions de l'utilisateur. Signalé en juin, toujours non corrigé.

Un cadenas ouvert par une griffe mécanique entourée de points binaires

Les chercheurs en sécurité d’Adversa AI ont publié une attaque qui transforme une requête ordinaire en fuite de données. Demandez à Grok de xAI de résumer une page Web, et si cette page contient une charge utile spécialement préparée, Grok peut finir par envoyer votre nom, votre emplacement approximatif, votre niveau d’abonnement et l’historique des conversations en cours à un serveur dont vous n’avez jamais entendu parler. Aucun clic requis.

La partie la plus intelligente réside dans la manière dont la charge utile franchit les défenses. Les chatbots qui parcourent le Web disposent de filtres qui recherchent les instructions suspectes cachées dans le texte de la page, l’injection d’invite classique. La réponse d’Adversa a été de rendre les instructions illisibles : la charge utile est cryptée avec AES-256-GCM, un chiffrement fort standard, et la page fournit également la clé. Les filtres de sécurité voient le charabia et le laissent passer. Ensuite, Grok, qui dispose d’un bac à sable Python intégré pour exécuter du code, déchiffre consciencieusement le blob. Ce qui en ressort est un texte brut produit dans son propre environnement d’exécution, et le modèle le traite comme un contexte interne fiable plutôt que comme un contenu non fiable provenant du site Web d’un étranger. Les chercheurs appellent cela l’injection de contexte cryptographique.

Sur environ 20 tentatives depuis juin, le taux de réussite signalé était d’environ 40 %, les échecs étant causés par un décryptage erroné plutôt que par une défense qui l’a détecté. Adversa a signalé la faille à xAI via son programme HackerOne le 3 juin 2026, suivi les 4 et 10 août, et affirme n’avoir reçu aucune réponse. Au 19 août, il n’y avait ni patch ni CVE. Le même article montre une démonstration connexe contre Gemini de Google en mode Deep Thinking.

Le problème sous-jacent est structurel et n’est pas propre à Grok. Chaque modèle qui parcourt le Web et exécute du code a la même forme : le contenu provient d’une source non fiable et, quelque part en aval, le système cesse de le traiter comme non fiable. Les filtres qui analysent le texte entrant à la recherche de mauvaises instructions ne fonctionnent que si les instructions sont visibles au moment de l’analyse. Tout ce qui reconstitue ultérieurement le texte, que ce soit par décryptage, décodage ou assemblage de fragments, passe devant. Il s’agit de la même classe d’échec derrière la faille Copilot que nous avons abordée le 20 août, où un lien enchaînait un paramètre d’URL, une récupération et une mémoire persistante dans un vol de données en un clic qui a mis huit mois à Microsoft pour le corriger. L’injection rapide n’est pas un bug qui est corrigé une seule fois. C’est une propriété des systèmes qui mélangent des instructions et des données dans le même canal, et elle ne cessera de refaire surface sous de nouveaux vêtements.

Ce que cela signifie pour vous : faites attention à ce que vous demandez à un assistant de navigation de lire lorsqu’une conversation sensible est ouverte dans la même session. L’exposition ici est votre contexte de discussion actuel, donc la défense pratique est la séparation : démarrez une nouvelle conversation avant de pointer un assistant vers une page inconnue, et ne collez pas de mots de passe, de contrats ou de données personnelles dans une session que vous utilisez également pour la synthèse Web. La même prudence s’applique à tout agent disposant de la navigation et de l’exécution de code, pas seulement à Grok. Et si vous évaluez des outils d’IA pour une entreprise, un fournisseur qui passe onze semaines sans répondre à un rapport HackerOne est en soi une donnée.

##Sources

Sources: https://thehackernews.com/2026/08/new-cryptographic-context-injection.html

Article suivant

Le même modèle a obtenu 30 % seul et 100 % dans le système d'agent de Nvidia

L'AVO de Nvidia a effacé les 183 niveaux d'ARC-AGI-3 en utilisant Claude Opus 5, un modèle qui obtient à lui seul un score d'environ 30 %. La partie intéressante n’est pas la partition, c’est ce qui a changé.

Un labyrinthe labyrinthe résolu par un bras mécanique atteignant une cible au centre