CourionAI
FR
Newsletter
← Toutes les actus
ai-and-society 3 min de lecture

Les détecteurs de texte IA s'effondrent lorsque le modèle imite votre style d'écriture

Epoch AI a testé Pangram, GPTZero et Originality.ai. Ils détectent presque parfaitement les textes IA ordinaires, mais manquent jusqu'à 29 % des passages universitaires écrits dans le style d'un auteur précis.

Illustration en risographie de deux pages manuscrites presque identiques côte à côte, une loupe entre elles, une coche au-dessus de l'une et un point d'interrogation au-dessus de l'autre

Les détecteurs de texte IA servent à trancher de vraies situations : déterminer si un étudiant a triché, si une soumission sera lue, ou si un candidat a rédigé lui-même sa lettre de motivation. Une nouvelle étude du groupe de recherche Epoch AI suggère qu’ils sont bien moins fiables que ne le supposent ces usages, et que l’astuce qui les met en défaut tient en une phrase dans une consigne.

L’équipe a testé trois détecteurs très utilisés : Pangram (version 3.3.2), GPTZero (modèle 2026-05-11-base) et Originality.ai (Turbo 3.0.2). Elle a constitué un corpus de 495 passages rédigés par des humains, issus de 99 auteurs, répartis à parts égales entre blogs, fiction et écrits scientifiques. Tous avaient été écrits avant l’apparition de ChatGPT en novembre 2022, de sorte qu’aucune IA n’avait pu les contaminer. Sur des textes IA simples, générés à partir d’une consigne élémentaire, les trois détecteurs étaient presque irréprochables : le taux de textes manqués culminait à 0,7 %. Pangram et GPTZero n’ont produit aucun faux signal sur les textes humains, tandis qu’Originality.ai a signalé à tort 19 des 495 passages humains, soit 3,8 % de faux positifs.

Les chercheurs ont ensuite changé une seule chose. Ils ont donné à trois modèles de pointe, Claude Opus 4.8, GPT-5.5 et Gemini 3.1 Pro, cinq passages authentiques d’un auteur et leur ont demandé de produire un nouveau texte dans le même style. Sur les 297 passages ainsi obtenus, 38 en moyenne sont passés entre les mailles, soit environ 13 %. La fiction restait facile à détecter, avec 1 à 5 %. Les écrits scientifiques, eux, se sont effondrés : Pangram en a manqué 25 %, GPTZero 24 % et Originality.ai 29 %. La pire combinaison fut Pangram face à des textes universitaires produits par Gemini : 48 % n’ont pas été détectés.

Les trois outils fonctionnent différemment et échouent de la même façon, ce qui mérite attention. Pangram s’appuie sur un réseau neuronal entraîné sur des textes humains et mécaniques. GPTZero mesure la prévisibilité et la diversité des choix de mots, partant de l’idée que les modèles écrivent plus uniformément que les personnes. Originality.ai cherche des motifs statistiques appris durant son entraînement. L’imitation d’un style déjoue les trois parce qu’elle attaque leur hypothèse commune : qu’un texte IA possède une voix par défaut reconnaissable. Donnez au modèle la voix de quelqu’un d’autre et le signal s’estompe. C’est aussi une course asymétrique : imiter un style coûte une consigne, alors que le détecter est un problème statistique difficile, rendu plus difficile encore par l’amélioration des modèles.

Ce que cela signifie pour vous : Si vous enseignez, examinez des soumissions ou recrutez, considérez le résultat d’un détecteur comme un indice faible, non comme une preuve, surtout pour une prose formelle ou universitaire, et jamais comme le seul fondement d’une accusation. Si vous êtes étudiant ou écrivain, le risque inverse compte aussi : Originality.ai a marqué comme IA près de 4 % de passages réellement humains. Une accusation erronée est donc possible, et conserver brouillons et historique des versions est une assurance peu coûteuse. Pour tous les autres, le constat honnête est qu’une détection fiable des écrits IA n’existe pas aujourd’hui ; seules des évaluations conçues autour du processus plutôt que du résultat tiennent vraiment.

Sources

Sources: https://epoch.ai/data-insights/ai-text-detection-challenges

Article suivant

Alibaba présente Qwen3.8 Max et promet de donner les poids

L'équipe Qwen d'Alibaba a présenté un modèle multimodal de 2 400 milliards de paramètres, qu'elle place juste derrière Claude Fable 5. Des poids ouverts sont promis, mais sans date, licence ni benchmarks indépendants pour l'instant.

Illustration en risographie d'une boîte cadeau sur un piédestal, couvercle levé et ruban défait, révélant à l'intérieur une pile de plaques arrondies vierges