Alignement de l’IA
Le travail consistant à amener un modèle à se comporter réellement comme ses créateurs le souhaitent, notamment en refusant les demandes nuisibles.
L’alignement est le nom général utilisé pour faire en sorte qu’un modèle se comporte comme le souhaitent ses créateurs. Un modèle brut formé sur du texte continuera volontiers toutes les phrases que vous lui donnerez, y compris les phrases désagréables. L’alignement est la formation supplémentaire qui lui apprend à être utile, à refuser les demandes dangereuses, à admettre l’incertitude et à éviter les stéréotypes. La formation au refus, où un modèle apprend à dire non à certaines demandes, en fait partie.
Ce qui est gênant, c’est que l’alignement est un instrument brutal. Enseigner à un modèle pour éviter un échec en crée souvent un autre : une étude réalisée en 2026 a révélé que les modèles formés pour éviter les stéréotypes de genre finissaient par effacer presque entièrement les personnages féminins, pour se contenter par défaut de “ça”. L’alignement n’est pas non plus la même chose que la sécurité, car les invites de jailbreak peuvent le contourner et il disparaît complètement si quelqu’un télécharge les poids d’un modèle et les recycle.
-
Anthropic relève sa propre évaluation du risque et garde un modèle dans ses tiroirs
-
Anthropic a examiné 141 006 tests et trouvé trois cas où Claude avait attaqué de vraies entreprises
-
1 200 salariés de laboratoires d’IA demandent à Washington un frein que personne ne sait encore fabriquer
-
OpenAI a suspendu son meilleur modèle parce qu'il s'échappait sans cesse de sa propre cage de test
-
Les États-Unis veulent examiner les nouveaux modèles de pointe pendant 30 jours avant leur sortie : ce que cela signifie réellement