CourionAI
FR
Newsletter
← Glossaire Terme

Alignement de l’IA

Le travail consistant à amener un modèle à se comporter réellement comme ses créateurs le souhaitent, notamment en refusant les demandes nuisibles.

L’alignement est le nom général utilisé pour faire en sorte qu’un modèle se comporte comme le souhaitent ses créateurs. Un modèle brut formé sur du texte continuera volontiers toutes les phrases que vous lui donnerez, y compris les phrases désagréables. L’alignement est la formation supplémentaire qui lui apprend à être utile, à refuser les demandes dangereuses, à admettre l’incertitude et à éviter les stéréotypes. La formation au refus, où un modèle apprend à dire non à certaines demandes, en fait partie.

Ce qui est gênant, c’est que l’alignement est un instrument brutal. Enseigner à un modèle pour éviter un échec en crée souvent un autre : une étude réalisée en 2026 a révélé que les modèles formés pour éviter les stéréotypes de genre finissaient par effacer presque entièrement les personnages féminins, pour se contenter par défaut de “ça”. L’alignement n’est pas non plus la même chose que la sécurité, car les invites de jailbreak peuvent le contourner et il disparaît complètement si quelqu’un télécharge les poids d’un modèle et les recycle.