CourionAI
FR
Newsletter
← Glossaire Terme

alignement des valeurs

La distinction entre un système d’IA poursuivant l’objectif qui lui a été fixé et se comportant de manière raisonnable dans des situations pour lesquelles personne n’a écrit d’instructions.

L’alignement des objectifs est le plus étroit des deux : le système fait-il réellement ce que vous avez demandé. L’alignement des valeurs est le plus difficile : lorsque le système rencontre une situation que les instructions n’ont jamais couverte, se généralise-t-il d’une manière qu’une personne raisonnable considérerait comme raisonnable. Vous pouvez avoir le premier sans le second.

Le scientifique en chef d’OpenAI, Jakub Pachocki, a fait valoir en septembre 2026 que cette lacune était la plus dangereuse, car un système hautement performant suivant correctement ses instructions dans une situation que personne n’avait anticipée était exactement la raison pour laquelle les choses tournaient mal. Ce n’est pas l’histoire d’une machine qui devient hostile, c’est l’histoire d’une machine qui devient littérale.