← Lexique IA

Apprentissage par renforcement

Fondamentaux de l'IA

L'apprentissage par renforcement fait progresser un agent par essais et erreurs : il agit dans un environnement, reçoit des récompenses ou des pénalités, et ajuste sa stratégie pour maximiser le gain. Sous la forme du RLHF (renforcement par retour humain), c'est aussi une étape clé de l'alignement des grands modèles de langage.

En pratique chez Gensai

Gensai suit ces techniques de près : elles expliquent une large part du comportement des modèles que l'agence intègre.