FLORIAN BASTIN
Toutes les séances

Cours 06

Alignement des LLM

Un modèle pré-entraîné sait produire du texte, mais cela ne signifie pas qu'il suit correctement une consigne ou qu'il produit toujours une réponse adaptée.

Nous verrons comment l'alignement permet d'adapter le modèle à des préférences humaines, d'abord avec RLHF puis avec des méthodes plus directes comme DPO.

Au programme
  1. 01Preference tuning
  2. 02Vue d'ensemble du RLHF
  3. 03Modélisation de la récompense
  4. 04Approches par renforcement (PPO et variantes)
  5. 05DPO