FLORIAN BASTIN
Toutes les séances

Cours 08

Raisonnement des LLM

Cette séance porte sur les modèles entraînés pour effectuer des raisonnements plus longs sur certaines tâches.

Nous partirons des méthodes vues pendant la séance précédente pour comprendre comment l'apprentissage par renforcement peut être utilisé dans ce contexte. Nous regarderons aussi le coût de ces modèles et les situations dans lesquelles ils apportent réellement quelque chose.

Au programme
  1. 01Modèles de raisonnement
  2. 02Apprentissage par renforcement pour le raisonnement
  3. 03GRPO
  4. 04Passage à l'échelle