FLORIAN BASTIN
Toutes les séances

Cours 02

Modèles fondés sur le Transformer et optimisations

L'attention ne contient pas, à elle seule, d'information sur l'ordre des tokens. Nous verrons donc comment les modèles représentent la position et comment les approches ont évolué jusqu'à RoPE.

La seconde partie est consacrée aux modèles encodeur, en particulier BERT, et à leur utilisation pour la classification et la recherche.

Au programme
  1. 01Approximation de l'attention
  2. 02MHA, MQA, GQA
  3. 03Plongements positionnels, classiques et appris
  4. 04RoPE et ses applications
  5. 05Architectures fondées sur le Transformer
  6. 06BERT et ses dérivés