Cours 02
Modèles fondés sur le Transformer et optimisations
- mercredi 28 octobre 2026
- 12:15 – 13:45
- En ligne
L'attention ne contient pas, à elle seule, d'information sur l'ordre des tokens. Nous verrons donc comment les modèles représentent la position et comment les approches ont évolué jusqu'à RoPE.
La seconde partie est consacrée aux modèles encodeur, en particulier BERT, et à leur utilisation pour la classification et la recherche.
Au programme
- 01Approximation de l'attention
- 02MHA, MQA, GQA
- 03Plongements positionnels, classiques et appris
- 04RoPE et ses applications
- 05Architectures fondées sur le Transformer
- 06BERT et ses dérivés