Attention
Le mécanisme par lequel le modèle pondère les tokens qui comptent pour produire le suivant. À chaque étape, il redistribue une quantité limitée d’attention sur tout ce qui se trouve dans la fenêtre.
Limitée est le mot important. J’aime l’image de l’enveloppe : ce n’est pas un projecteur qu’on braque sur le bon passage, c’est une somme fixe qu’on répartit sur tout. Plus la fenêtre est remplie, moins chaque token en reçoit.
D’où un effet contre-intuitif : ajouter du contexte peut dégrader le résultat. Votre convention de nommage, seule dans un prompt court, pèse lourd. Noyée dans deux cents fichiers, elle pèse comme le reste.
La position compte aussi. Ce qui se trouve au début et à la fin de la fenêtre est mieux retenu que ce qui traîne au milieu.
À éviter
Traiter le contexte comme un sac dans lequel on entasse. Et raisonner en « est-ce que ça rentre ? » quand la vraie question est « est-ce que ça va être vu ? ». Une information diluée est une information absente.
Étape : Tokens, fenêtres et attention voir aussi : Fenêtre de contexte voir aussi : Contexte