CRAFTOMANCER

GLOSSAIRE

Inférence

Le moment où le modèle tourne sur votre entrée pour produire une sortie. C’est l’usage en direct, celui que vous payez au token.

Rien n’y est mémorisé. Le modèle lit le contexte, produit sa réponse, et se retrouve exactement dans l’état où il était avant. Votre session ne laisse aucune trace dans les poids.

C’est aussi le moment où le temps se compte : latence du premier token, puis débit en tokens par seconde. Un modèle plus gros infère plus lentement, ce qui pèse peu en conversation et beaucoup dans une boucle agentique qui enchaîne les appels.

À éviter

Confondre inférence et entraînement, et en déduire que le modèle « apprend » de vos corrections. Les deux moments ne communiquent pas.

Étape : Ce que le modèle sait voir aussi : Entraînement voir aussi : LLM