🧩 LLM · Page 3/5

Tokens & Fenêtre de contexte

L'unité atomique du texte et la mémoire de travail d'un LLM

La métaphore
Un token, c'est comme une brique Lego : pas exactement un mot entier, mais un fragment de texte. La fenêtre de contexte, c'est la taille de ta table de travail : tu ne peux poser qu'un certain nombre de briques à la fois. Si tu en ajoutes trop, les premières tombent par terre — le LLM les oublie.

Qu'est-ce qu'un token ?

Un LLM ne lit pas les mots comme toi. Il découpe d'abord le texte en tokens — des fragments qui correspondent approximativement à des syllabes, des petits mots ou des morceaux de mots.

Pourquoi ne pas simplement utiliser les mots entiers ? Parce que la langue est trop riche : des mots inconnus, des noms propres, des mots composés, des langues différentes… La tokenisation permet au LLM de traiter n'importe quel texte, même des mots qu'il n'a jamais vus.

Exemples de tokenisation

Chaque case colorée = 1 token

→ "Bonjour, comment vas-tu ?"

Bonjour, comment vas- tu ?

→ "L'intelligence artificielle"

L'intelligence artificielle

→ "1234567890"

123 456 7890

Les chiffres sont souvent découpés en plusieurs tokens — et surtout, le LLM prédit plutôt qu'il ne calcule, ce qui explique ses limites en arithmétique.

ℹ️ Règle approximative
En anglais, 1 token ≈ ¾ de mot. En français (langue plus riche morphologiquement), un peu moins. Une page de texte standard ≈ 500–700 tokens.

La fenêtre de contexte

La fenêtre de contexte (ou "context window") est la quantité maximale de tokens que le modèle peut traiter en une seule fois. C'est sa mémoire de travail.

Tout ce qui dépasse cette limite est simplement oublié. Le modèle ne voit pas la partie excédentaire de la conversation — comme si tu avais arraché les premières pages d'un livre.

Ce qui entre dans la fenêtre de contexte
Sys
Historique conv.
Documents
Réponse
Prompt système (instructions)
Historique de conversation
Documents fournis
Réponse générée

Tout compte ! Le prompt système, tes messages, les réponses précédentes, les documents que tu colles. C'est le total qui doit rester sous la limite du modèle.

L'évolution des fenêtres de contexte

En quelques années, les fenêtres de contexte ont explosé. Ce qui était impossible en 2020 (analyser un roman entier en une fois) est devenu banal en 2024–2025.

Chronologie des contextes
2020
GPT-3
4 096 tokens ≈ 3 pages
À peine une longue conversation
2023
GPT-4 / Claude 2
8K – 100K tokens
Claude 2 à 100K = 75 pages de livre
2024
Claude 3 / Gemini 1.5
200K – 1 000K tokens
1M tokens = un roman de 750 pages entier
2025
Claude Sonnet 4.6
200 000 tokens
Le modèle que tu utilises en ce moment

Conséquences pratiques

⚠️ Quand tu dépasses la limite
Si ta conversation devient trop longue, le modèle "oublie" le début. Il peut alors perdre le fil du contexte, répéter des informations, ou contredire ce qu'il a dit plus tôt — sans le signaler.

Les tokens ont aussi un coût financier. Les fournisseurs d'IA facturent à la consommation : généralement quelques centimes par million de tokens. Pour une utilisation personnelle, c'est négligeable. Pour une application qui traite des milliers de requêtes par jour, ça devient un poste budgétaire à piloter.

Bonnes pratiques
Être concis dans tes prompts : chaque mot compte comme des tokens
Pour les longues conversations : commencer une nouvelle session plutôt qu'allonger indéfiniment
Coller uniquement les parties pertinentes d'un document, pas le document entier
Demander des réponses courtes quand la précision n'est pas critique