Le Context Window est la quantité de texte qu'un modèle de langage peut « voir » en une seule fois. GPT-4o traite 128K tokens (environ 100K mots / 300 pages). Au-delà de cette limite, le modèle « oublie » le contenu précédent. C'est le facteur #1 qui détermine si un LLM peut traiter un document long ou maintenir une conversation longue.
Le context window se mesure en tokens (1 token ≈ 0.75 mots anglais, 0.5 mots français). Chaque modèle a une limite : GPT-4 Turbo = 128K, Claude 3 Opus = 200K, Gemini 1.5 = 1M. Le problème du « Lost in the Middle » : les modèles retiennent mieux les informations au début (position primauté) et à la fin (position récence) qu'au milieu du contexte. Studies montrent une dégradation de 40-50% de rétention pour les informations placées au centre d'un long contexte (Liu et al., 2024). Le coût de l'inférence augmente quadratiquement avec la taille du contexte.
Le context window, c'est la mémoire de travail d'un étudiant. Un étudiant qui ne peut retenir que 5 pages de notes peut comprendre un chapitrecourt mais perd le fil d'un livre de 500 pages. De même, un LLM avec 4K tokens peut analyser un email mais pas unroman de 300 pages. Si vous lui donnez 200 pages à lire, il « oublie » les pages 50 à 150 en arrivant à la page 200.
Chaque modèle a un context window hard limit : (1) GPT-4o : 128K tokens (100K mots), (2) Claude 3.5 Sonnet : 200K tokens, (3) Gemini 1.5 Pro : 1M tokens (controversial — effective est plus faible). Au-delà du limit, vous devez utiliser du chunking (découper le document) ou du RAG (ne retenir que les passages pertinents). Le surcoût d'un context window large est significatif : 128K tokens coûte 10x plus que 8K tokens par requête.
Les recherches démontrent que les LLMs suffer de deux biais : (1) Primacy bias — meilleure rétention pour les premières informations (position 1-20% du contexte), (2) Recency bias — meilleure rétention pour les dernières informations (position 80-100%). Les informations au milieu (position 40-60%) sont oubliées ou ignorées dans 40-50% des cas. Solutions : (1) Summary recurrence — répéter le summary tous les 20% du contexte, (2) Semantic chunking — casser le document par sens plutôt que par taille fixe, (3) RAG filtering — ne garder que le top-20 passages pertinents via similarité vectorielle.
Un context window plus large = coût d'inférence plus élevé et latence plus importante. Benchmark : (1) 8K tokens : latence ~1-2s, coût $0.03/1K tokens, (2) 128K tokens : latence ~15-30s, coût $0.30/1K tokens. Strategies d'optimisation : (1) Contexte juste suffisant — ne mettre dans le prompt que les informations nécessaires, (2) Compression prompts — utiliser des techniques de summarization pour réduire le contexte avant injection, (3) Cache contextuel — OpenAI propose le cached context à 50% de réduction de coût pour les prompts répétés.
Une entreprise de legaltech traite des contrats de 200+ pages. Problème : GPT-4 Turbo (128K tokens) ne pouvait pas traiter un contrat complet en une seule passe. Solution : (1) Chunking avec overlap de 500 tokens entre les sections, (2) Extraction des clauses clés (parties, dates, montants, pénalités) avec un premier passage, (3) Summary des sectionsnon pertinentes avec un deuxième passage, (4) Synthèse finale avec les informations extraites. Coût moyen par contrat : $2.40 (vs $18 si traité en une fois). Temps moyen : 45 secondes (vs 3 minutes).
| Métrique | Valeur | Impact |
|---|---|---|
| GPT-4o context window | 128K tokens | 100K mots |
| Claude 3.5 Sonnet | 200K tokens | 150K mots |
| Lost in the Middle | -40-50% rétention | Milieu du contexte |
| Coût 128K vs 8K | 10x plus cher | Par requête |
| Cached context | -50% coût | Prompts répétés |