Un Token est la plus petite unité de texte traitée par un modèle de langage : un mot, une partie de mot ou un caractère de ponctuation. "Bonjour, comment allez-vous ?" = 7 tokens. Les LLM lisent et génèrent du texte token par token. C'est l'unité de facturation des API LLM.
La tokenisation décompose le texte en chunks numériques. Le schéma BPE (Byte Pair Encoding) utilise des sous-mots fréquents — "inconvénients" peut devenir ["in", "conv", "én", "ients"]. GPT-4 turbo encode ~4 caractères par token en moyenne (français). La fenêtre de contexte est mesurée en tokens max : 128 000 pour GPT-4o, 200 000 pour Claude 3.5. Coût API : $2-15 par million de tokens input, $6-75 par million output.
Un token, c'est une syllabe IA. "Chat" = 1 token. "Intelligence" = 3 tokens (In-tel-li-gence). Quand vous payez 0.01$ pour 1 000 tokens, vous payez pour que l'IA lise environ 750 mots de votre prompt. C'est comme un compteur de mots pour taxis — vous utilisez, vous payez au km.
Les LLMs modernes utilisent BPE ou SentencePiece. Ces algorithmes créent un vocabulaire de 30 000 à 200 000 tokens. Les mots fréquents = 1 token, les mots rares = plusieurs subword tokens. Un texte français avec accents peut coûter +20% en tokens vs ASCII pur.
La context window définit combien de tokens l'IA peut "voir" d'un coup. GPT-4o : 128K, Claude 3.5 : 200K, Gemini 1.5 : 1M. Les premiers et derniers tokens ont plus d'importance (effet de primauté et récence). Au-delà de 70% de la fenêtre, les performances baissent.
Les API LLM facturent par token. Optimisations : (1) prompt compression, (2) few-shot examples minimalistes, (3) utiliser des modèles petits pour les tâches simples (GPT-4o-mini coûte 10x moins que GPT-4o). 1 page A4 ~= 530 tokens ~= $0.00106 pour Claude Haiku.
Une entreprise de legaltech analyse 200 contrats PDF mensuels (15 pages chacun). Chaque contrat = 8 000 tokens input. Avec GPT-4o-mini ($0.15/1M) : coût mensuel = 200 × 8 000 × $0.15/1M = $2.40/mois. Avec GPT-4o ($5/1M) : $24/mois. Chunking intelligent à 500 tokens/contrat = $0.90/mois avec GPT-4o-mini.
| Métrique | Benchmark | Objectif |
|---|---|---|
| Tokens/page A4 (français) | 530 tokens | — |
| Ratio caractères/token | ~4 car/tok | — |
| Coût GPT-4o-mini input | $0.15/1M tok | — |
| Coût GPT-4o input | $5/1M tok | — |
| Contexte optimal | < 70% fenêtre | < 70% |