Aller au contenu principal
Retour au lexique

Token

IA

Définition courte

Un Token est la plus petite unité de texte traitée par un modèle de langage : un mot, une partie de mot ou un caractère de ponctuation. "Bonjour, comment allez-vous ?" = 7 tokens. Les LLM lisent et génèrent du texte token par token. C'est l'unité de facturation des API LLM.

Définition complète

La tokenisation décompose le texte en chunks numériques. Le schéma BPE (Byte Pair Encoding) utilise des sous-mots fréquents — "inconvénients" peut devenir ["in", "conv", "én", "ients"]. GPT-4 turbo encode ~4 caractères par token en moyenne (français). La fenêtre de contexte est mesurée en tokens max : 128 000 pour GPT-4o, 200 000 pour Claude 3.5. Coût API : $2-15 par million de tokens input, $6-75 par million output.

Pensée simple

Un token, c'est une syllabe IA. "Chat" = 1 token. "Intelligence" = 3 tokens (In-tel-li-gence). Quand vous payez 0.01$ pour 1 000 tokens, vous payez pour que l'IA lise environ 750 mots de votre prompt. C'est comme un compteur de mots pour taxis — vous utilisez, vous payez au km.

Les 3 piliers du Token

Algorithme de tokenisation (BPE / SentencePiece)

Les LLMs modernes utilisent BPE ou SentencePiece. Ces algorithmes créent un vocabulaire de 30 000 à 200 000 tokens. Les mots fréquents = 1 token, les mots rares = plusieurs subword tokens. Un texte français avec accents peut coûter +20% en tokens vs ASCII pur.

Fenêtre de contexte et limites pratiques (Context Window)

La context window définit combien de tokens l'IA peut "voir" d'un coup. GPT-4o : 128K, Claude 3.5 : 200K, Gemini 1.5 : 1M. Les premiers et derniers tokens ont plus d'importance (effet de primauté et récence). Au-delà de 70% de la fenêtre, les performances baissent.

Facturation et optimisation (Cost Optimization)

Les API LLM facturent par token. Optimisations : (1) prompt compression, (2) few-shot examples minimalistes, (3) utiliser des modèles petits pour les tâches simples (GPT-4o-mini coûte 10x moins que GPT-4o). 1 page A4 ~= 530 tokens ~= $0.00106 pour Claude Haiku.

Le cycle du Token

  1. Token counting — compter les tokens via tiktoken ou API du provider
  2. Context feasibility check — vérifier que total < 70% de la fenêtre
  3. Cost estimation — estimer le coût via tarification $/M tokens
  4. Compression si nécessaire — réduire le prompt, utiliser modèles compacts
  5. Execution — envoyer et récupérer la réponse tokenisée
  6. Audit de consommation — comparer réels vs estimés, ajuster prompts

Exemple concret

Une entreprise de legaltech analyse 200 contrats PDF mensuels (15 pages chacun). Chaque contrat = 8 000 tokens input. Avec GPT-4o-mini ($0.15/1M) : coût mensuel = 200 × 8 000 × $0.15/1M = $2.40/mois. Avec GPT-4o ($5/1M) : $24/mois. Chunking intelligent à 500 tokens/contrat = $0.90/mois avec GPT-4o-mini.

Applications

  • Estimation de coût avant déploiement agent conversationnel
  • Optimisation des prompts longs (compression)
  • Gestion de fenêtre de contexte pour documents volumineux
  • Choix du modèle selon longueur de la tâche
  • Budget planning pour pipelines LLM haut volume

Métriques clés

MétriqueBenchmarkObjectif
Tokens/page A4 (français)530 tokens—
Ratio caractères/token~4 car/tok—
Coût GPT-4o-mini input$0.15/1M tok—
Coût GPT-4o input$5/1M tok—
Contexte optimal< 70% fenêtre< 70%