Aller au contenu principal
Retour au lexique

LLM (Large Language Model)

INTELLIGENCE ARTIFICIELLE

Définition courte

Un LLM (Large Language Model) est un modèle de langage de très grande taille, entraîné sur des billions de textes, capable de comprendre et générer du langage humain de manière contextualisée. GPT-4, Claude 3, Gemini sont des LLM. Ils ne réfléchissent pas comme les humains — ils prédisent le prochain token le plus probable en fonction de patterns appris.

Définition complète

Un LLM est un modèle de deep learning avec des milliards de paramètres (OpenAI GPT-4 : ~1.76 trillion params, Claude 3.5 : unknown but > 1T). L'entraînement utilise le transformer architecture (introduit par Vaswani 2017) : un réseau de layers d'attention multi-tête qui apprennent des représentations hiérarchiques du language. Le pre-training est unsupervised sur un corpus massif (Common Crawl, Wikipedia, books, code) via next-token prediction : le modèle apprend à prédire le mot suivant dans une séquence. Le RLHF (Reinforcement Learning from Human Feedback) affine ensuite le modèle pour être helpful, harmless, et honest. Le résultat : un modèle qui peut comprendre le contexte, raisonner, summariser, traduire, répondre aux questions, et générer du texte cohérent sur virtually n'importe quel sujet. Limites : hallucinations (confiance excessive), knowledge cutoff (limites temporelles), et compute cost (GPT-4o = $2.50/1M tokens output).

Pensée simple

Un LLM, c'est comme un enfant qui a lu des millions de livres pendant 10 ans sans dormir. Il n'a pas vraiment "compris" le monde comme vous et moi — mais il a appris tous les patterns du language, toutes les phrases, tous les contextes. Résultat : il peut répondre à presque n'importe quelle question de manière fluide, mais parfois il invente des réponses plausibles mais fausses. C'est un predictor très sophistiqué, pas un专家 avec une conscience.

Les 3 piliers du LLM

Pre-entraînement (Massive scale + data quality)

Le pre-training est le processus le plus coûteux et le plus important. (1) Corpus scaling — GPT-3 a été entraîné sur 300B tokens, GPT-4 sur ~2T tokens (estimé), Claude 3 sur 3T tokens (estimé). Plus le corpus est large, plus le modèle est général. (2) Data quality filtering — pas tous les textes sont égaux. Les données sont filtrées pour remove low-quality (spam, duplicates, low-information), NSFW, et protected content. The Pile (EleutherAI) et RedPajama sont des datasets open流行的. (3) Compute scaling — GPT-3 a nécessité 3.6M GPU hours sur V100. Les Frontier models coûtent $50-100M+ en compute. (4) Architecture efficiency — des techniques comme混合专家 (Mixture of Experts, MoE) permettent d'avoir plus de paramètres sans augmenter le compute (Mixtral 8x7B = 47B params but only 12B active per token).

Inférence (Serving + optimization)

L'inférence est le processus de générer une réponse. Optimisations critiques : (1) KV Cache — les clés et valeurs d'attention des tokens précédents sont cached pour éviter de les recalculer. Réduit le compute de ~50%. (2) Quantization — passer de float16 à int8 ou int4 réduit la mémoire GPU de 2-4x avec une perte de précision minimale (~1% accuracy). (3) Speculative decoding — un petit modèle prédit plusieurs tokens, le grand modèle les vérifie en parallèle. +30% throughput. (4) Batching — grouper plusieurs requêtes utilisateurs en un seul forward pass. Throughput = batch_size / latency. Coût d'inférence : le défi majeur pour les applications production. GPT-4o output = $15/1M tokens, input = $5/1M tokens.

Alignment et RLHF (Human feedback)

Le pre-training produit un modèle qui prédit le next token — pas forcément un modèle qui est helpful. Le RLHF aligne le modèle avec les préférences humaines : (1) SFT (Supervised Fine-Tuning) — le modèle est fine-tuné sur des demonstrations humaines de réponses идеальные. (2) Reward Model — un modèle est entraîné à prédire quel response un humain préfèrerait (pairwise comparison). (3) PPO (Proximal Policy Optimization) — le modèle,语言模型 est affiné pour maximize le reward du reward model. Résultat : un modèle qui est plus susceptible d'être helpful, harmless, et honest. Limites : le RLHF peut être sur-optimisé (reward hacking), et le modèle peutlearn to please without être factuel. Les alternatives : Constitutional AI (Anthropic), Direct Preference Optimization (DPO).

Le cycle LLM

  1. Pre-training — le modèle apprend les patterns du language sur un massive corpus non-labelled
  2. Post-training — SFT + RLHF alignent le modèle avec les préférences humaines
  3. Fine-tuning optionnel — le modèle est spécialisé sur un domain ou tâche spécifique
  4. Inférence — le modèle génère une réponse à partir d'un prompt utilisateur
  5. Evalution — benchmark sur des tâches standardisées (MMLU, HumanEval, GSM8K)
  6. Red-teaming — des testeurs cherchent des failles (hallucinations, bias, safety)
  7. Deployment — le modèle est déployé en production avec monitoring des performances

Exemple concret

PME comptables (30 experts) déploie Claude 3.5 pour l'analyse de contrats. Avant : chaque contrat doit être lu et résumé par un expert (30 min en moyenne, $45/contrat en coût expert). Après : l'agent LLM analyse le contrat en 45 secondes, extrait les clauses clés, évalue les risques, et génère un résumé structuré. Exactitude : 94% sur les clauses contractuelles (vs 98% expert humain, gap acceptable). Coût : $0.12/contrat (API Claude). Temps expert libéré : 70% des contrats ne nécessitent plus de relecture complète — only validation finale. Impact : -60% coût unitaire, -75% temps de traitement, capacité x3 sans embauche.

Applications

  • Rédaction assistée — drafts, rewrites, summaries. +40% productivity writers (OpenAI study).
  • Customer support — 73% des tickets résolus sans human (Intercom benchmark).
  • Code generation — GitHub Copilot = +55% developer productivity (GitHub data 2024).
  • Research et analysis — synthesis de documents, extraction de données. -75% temps research.
  • Multilingual translation — traduction上下文-aware, +30% qualité vs statistical MT.

Métriques clés

MétriqueValeur
GPT-4o output cost$15/1M tokens
Claude 3.5 Sonnet context window200K tokens
MMLU benchmark GPT-486.4% (human expert = 89%)
Developer productivity uplift+55% (GitHub Copilot 2024)
Quantization accuracy loss int8~1% vs float16
Speculative decoding speedup+30% throughput