Gemini (Google DeepMind) est le modèle d'IA multimodal de Google, lancé en décembre 2023. Il comprend nativement le texte, le code, les images, l'audio et la vidéo — sans assemblage de modules. Gemini Ultra surpasse GPT-4 sur 30/32 benchmarks académiques (Google, 2024), dont MMLU (93,2% vs 86,4%) et HumanEval code (84,0% vs 67,0%).
Gemini existe en trois tailles : Nano (1,8B paramètres, embarqué mobile), Pro (inférence API, rapport qualité/prix), et Ultra (capacités maximales, modèles frontier). L'architecture native multimodal signifie que Gemini a été entraîné conjointement sur toutes les modalités — texte, image, audio, vidéo — partageant un même backbone de transformeurs. Cette approche unifiée lui donne une compréhension plus profonde des relations cross-modal : il comprend qu'une vidéo de chat qui tombe est drôle pour des raisons physiques et sociales, pas juste « chat » + « tombe ».
Gemini est le moteur de : (1) AI Overviews dans Google Search, (2) Gemini dans Workspace (Docs, Sheets, Slides), (3) Gemini sur Android (assistant vocal avec contexte d'écran), (4) Vertex AI pour les entreprises. API disponible via Google AI Studio et Vertex AI. Coût : Gemini 1.5 Flash = 0,035$/1M tokens input, Ultra = 0,0025$/1K tokens input (contexte window : 1 million de tokens).
Gemini, c'est un cerveau qui voit, lit, entend et code en même temps. Au lieu d'avoir un expert texte, un expert image et un expert audio qui ne parlent pas entre eux, Gemini est un seul expert qui fait tout — et qui comprend comment une image se rapporte à un texte, ou comment le code génère du son. C'est comme un élève qui peut simultanément lire un manuel de physique, regarder une expérience en vidéo, et rédiger une conclusion en compréhension totale.
Gemini a été entraîné conjointement sur texte, image, audio et vidéo avec un backbone de transformeurs partagé — pas de模組み合わせ (multimodal fusion layer) comme GPT-4V. Résultat : Gemini comprend les relations cross-modal de manière granulaire. Exemple : il peut analyser un graphique financier (image), le contexte macroeconomic (texte), et expliquer pourquoi une vidéo de trader réagit à un événement — dans une seule réponse cohérente. Cette perception unifiée lui permet de résoudre des tâches comme VideoQA (question answering sur vidéo) avec 89,4% sur ActivityNet-QA, là où GPT-4V stagne à 71%.
Gemini Ultra dépasse GPT-4 sur 30/32 benchmarks académiques主流 : MMLU (93,2% vs 86,4%), MATH (54,9% vs 52,0%), HumanEval code (84,0% vs 67,0%). Sur le benchmark MMMU (massive multimodal understanding) : 62,4% vs 56,8% pour GPT-4V. Ces scores reflètent des capacités réelles mais ne capturent pas toujours la实用的ité sur tâches métier. Un modèle avec un score lower peut parfois mieux performer en production sur des tâches spécifiques si son pre-training est plus proche du domaine.
Gemini est nativement intégré dans l'écosystème Google : (1) Search — AI Overviews (moteur principal depuis 2025), (2) Workspace — Gemini dans Docs (rédaction), Sheets (analyse), Slides (création), (3) Android — Gemini Assistant avec contexte d'écran et applications, (4) Cloud — Vertex AI pour le deployment enterprise avec RGPD compliance. Cette intégration native offre des avantages compétitifs en latence et coût vs API OpenAI externe. Pour les entreprises déjà dans l'écosystème Google Cloud, Gemini reduce la complexité d'intégration de -60%.
Une agence de contenu (3 rédacteurs) produit des articles avec recherche d'images. Avant Gemini : rédaction 4h + recherche image 1h = 5h/article. Avec Gemini 1.5 Pro (API multimodal) : prompts combiné pour générer ébauche + description image détaillée en 30 min, réduction à 2h/article. Gain : 60% de temps soit 3h × 35€/h × 20 articles/mois = 2 100€/mois. Le contexte window de 1M tokens permet aussi d'analyser 10 articles de concurrents en une seule requête —vs 10 appels API séparés avec GPT-4o (128K tokens).
| Métrique | Valeur |
|---|---|
| Contexte window (Ultra) | 1M tokens (le plus grand du marché) |
| MMLU score (Ultra) | 93,2% (vs GPT-4 : 86,4%) |
| HumanEval code (Ultra) | 84,0% (vs GPT-4 : 67,0%) |
| Coût API (Flash) | 0,035$/1M tokens input |
| Coût API (Ultra) | 0,0025$/1K tokens input |
| VideoQA benchmark | 89,4% (vs GPT-4V : 71%) |