L'A/B Testing (ou test A/B) est une méthode d'expérimentation qui compare deux versions d'une même page pour déterminer laquelle convertit mieux. 50% des visiteurs voient la version A (contrôle),50% voient la version B (variante). Après reach statistical significance (enough sample size), on garde la gagnante. Les sites qui A/B testent systématiquement gagnent en moyenne +15% de conversion.
L'A/B Testing repose sur le raisonnement statistique : (1) Hypothèse : « En changeant la couleur du bouton CTA de bleu à vert, le taux de clic passera de3% à 4% », (2) Calcul de sample size : combien de visiteurs par variante pour détecter une différence de1% avec 95% de confiance (≈ 10000/variante), (3) Split traffic : 50/50 ou pondéré (70/30), (4) Durée : 运行 jusqu'à reach significance OU expiration du temps calculé. Outils : Google Optimize (gratuit, sunset en2023), Optimizely, VWO, Adobe Target. Statistical significance target : 95% (minimum 90%).
L'A/B Testing, c'est comme un jury qui écoute deux avocats. Le jury (les visiteurs) est divisé en deux groupes égaux — le premier entend l'avocat A, le second entend l'avocat B. À la fin, on compte combien ont condamné (conversion) dans chaque groupe. Si l'avocat B a obtenu40% de condamnations vs 25% pour A, on garde B. Mais il faut assez de jurés (sample size) pour être sûr que la différence n'est pas due au hasard. Un jury de 10 personnes ne peut pas conclure — il en faut 1000+.
Une hypothèse mal formulée = test inutile. Bonne hypothèse : « Le changement du titre H1 de "Livraison gratuite" à "Livraison gratuite en 24h" augmentera le taux de conversion de la page produit de 3.2% à 4.0% ». Éléments : (1) Specific change — exactement quoi changer, (2) Baseline — performance actuelle mesurée, (3) Expected lift — improvement attendue, (4) Primary metric — la métrique principale (conversion, CTR, bounce rate). Sample size calculator (Evan Miller) : pour détecter un lift de +25% relatif avec 95% de confiance et 80% de power, il faut ≈ 12 000 visiteurs/variante.
Une fois le test terminé, il faut analyser les résultats correctement : (1) Overall result — la variant a-t-elle battu le contrôle avec significance ?, (2) Segmentation — le test a-t-il fonctionné différemment sur mobile vs desktop, new vs returning visitors ? Un test négatif overall peut être positif sur mobile. (3) Revenue impact — si le test est positif, calculer le revenue adicional. Outil : Bayesian A/B testing (plus rapide à conclure, donne la probabilité que B soit meilleur). Erreur comune : arrêter un test trop tôt (peaking) — cela surestime l'effet de +30% en moyenne.
Stack technique : (1) Client-side (JavaScript) — VWO, Optimizely, Google Optimize (injecte le variant via JS). Facile à implémenter mais risque de FOUC (flash of unstyled content), (2) Server-side — vous gérez la logique de split dans votre code. Plus précis, pas de FOUC, plus complexe, (3) CDN-level — Cloudflare Segment pour faire le split à la edge, ideal pour le caching. Coût : Google Optimize gratuit (jusqu'à 16 variants,5M impressions/mois), VWO 75$/mois, Optimizely 1000$/mois+.
Site e-commerce de décoration (CA 1.2M€/an) veut améliorer le checkout. Hypothèse : « Réduire le nombre de champs de checkout de 8 à 4 (nom, email, adresse, paiement) augmentera le taux de conversion checkout de 68% à 75% ». Sample size :8 000 visiteurs/variante. Test sur 3 semaines : (1) Groupe A (4100 visiteurs) : checkout standard 8 champs, (2) Groupe B (4 100 visiteurs) : checkout express 4 champs. Résultat : conversion checkout B : 74.2% vs A : 67.8% (+6.4 points, p< 0.001). Impact CA : +96 000€/an (meilleure conversion × traffic annuel). Coût du test :0$ (Google Optimize).
| Métrique | Valeur |
|---|---|
| Significance target | 95% (minimum 90%) |
| Sample size (lift 25%) | ~12 000/variante |
| Overestimation si test arrêté tôt | +30% (peaking bias) |
| Gain moyen conversion A/B test | +15% (sites qui testent régulièrement) |
| Google Optimize free | 16 variants, 5M impressions/mois |
| Erreur peak effect | +30% surestimation (arrêt précoce) |