A/B testing push : mesurer l’incrémental sans biaiser l’attribution
Tester un push ne consiste pas à comparer deux messages, mais à isoler un effet causal
La notification push est souvent testée comme un objet créatif : variante A contre variante B, deux accroches, deux horaires, deux CTA, puis arbitrage sur le taux d’ouverture ou le taux de clic. Cette lecture est confortable, mais elle répond rarement à la question qui intéresse une direction marketing ou finance : le push a-t-il créé des ventes, des visites magasin ou des sessions additionnelles, ou a-t-il simplement capté une intention déjà existante ? Dans les environnements retail et omnicanaux, l’enjeu n’est pas seulement de choisir la meilleure formulation. Il est de mesurer l’incrémental sans biaiser l’attribution.
L’incrémentalité désigne l’effet additionnel causé par une activation par rapport à ce qui se serait produit sans cette activation. L’attribution, méthode qui assigne une conversion à un ou plusieurs points de contact marketing, ne répond pas toujours à cette question. Un utilisateur qui consulte un produit, reçoit un push de relance, ouvre l’application et achète peut être attribué au push. Mais si son intention était déjà forte, une partie de cette vente aurait probablement eu lieu sans notification. Le push peut donc être crédité d’une conversion qu’il n’a pas réellement créée.
Ce biais est particulièrement fort sur mobile, car les signaux d’intention sont très proches de la conversion. Panier abandonné, favori produit, consultation de stock local, demande d’itinéraire, alerte disponibilité : tous ces événements identifient des utilisateurs naturellement plus susceptibles d’acheter ou de se déplacer. Les exposer à un push et comparer leur performance brute à celle d’utilisateurs moins intentionnistes revient à confondre propension et impact. Le test doit donc séparer deux dimensions : la qualité du ciblage et l’effet causal du message.
Pour les professionnels du marketing mobile, la discipline consiste à passer d’un A/B testing décoratif à un protocole expérimental robuste. Il faut décider quelle unité randomiser, quel groupe témoin conserver, quelle métrique primaire retenir, quelle fenêtre d’observation appliquer, comment traiter les conversions cross-canal et comment éviter que les modèles d’attribution ne réinjectent du biais dans la décision. Sans ce cadrage, le push peut afficher un CPA, cost per acquisition, coût nécessaire pour générer une conversion attribuée, très attractif, tout en ayant une contribution incrémentale faible. À l’inverse, un push moins spectaculaire en ouverture peut produire un meilleur ROAS incrémental, return on ad spend, ratio entre chiffre d’affaires additionnel et dépenses marketing, s’il modifie réellement le comportement.
Définir l’hypothèse : tester un levier, pas une moyenne globale
Un A/B test push utile commence par une hypothèse comportementale précise. Trop de tests comparent deux variantes sans expliciter le mécanisme attendu. Dire que l’on veut améliorer la performance d’un push promotionnel n’est pas une hypothèse. Dire que l’urgence limitée à 24 heures augmente la visite magasin des clients ayant consulté un stock local dans les 72 heures en est une. La différence est décisive : dans le second cas, on sait quelle population, quel comportement, quelle fenêtre et quel indicateur doivent être observés.
Le funnel, parcours allant de l’exposition à la considération, puis à la conversion et à la fidélisation, doit guider le choix de l’objectif. En haut de funnel, un push peut chercher à réactiver l’application ou à faire découvrir un service. En milieu de funnel, il peut pousser une catégorie, un événement local ou une disponibilité magasin. En bas de funnel, il sert souvent à lever une friction : produit en stock, rendez-vous disponible, panier non finalisé, coupon prêt à utiliser. Tester un push de réactivation et un push de conversion avec la même métrique primaire conduit à des conclusions instables.
Le premier arbitrage est donc la métrique. Le taux d’ouverture peut être pertinent pour diagnostiquer la visibilité d’un message, mais il ne doit pas devenir l’indicateur de décision économique. Le taux de clic mesure une interaction, pas nécessairement un achat. La visite magasin estimée peut être utile, mais elle dépend des méthodes de localisation et du consentement. Le chiffre d’affaires attribué est souvent surévalué si les utilisateurs étaient déjà intentionnistes. La marge incrémentale, lorsqu’elle est mesurable, reste l’indicateur le plus robuste pour arbitrer entre variantes, segments et niveaux de pression.
Une bonne formulation d’hypothèse peut suivre quatre éléments : population, traitement, comportement attendu, critère de succès. Par exemple : parmi les utilisateurs opt-in push ayant ajouté un produit running en favori dans les 7 derniers jours et se trouvant à moins de 15 minutes d’un magasin avec stock disponible, un push mentionnant la disponibilité locale et le retrait aujourd’hui génère davantage de visites incrémentales qu’un push promotionnel générique, avec une marge incrémentale par notification supérieure de 20 %. Cette phrase impose un cadrage opérationnel et empêche d’interpréter a posteriori n’importe quel signal favorable comme une victoire.
Il faut aussi distinguer test créatif, test d’audience, test de timing et test de pression. Si l’on modifie simultanément le segment, l’offre, l’heure d’envoi et le texte, le résultat devient difficile à interpréter. Un test A/B simple doit isoler une variable principale. Pour des plans plus complexes, un test factoriel peut être envisagé : par exemple 2 accroches x 2 horaires x 2 types de CTA. Mais cette sophistication exige des volumes importants et une gouvernance statistique rigoureuse. Dans la plupart des bases applicatives, mieux vaut tester moins de dimensions et mesurer plus proprement.
Conserver un vrai groupe témoin : le holdout est la condition de l’incrémentalité
Le piège le plus fréquent consiste à opposer deux variantes A et B sans groupe non exposé. Ce protocole permet de savoir quelle variante performe le mieux relativement à l’autre, mais pas si le push lui-même crée de la valeur. Si A génère 3,2 % d’achats et B 3,5 %, B semble meilleur. Mais si un groupe témoin comparable non exposé aurait généré 3,1 %, l’uplift réel de B n’est que de 0,4 point. Si le témoin aurait généré 3,4 %, l’effet de B devient marginal. Le holdout, groupe volontairement non exposé servant de contrefactuel, est donc central.
Dans un test push, le holdout peut être structuré de plusieurs manières. Un holdout global consiste à exclure une part fixe de la population éligible de toute campagne commerciale sur une période donnée. Il mesure l’effet global du programme push, mais il peut être coûteux si l’on prive durablement des utilisateurs d’offres utiles. Un holdout de campagne réserve 5 % à 20 % des utilisateurs éligibles à une opération précise. Il est plus simple à mettre en place et souvent suffisant pour estimer l’uplift d’une campagne. Un holdout permanent, parfois appelé ghost holdout, maintient un échantillon stable non sollicité pour suivre la pression marketing dans le temps ; il est plus robuste mais plus exigeant politiquement.
La randomisation doit intervenir au niveau de l’utilisateur, pas au niveau de l’événement, lorsque l’objectif est de mesurer l’effet relationnel ou commercial. Si le même utilisateur peut recevoir A un jour et B le lendemain, les effets se contaminent. Il peut ouvrir le second push parce que le premier a rappelé l’offre, ou inversement ignorer le second parce qu’il a déjà acheté. Pour les scénarios de relance, l’unité expérimentale doit souvent être le couple utilisateur-séquence : l’utilisateur est assigné à une stratégie complète, pas seulement à un message isolé.
La taille du holdout dépend du volume et de la conversion attendue. Les équipes sous-dimensionnent souvent les groupes témoins parce qu’elles craignent de perdre du chiffre d’affaires. Pourtant, un témoin trop petit produit une mesure inutilisable. Si une campagne cible 50 000 utilisateurs et que le taux d’achat attendu est de 0,5 %, un holdout de 5 % ne représente que 2 500 personnes et environ 12 à 13 achats attendus. La variance sera très élevée. À l’inverse, sur une base de 800 000 opt-in avec un taux de conversion de 2 %, un holdout de 5 % peut déjà produire une mesure solide. Le protocole doit être dimensionné selon l’événement mesuré, pas selon un pourcentage standard.
Un exemple illustre l’écart entre attribution et incrémentalité. Une enseigne mode envoie un push à 360 000 utilisateurs ayant consulté une catégorie dans les 10 derniers jours. Elle répartit 300 000 utilisateurs entre deux variantes, A et B, et conserve 60 000 en holdout. Sur 7 jours, A génère 2,9 % d’achats, B 3,1 %, le holdout 2,6 %. L’attribution brute pourrait créditer B de 9 300 achats. L’incrément réel est plutôt de 0,5 point par rapport au témoin, soit 1 500 achats additionnels sur les 300 000 exposés si l’on applique l’écart moyen. Si le panier moyen incrémental est de 54 euros et la marge brute de 42 %, la marge additionnelle est d’environ 34 000 euros. Cette lecture est nettement moins flatteuse que le chiffre d’affaires attribué brut, mais elle est décisionnelle.
Éviter les biais d’attribution : last click, intention préexistante et fenêtres trop larges
L’attribution push est facilement biaisée, car le canal intervient souvent très près de la conversion. Le last click, modèle qui attribue toute la conversion au dernier point de contact avant l’achat, favorise mécaniquement les relances tardives. Un push envoyé après une consultation produit sera souvent le dernier contact observable. Cela ne prouve pas qu’il a créé la conversion ; cela prouve qu’il a été proche d’un comportement déjà probable. Plus le ciblage est intentionniste, plus l’écart entre attribution et incrémentalité peut être important.
La fenêtre d’attribution est un autre point critique. Une fenêtre de 7 jours peut être pertinente pour l’équipement de la maison ou l’optique, mais excessive pour une offre déjeuner ou une promotion de proximité valable le jour même. Plus la fenêtre est longue, plus elle capte des conversions organiques qui auraient eu lieu sans push. À l’inverse, une fenêtre trop courte peut sous-estimer l’effet d’un message de considération. Le choix doit dépendre de la catégorie, du cycle d’achat, de la promesse et du comportement mesuré. Une bonne pratique consiste à analyser plusieurs horizons : 24 heures, 72 heures, 7 jours et, pour les achats longs, 14 ou 30 jours. Si l’effet disparaît après correction par le témoin, le push était surtout un point de contact attribué.
Les conversions cross-canal ajoutent de la complexité. Un utilisateur peut recevoir un push, ne pas ouvrir l’application, puis se rendre en magasin ou acheter sur desktop. Si l’identifiant client est reconnu en caisse ou en ligne, la conversion peut être reliée au test. Sinon, elle sera invisible ou attribuée à un autre canal. Pour le Drive-to-Store, stratégie visant à générer du trafic qualifié vers un point de vente physique, la mesure doit idéalement combiner données de caisse, carte de fidélité, coupons individuels, visites géolocalisées consenties et événements applicatifs. Aucun signal n’est parfait ; l’important est de documenter le biais de chaque source.
Le risque inverse existe aussi : sur-attribuer toutes les ventes d’un utilisateur exposé. Si un client reçoit un push sur une catégorie jardin et achète le lendemain un produit électroménager sans lien avec le message, faut-il attribuer la vente au push ? Probablement pas, sauf si l’objectif était une réactivation générale. Les règles d’attribution doivent donc intégrer une cohérence entre message, catégorie, magasin, événement et fenêtre temporelle. Une attribution trop permissive améliore artificiellement le ROAS et dégrade les arbitrages budgétaires.
Les campagnes omnicanales peuvent contaminer les résultats. Une population exposée au push peut également recevoir un email, un SMS, une campagne social mobile ou une impression programmatique via une DSP, demand-side platform, plateforme permettant aux annonceurs d’acheter automatiquement des impressions publicitaires. En RTB, real-time bidding, mécanisme d’enchères en temps réel pour acheter une impression disponible, les algorithmes peuvent cibler les mêmes utilisateurs intentionnistes que le push. Si le test ne contrôle pas cette exposition, l’uplift observé peut provenir d’un mix de canaux. Il faut donc soit maintenir les autres canaux constants entre groupes, soit les mesurer et les intégrer comme variables de contrôle.
Dimensionner le test : puissance statistique, MDE et risques de faux positifs
Un A/B test push peut être techniquement facile à lancer et statistiquement fragile à interpréter. Le premier sujet est la puissance statistique, c’est-à-dire la capacité d’un test à détecter un effet réel lorsqu’il existe. Elle dépend du volume exposé, du taux de conversion de base, de l’écart attendu et du niveau de confiance retenu. Le MDE, minimum detectable effect, effet minimal détectable avec une puissance donnée, doit être défini avant le lancement. Si le test ne peut détecter qu’un écart de 20 % alors que l’effet attendu réaliste est de 3 %, il ne répondra pas à la question.
Sur des indicateurs fréquents comme l’ouverture, les volumes nécessaires sont modérés. Sur des indicateurs rares comme l’achat en magasin ou la marge incrémentale, ils deviennent rapidement élevés. Supposons une base de 100 000 utilisateurs, un taux d’achat témoin de 1 % et deux variantes exposées à 45 000 utilisateurs chacune, avec 10 000 en holdout. Un écart de 0,2 point peut représenter 90 achats supplémentaires dans une variante, mais l’incertitude statistique peut rester importante. Si la décision engage un plan national ou une hausse de pression sur plusieurs mois, un test plus large ou répété sera nécessaire.
Les faux positifs sont fréquents lorsque les équipes multiplient les lectures après coup : ouverture à 24 heures, clic à 48 heures, achat à 7 jours, panier moyen, marge, visites, sessions, par segment, par magasin, par OS, par heure d’envoi. Plus on observe de métriques et de sous-populations, plus la probabilité de trouver un résultat apparemment significatif par hasard augmente. Cela ne signifie pas qu’il faille ignorer les analyses exploratoires, mais qu’il faut distinguer métrique primaire pré-définie et signaux secondaires. La décision doit reposer sur la métrique primaire ou sur une réplication, pas sur le meilleur chiffre sorti d’un tableau croisé.
Le peeking, pratique consistant à regarder les résultats en continu et à arrêter le test dès qu’un écart semble favorable, biaise également la mesure. Dans un test classique, la durée et les règles d’arrêt doivent être définies avant le lancement. Si l’on souhaite optimiser en cours de campagne, des méthodes adaptées existent, comme les tests séquentiels ou les bandits multi-bras, algorithmes répartissant progressivement le trafic vers les variantes les plus performantes tout en continuant à explorer. Mais ces approches répondent à une logique d’optimisation opérationnelle plus qu’à une mesure causale pure. Elles doivent être utilisées avec prudence si l’objectif est d’estimer l’incrémentalité.
La saisonnalité et le calendrier commercial peuvent aussi fausser les résultats. Un push envoyé le vendredi à une variante et le lundi à une autre ne teste pas seulement le message ; il teste le jour. Une campagne lancée pendant des soldes, un pont, une météo favorable ou une rupture stock locale doit être interprétée dans ce contexte. En retail, les effets magasin peuvent être majeurs : deux variantes exposées à des utilisateurs rattachés à des magasins différents peuvent refléter des différences de stock, de trafic ou d’attractivité locale. La randomisation doit équilibrer ces variables ou l’analyse doit les contrôler.
Lire les résultats en valeur : uplift, marge et coût relationnel
La lecture d’un A/B test push ne doit pas s’arrêter au gagnant statistique. Il faut convertir l’effet en valeur business. L’uplift absolu, par exemple +0,4 point de conversion, est souvent plus utile que l’uplift relatif, par exemple +18 %, car il permet de calculer le nombre d’achats incrémentaux. La marge incrémentale doit ensuite intégrer le panier, la marge brute, la remise éventuelle, les coûts techniques ou créatifs et le coût relationnel. Même si le coût d’envoi d’un push est faible, le coût d’opportunité peut être élevé : chaque notification consomme de l’attention et peut augmenter la désactivation du canal.
Un cas simplifié permet de cadrer l’analyse. Une enseigne de sport teste deux pushs auprès d’utilisateurs ayant consulté des chaussures running. Le groupe A reçoit un message promotionnel : 15 % aujourd’hui. Le groupe B reçoit un message de service : votre taille est disponible dans votre magasin, retrait en deux heures. Un holdout est conservé. À 7 jours, A affiche un taux d’achat de 4,2 %, B de 3,8 %, le holdout de 3,3 %. En attribution brute, A gagne. En incrémental, A produit +0,9 point et B +0,5 point. Mais le panier moyen de A est de 72 euros avec une marge nette après remise de 28 %, tandis que B génère un panier de 81 euros avec une marge de 41 %. Sur 100 000 exposés, A génère environ 900 achats incrémentaux et 18 144 euros de marge ; B génère 500 achats incrémentaux et 16 605 euros de marge. L’écart économique est beaucoup plus faible que l’écart de conversion ne le suggère. Si A génère deux fois plus de désactivations push, B peut devenir préférable à moyen terme.
Les signaux négatifs doivent être intégrés systématiquement : opt-out push, désinstallation de l’application, baisse de fréquence de session, désengagement sur les campagnes suivantes, plaintes au service client, non-utilisation des coupons activés. Un push agressif peut créer un pic court terme et réduire la valeur future. Pour les segments à forte LTV, lifetime value, valeur économique attendue d’un client sur la durée de relation, cette perte relationnelle peut dépasser la marge immédiate. Le test doit donc distinguer rendement immédiat et valeur client.
Le CPA incrémental doit être recalculé. Si une campagne produit 5 000 conversions attribuées pour un coût complet de 20 000 euros, le CPA attribué est de 4 euros. Si le holdout montre que seules 1 200 conversions sont réellement incrémentales, le CPA incrémental est de 16,67 euros. Cette différence change les arbitrages entre push, SMS, email, média programmatique et opérations magasin. Elle évite aussi de surexploiter un canal parce qu’il semble gratuit ou très rentable dans un modèle d’attribution incomplet.
Le ROAS doit suivre la même logique. Le ROAS attribué sert au pilotage tactique, mais le ROAS incrémental doit guider l’allocation budgétaire. Le ROAS marge, calculé sur la marge incrémentale plutôt que sur le chiffre d’affaires, est encore plus pertinent lorsque les variantes incluent des remises. Une notification sans remise mais avec une preuve de disponibilité peut convertir moins d’utilisateurs qu’un coupon, tout en créant davantage de contribution nette. Le test doit permettre d’arbitrer ces compromis, pas seulement d’élire le message qui obtient le plus de clics.
Construire un protocole opérationnel : du ciblage à la décision
Un protocole robuste peut être structuré en sept étapes. Premièrement, définir l’objectif business : achat app, visite magasin, réactivation, utilisation de coupon, rendez-vous, panier moyen ou marge. Deuxièmement, sélectionner une population éligible homogène, en documentant les critères d’intention, de valeur, de consentement, de pression récente et d’exclusion. Troisièmement, randomiser les utilisateurs entre variantes et holdout avant l’envoi, en assurant l’équilibre sur les variables clés : OS, ancienneté, magasin favori, segment RFM, réactivité historique. La méthode RFM, récence, fréquence, montant, classe les clients selon la date du dernier achat, la fréquence d’achat et la valeur dépensée.
Quatrièmement, verrouiller les traitements. Chaque groupe doit recevoir uniquement sa variante, avec les mêmes règles de délivrabilité, d’horaire et de capping, sauf si l’horaire est précisément la variable testée. Le capping, limitation de la fréquence de sollicitation sur une période donnée, doit être appliqué au niveau utilisateur pour éviter qu’un autre message commercial ne vienne parasiter le test. Cinquièmement, définir les fenêtres de mesure : ouverture et clic à court terme, conversion à un horizon cohérent avec la catégorie, suivi post-campagne pour détecter l’anticipation ou la cannibalisation temporelle.
Sixièmement, collecter les conversions avec une logique cross-canal. Pour un achat magasin, il faut relier autant que possible l’exposition à la donnée caisse via identifiant client, carte de fidélité, coupon unique ou autre clé consentie. Pour une visite, il faut préciser s’il s’agit d’une visite estimée par localisation mobile, d’une demande d’itinéraire, d’un check-in applicatif ou d’une transaction. Ces signaux n’ont pas la même valeur probante. Septièmement, décider selon une matrice combinant uplift, marge, signaux négatifs et capacité de généralisation.
La décision ne doit pas être automatique. Si une variante gagne sur un segment très intentionniste, elle ne sera pas nécessairement performante sur une base plus large. Si elle gagne pendant une période promotionnelle exceptionnelle, l’effet peut ne pas se reproduire. Si elle gagne en ouverture mais pas en conversion, elle peut être créativement attractive mais économiquement faible. Si elle gagne sur iOS mais pas sur Android, il faut vérifier les différences de base, de délivrabilité, de comportements app et d’autorisations de suivi. Le rôle du test est de réduire l’incertitude, pas de supprimer le jugement marketing.
La documentation est une condition de progrès. Chaque test doit laisser une trace : hypothèse, population, taille d’échantillon, randomisation, variantes, fenêtre, métrique primaire, résultats, biais connus, décision prise et impact estimé. Sans mémoire expérimentale, les équipes répètent les mêmes tests, comparent des résultats non comparables et construisent des convictions sur des moyennes fragiles. Une taxonomie commune des pushs, service, commercial, local, réactivation, fidélité, promotion, permet de capitaliser sur plusieurs vagues et de détecter les patterns réels.
Conclusion : mesurer moins de signaux, mais mesurer mieux l’effet causal
L’A/B testing push devient réellement utile lorsqu’il cesse d’être un concours d’ouverture pour devenir un dispositif d’apprentissage causal. La question centrale n’est pas quelle variante obtient le plus d’interactions, mais quelle stratégie crée le plus de valeur additionnelle, pour quel segment, à quel coût économique et relationnel. Dans un canal aussi intrusif que le push, cette rigueur protège autant la performance que la permission utilisateur.
Une feuille de route actionnable peut se résumer ainsi. Définir une hypothèse comportementale précise avant de tester. Choisir une métrique primaire reliée à l’objectif business, idéalement l’uplift de conversion ou de marge. Conserver un holdout suffisant pour mesurer le contrefactuel. Randomiser au niveau utilisateur ou séquence, pas seulement au niveau message. Limiter les variables testées pour interpréter l’effet. Contrôler les expositions omnicanales et les fenêtres d’attribution. Dimensionner le test avec un MDE réaliste. Lire les résultats en marge incrémentale, CPA incrémental et signaux négatifs, pas seulement en clics. Documenter chaque apprentissage pour améliorer les scénarios suivants.
Le point critique est l’humilité analytique. Un push envoyé à une audience intentionniste aura presque toujours une belle performance attribuée. Cela ne suffit pas à prouver sa valeur. Le marketing mobile mature accepte de priver une partie limitée de l’audience d’un message pour mesurer ce qui se serait passé sans lui. Ce coût apparent est le prix de la décision fiable. À long terme, il permet de réduire les sollicitations inutiles, d’allouer la pression aux moments où elle change vraiment le comportement et de défendre le push comme un levier incrémental, pas comme un simple capteur d’intentions déjà présentes.