La prova A/B (també coneguda com a prova de bucket, prova d'execució dividida o prova divididaés un mètode d'investigació de l'experiència d'usuari. Les proves A/B consisteixen en un experiment aleatoritzat que normalment implica dues variants (A i B), tot i que el concepte també es pot estendre a múltiples variants de la mateixa variable. Inclou l'aplicació de proves d'hipòtesis estadístiques o "proves d'hipòtesis de dues mostres" tal com s'utilitzen en el camp de l'estadística. Les proves A/B s'utilitzen per comparar múltiples versions d'una sola variable, per exemple, provant la resposta d'un subjecte a la variant A amb la variant B, i per determinar quina de les variants és més efectiva.
Les proves multivariants o multinomials són similars a les proves A/B, però poden provar més de dues versions alhora o utilitzar més controls. Les proves A/B simples no són vàlides per a situacions observacionals, quasi experimentals o altres situacions no experimentals, cosa que és habitual amb dades d'enquestes, dades fora de línia i altres fenòmens més complexos.
Definició
"Proves A/B" és una abreviatura per a un experiment controlat aleatori simple, en què es comparen diverses mostres (per exemple, A i B) d'una única variable vectorial. Les proves A/B es consideren àmpliament la forma més simple d'experiment controlat, especialment quan només impliquen dues variants. Tanmateix, en afegir més variants a la prova, la seva complexitat creix.
L'exemple següent il·lustra una prova A/B amb una sola variable:
Una empresa té una base de dades de clients de 2.000 persones i llança una campanya de correu electrònic amb un codi de descompte per tal de generar vendes a través del seu lloc web. L'empresa crea dues versions del correu electrònic amb diferents crides a l'acció (la part del text que anima els clients a actuar; en el cas d'una campanya de vendes, fer una compra) i codis promocionals identificatius.
- A 1.000 persones, l'empresa envia un correu electrònic amb la crida a l'acció que diu "L'oferta finalitza aquest dissabte! Feu servir el codi A1".
- A les 1.000 persones restants, envia un correu electrònic amb la crida a l'acció que diu "L'oferta finalitza aviat! Feu servir el codi B1".
- Tots els altres elements del text i el disseny dels correus electrònics són idèntics.
L'empresa controla quina campanya té la taxa d'èxit més alta analitzant l'ús dels codis promocionals. El correu electrònic que utilitza el codi A1 té una taxa de resposta del 5% (50 de les 1.000 persones a qui s'ha enviat el correu electrònic van utilitzar el codi per comprar un producte) i el correu electrònic que utilitza el codi B1 té una taxa de resposta del 3% (30 dels destinataris van utilitzar el codi per comprar un producte). Per tant, l'empresa determina que, en aquest cas, la primera crida a l'acció és més efectiva i la farà servir en vendes futures. Un enfocament més matisat implicaria aplicar proves estadístiques per determinar si les diferències en les taxes de resposta entre A1 i B1 eren estadísticament significatives (molt probablement que les diferències siguin reals, repetibles i no el resultat de l'atzar).
En l'exemple anterior, l'objectiu de la prova és determinar l'estratègia més eficaç per animar els clients a fer una compra. Si, tanmateix, l'objectiu de la prova hagués estat determinar quin correu electrònic generaria una taxa de clics més alta (el percentatge de persones que realment fan clic a l'enllaç després de rebre el correu electrònic), els resultats podrien haver estat diferents.
Per exemple, tot i que més dels clients que van rebre el codi B1 van accedir al lloc web, com que la crida a l'acció no indicava la data de finalització de la promoció, és possible que molts destinataris no sentin cap urgència per fer una compra immediata. En conseqüència, si l'objectiu de la prova hagués estat simplement determinar quin correu electrònic portaria més trànsit al lloc web, el correu electrònic que contenia el codi B1 podria haver tingut més èxit. Una prova A/B hauria de tenir un resultat definit i mesurable, com ara vendes convertides, taxa de clics o taxa de registre.
Estadístiques de prova comunes
Les proves d'hipòtesi de dues mostres són adequades per comparar les dues mostres en què les mostres es divideixen pels dos casos de control de l'experiment. Les proves Z són apropiades per comparar mitjanes sota condicions estrictes pel que fa a la normalitat i una desviació estàndard coneguda. Les proves t de Student són apropiades per comparar mitjanes en condicions relaxades quan se suposa que n'hi ha menys. La prova t de Welch assumeix el mínim i, per tant, és la prova d'hipòtesi de dues mostres més utilitzada en la qual s'ha d'optimitzar la mitjana d'una mètrica. Tot i que la mitjana de la variable a optimitzar és l'estimador més comú, se n'utilitzen d'altres amb regularitat.
La prova exacta de Fisher es pot utilitzar per comparar dues distribucions binomials, com ara la taxa de clics.
| Distribució assumida | Cas d'exemple | Prova estàndard | Prova alternativa |
|---|---|---|---|
| Gaussià | Ingressos mitjans per usuari | Prova t de Welch (prova t no aparellada) | Prova t de Student |
| Binomial | Taxa de clics | Prova exacta de Fisher | Prova de Barnard |
| Poisson | Transaccions per usuari de pagament | Prova electrònica | Prova C |
| Multinomial | Nombre de cada producte comprat | Prova de khi quadrat | Prova G |
| Desconegut | Prova U de Mann-Whitney | Mostreig de Gibbs |
Segmentació i orientació
Les proves A/B solen aplicar la mateixa variant (per exemple, un element de la interfície d'usuari) amb la mateixa probabilitat a tots els usuaris. No obstant això, en algunes circumstàncies, les respostes a les variants poden ser heterogènies. Mentre que una variant A pot tenir una taxa de resposta més alta en general, la variant B pot tenir una taxa de resposta encara més alta dins d'un segment específic de la base de clients.
Per exemple, en l'exemple anterior, el desglossament de les taxes de resposta per sexe podria haver estat:
| Gènere | En general | Homes | Dones |
|---|---|---|---|
| Total d'enviaments | 2.000 | 1.000 | 1.000 |
| Total de respostes | 80 | 35 | 45 |
| Variant A | 501,000 (5%) | 10500 (2%) | 40500 (8%) |
| Variant B | 301,000 (3%) | 25500 (5%) | 5500 (1%) |
En aquest cas, mentre que la variant A va atreure una taxa de resposta global més alta, la variant B va provocar una taxa de resposta més alta entre els homes.
Com a resultat, l'empresa podria seleccionar una estratègia segmentada com a resultat de la prova A/B, enviant la variant B als homes i la variant A a les dones en el futur. En aquest exemple, una estratègia segmentada generaria un augment del 30% en les taxes de resposta esperades de a
.
Si s'esperen resultats segmentats de la prova A/B, la prova s'ha de dissenyar correctament des del principi per tal que es distribueixi uniformement entre els atributs clau del client, com ara el sexe. La prova ha de contenir una mostra representativa d'homes vs. dones i assignar homes i dones aleatòriament a cada "variant" (variant A vs. variant B). Si no es fa això, es podria produir un biaix d'experiment i conclusions inexactes.
Aquest enfocament de segmentació i orientació es pot generalitzar encara més per incloure múltiples atributs del client en lloc d'un únic atribut del client — per exemple, l'edat i el sexe dels clients — per identificar patrons més matisats que puguin existir en els resultats de les proves.
Compromisos
Positius
Els resultats de les proves A/B són fàcils d'interpretar per crear una imatge clara de les preferències reals de l'usuari, ja que proven directament una opció sobre una altra. Les proves A/B també poden proporcionar respostes a preguntes de disseny molt específiques. Un exemple d'això són les proves A/B de Google amb colors d'hiperenllaços. Per tal d'optimitzar els ingressos, Google va provar desenes de colors d'enllaços per determinar quins colors atrauen més clics.
Negatius
Els tests A/B són sensibles a la variància; requereixen una mostra gran per reduir l'error estàndard i produir un resultat estadísticament significatiu. En aplicacions en què hi ha molts usuaris actius, com ara les plataformes populars de xarxes socials, obtenir una mostra gran és trivial. En altres casos, s'obtenen mostres grans augmentant el període d'inscripció a l'experiment. Tanmateix, utilitzant una tècnica encunyada per Microsoft com a Experiment Controlat que Utilitza Dades Preexperimentals (CUPED), es pot tenir en compte la variància respecte a l'inici de l'experiment, de manera que es requereixen menys mostres per produir un resultat estadísticament significatiu.
A causa de la seva naturalesa d'experiment, executar una prova A/B introdueix el risc de pèrdua de temps i recursos si la prova produeix resultats no desitjats o inútils.
El desembre de 2018, representants amb experiència en proves A/B a gran escala de 13 organitzacions (Airbnb, Amazon, Booking.com, Facebook, Google, LinkedIn, Lyft, Microsoft, Netflix, Twitter, Uber i la Universitat de Stanford) van resumir els principals reptes en un article. Els reptes es van agrupar en quatre àrees: anàlisi, enginyeria i cultura, desviacions de les proves A/B tradicionals i qualitat de les dades.
Història
És difícil establir amb certesa quan es van utilitzar per primera vegada les proves A/B. El primer assaig aleatoritzat doble cec per avaluar l'eficàcia d'un fàrmac homeopàtic va tenir lloc el 1835. L'experimentació amb campanyes publicitàries, que s'ha comparat amb les proves A/B modernes, va començar a principis del segle XX. El pioner de la publicitat Claude Hopkins va utilitzar cupons promocionals per provar l'eficàcia de les seves campanyes. Tanmateix, aquest procés, que Hopkins va descriure al seu llibre *Scientific Advertising* de 1923, no incorporava conceptes com la significació estadística i la hipòtesi nul·la, que s'utilitzen en les proves d'hipòtesis estadístiques. Els mètodes estadístics moderns per avaluar la significació de les dades de la mostra es van desenvolupar per separat en el mateix període. Aquest treball va ser dut a terme el 1908 per William Sealy Gosset quan va modificar la prova Z per crear la prova t de Student.
Amb el creixement d'Internet, han aparegut noves maneres de mostrejar poblacions. Els enginyers de Google van executar la seva primera prova A/B l'any 2000 per determinar el nombre òptim de resultats que es mostrarien als resultats del motor de cerca. La primera prova no va tenir èxit a causa d'errors derivats de temps de càrrega lents. La recerca posterior sobre proves A/B va ser més avançada, però la base i els principis subjacents generalment segueixen sent els mateixos, i el 2011, Google va executar més de 7.000 proves A/B diferents.
El 2012, un empleat de Microsoft que treballava al motor de cerca Bing va crear un experiment per provar diferents mètodes per mostrar titulars publicitaris. En poques hores, el format alternatiu va produir un augment dels ingressos del 12% sense cap impacte en les mètriques d'experiència d'usuari. Avui dia, les principals empreses de programari com ara Microsoft i Google realitzen cadascuna més de 10.000 proves A/B anualment.
Alguns han afirmat que les proves A/B són un canvi en la filosofia i l'estratègia empresarial en certs nínxols, tot i que l'enfocament és idèntic al disseny entre subjectes, que s'utilitza habitualment en diverses tradicions de recerca. Les proves A/B com a filosofia del desenvolupament web alineen el camp amb un moviment més ampli cap a la pràctica basada en l'evidència.
Moltes empreses ara utilitzen l'enfocament de "l'experiment dissenyat" per prendre decisions de màrqueting, amb l'expectativa que els resultats de mostres rellevants puguin millorar els resultats de conversió positius. És una pràctica cada cop més comuna a mesura que creixen les eines i l'experiència en aquest àmbit. Com a resultat, ara més equips de màrqueting utilitzen proves A/B per guiar les decisions, adaptant el rigor de la prova a les hipòtesis mesurades i mesurant l'impacte en resultats com ara conversions, ingressos i conversions posteriors.
Aplicacions

Xarxes socials
Les proves A/B han estat utilitzades per grans xarxes socials com LinkedIn, Facebook i Instagram per entendre la participació i la satisfacció dels usuaris amb les funcions en línia, com ara una nova funció o producte. Les proves A/B també s'han utilitzat per dur a terme experiments complexos sobre temes com ara els efectes de xarxa quan els usuaris estan fora de línia, com els serveis en línia afecten les accions dels usuaris i com els usuaris s'influeixen entre ells.
Comerç electrònic
En un lloc web de comerç electrònic, l'embut de compra sol ser un candidat útil per a les proves A/B, ja que fins i tot disminucions marginals en les taxes d'abandonament poden representar un augment significatiu en les vendes. De vegades es poden veure millores significatives provant elements com ara text, dissenys, imatges i colors. En aquestes proves, els usuaris només veuen una de les dues versions, ja que l'objectiu és descobrir quina de les dues versions és preferible.
Preus del producte
Les proves A/B es poden utilitzar per determinar el preu adequat per a un producte, que és un dels reptes més difícils als quals s'enfronta quan es llança un nou producte o servei. Les proves A/B (especialment vàlides per a béns digitals) són un mecanisme eficaç per identificar el punt de preu que maximitza els ingressos totals.
Proves A/B polítiques
Les proves A/B també han estat utilitzades per campanyes polítiques. El 2007, la campanya presidencial de Barack Obama va utilitzar proves A/B per aconseguir atracció en línia i entendre què volien veure els votants d'Obama. Per exemple, l'equip d'Obama va provar quatre botons diferents al seu lloc web que feien que els usuaris es registressin per rebre butlletins informatius. A més, l'equip va utilitzar sis imatges d'acompanyament diferents per atraure els usuaris.
Enrutament HTTP i proves de funcions d'API
Les proves A/B s'utilitzen habitualment quan es desplega una versió més nova d'una API. Per a proves d'experiència d'usuari en temps real, es configura un proxy invers HTTP de capa 7 de manera que el n % del trànsit HTTP es dirigeix a la versió més recent de la instància del backend, mentre que el 100-n % restant del trànsit HTTP arriba a la versió més antiga (estable) del servei d'aplicació HTTP del backend. Això normalment s'aconsegueix per limitar l'exposició dels clients a una instància de backend més nova de manera que, si hi ha un error amb la versió més recent, només un n % del total d'agents d'usuari o clients es veuen afectats, mentre que altres es dirigeixen a un backend estable, que és un mecanisme de control d'entrada comú.
