Konverze

Proč vám A/B test lže: statistická významnost a velikost vzorku

Pět způsobů, jak A/B test ukáže vítěze, který neexistuje. Co znamená statistická významnost, kolik návštěv potřebujete — s kalkulačkou velikosti vzorku.

Kaentým growth buddyho · 6 min čtení

Varianta B po třech dnech vede o 30 %. Nástroj svítí zeleně, tým slaví, změna jde na web. Za dva měsíce je konverzní poměr tam, kde byl. Nikdo neví proč.

Důvod je prostý: ten rozdíl nikdy neexistoval. A/B test neměří pravdu, měří vzorek — a vzorek umí lhát několika spolehlivými způsoby. Tenhle článek je popisuje a ukazuje, jak se jim vyhnout.

Co statistická významnost doopravdy říká

Když hodíte mincí desetkrát, klidně padne sedmkrát panna. Mince kvůli tomu není cinknutá — malé vzorky prostě kolísají. S návštěvníky webu je to stejné: dvě naprosto identické stránky budou mít po pár dnech různý konverzní poměr čistě náhodou.

Statistická významnost odpovídá na jednu otázku: kdyby mezi variantami ve skutečnosti žádný rozdíl nebyl, jak často bychom naměřili takhle velkou mezeru jen náhodou? Obvyklá hranice 95 % znamená, že falešný poplach připouštíte zhruba v jednom případě z dvaceti.

Co významnost neříká:

  • že je varianta B lepší „s 95% jistotou”,
  • jak velký rozdíl doopravdy je,
  • že se rozdíl udrží i po nasazení.

A hlavně: platí jen tehdy, když test proběhl podle pravidel. Většina lží vzniká jejich porušením.

Pět způsobů, jak vám A/B test zalže

1. Díváte se průběžně a vypnete, když to vyjde

Nejčastější chyba. Rozdíl mezi variantami během testu kolísá — jednou vede A, jednou B. Pokud se díváte každý den a test ukončíte ve chvíli, kdy nástroj poprvé ukáže významnost, nevybíráte vítěze. Vybíráte okamžik, kdy náhoda zrovna vychýlila čísla správným směrem.

Dopad není kosmetický: při každodenní kontrole se podíl falešných vítězů z plánovaných 5 % může vyšplhat na desítky procent.

Oprava: velikost vzorku a délku běhu určete předem. Dívat se smíte, rozhodovat až na konci.

2. Vzorek je moc malý — a výhry proto vypadají obří

Test s malým vzorkem má dvě vlastnosti. Skutečné zlepšení většinou nezachytí. A když už něco „zachytí”, je to skoro vždy přestřelené — do významnosti se s malým vzorkem dostanou jen výsledky, které náhoda nafoukla. Proto tolik testů hlásí +40 % a po nasazení z toho zbude zlomek, nebo nic.

Oprava: spočítat si potřebný vzorek (kalkulačka je níž) a nedůvěřovat velkým výhrám z malých čísel.

3. Sledujete dvacet metrik a jedna vyjde

Při hranici 95 % vyjde náhodou „významně” jedna metrika z dvaceti. Pokud po testu procházíte konverze, prokliky, čas na stránce a scroll, každé zvlášť pro mobil, desktop, nové a vracející se návštěvníky, vítěze najdete vždycky. Nic to neznamená.

Oprava: jedna hlavní metrika určená před startem. Segmenty a vedlejší metriky berte jako zdroj dalších hypotéz, ne jako důkaz.

4. Test neběžel celé týdny

Lidé se v úterý dopoledne chovají jinak než v neděli večer. Test od středy do pondělí jednu část týdne převáží. Podobně zkreslují první dny: vracející se návštěvníci reagují na novinku jinak, než budou reagovat za měsíc.

Oprava: vždy celé týdny, ideálně aspoň dva. A počítat s tím, že část počátečního efektu je jen zvědavost.

5. Rozbité měření nebo nerovné rozdělení

Pokud má být provoz rozdělený půl na půl a jedna varianta má znatelně víc návštěvníků, něco je špatně — přesměrování, cache, blokovaný skript, boti. Stejně tak když se konverzní event v jedné variantě nespouští spolehlivě. Výsledek takového testu nejde opravit, jen zahodit.

Oprava: po prvním dni zkontrolovat poměr návštěvníků ve variantách a to, že se konverze zapisují v obou. Jak si ověřit měření kroků, ukazuje návod na analýzu funnelu v GA4.

Kolik návštěvníků potřebujete

Potřebný vzorek určují dvě čísla: současný konverzní poměr a nejmenší zlepšení, které chcete spolehlivě zachytit. Čím nižší konverzní poměr a čím menší hledaný rozdíl, tím víc lidí potřebujete.

Kalkulačka velikosti vzorku

návštěvníků na variantu
návštěvníků celkem (2 varianty)
týdnů běhu

Cílový konverzní poměr:

Oboustranný test, hladina významnosti 5 %, síla testu 80 %. Počítejte s celými týdny, ať test pokryje pracovní dny i víkendy.

Dva příklady, které stojí za zapamatování:

  • Konverzní poměr 2 %, hledané zlepšení o 20 % (na 2,4 %): zhruba 21 tisíc návštěvníků na variantu.
  • Stejný web, hledané zlepšení o 10 %: zhruba 81 tisíc na variantu. Poloviční efekt stojí přibližně čtyřnásobek vzorku.

Z toho plyne nepříjemná, ale užitečná věc: drobné úpravy — barva tlačítka, jedno slovo v nadpisu — přinášejí drobné rozdíly, a ty většina webů nemá šanci změřit.

Co dělat s malou návštěvností

Testujte větší změny. Nová struktura stránky, jiná nabídka, zkrácený formulář. Větší zásah může přinést větší rozdíl a ten se dá změřit i na menším vzorku.

Testujte tam, kde je provoz. Krok, kterým projde většina návštěvníků, nasbírá vzorek rychleji než poslední stránka košíku.

Nepřetahujte test přes osm týdnů. Za tu dobu se změní kampaně, sezóna i web sám. Test, který vychází na čtvrt roku, je signál k přenavržení.

Opřete se o kvalitativní data. Když pět lidí z pěti nenajde při uživatelském testování tlačítko pro odeslání, nepotřebujete na to A/B test. Zjevné bariéry se opravují, ne testují.

Přehled nástrojů a víc o testování s menším provozem je v článku A/B testování v roce 2026.

Kontrolní seznam před spuštěním

  1. Máme hypotézu ve tvaru „protože vidíme X, věříme, že změna Y zvedne Z”.
  2. Máme jednu hlavní metriku.
  3. Známe potřebný vzorek a z něj délku běhu v celých týdnech.
  4. Test vychází na nejvýš osm týdnů; jinak ho přenavrhneme.
  5. Po prvním dni zkontrolujeme rozdělení provozu a zápis konverzí v obou variantách.
  6. Rozhodneme až na konci — ať čísla v průběhu vypadají jakkoli.

Nic z toho není složité. Těžké je to dodržet pokaždé, zvlášť když varianta po třech dnech vede a všichni chtějí slavit. Proto tuhle disciplínu čím dál častěji drží software: AI CRO agent spočítá vzorek předem, test neukončí dřív a řekne vám i to, že se na vašem provozu daná změna změřit nedá.

Časté otázky

Co znamená statistická významnost u A/B testu?

Říká, jak nepravděpodobné by bylo naměřit takový rozdíl mezi variantami, kdyby ve skutečnosti žádný nebyl. Hranice 95 % znamená, že falešný poplach připouštíte zhruba v jednom případě z dvaceti. Neříká, jak velký rozdíl je, ani že je varianta lepší s 95% jistotou.

Kolik návštěvníků potřebuji na A/B test?

Záleží na současném konverzním poměru a na tom, jak malé zlepšení chcete zachytit. Při konverzním poměru 2 % a hledaném zlepšení o 20 % je to zhruba 21 tisíc návštěvníků na variantu. Poloviční zlepšení vyžaduje přibližně čtyřnásobný vzorek.

Jak dlouho má A/B test běžet?

Dokud nenasbírá předem spočítaný vzorek, a vždy celé týdny, aby pokryl pracovní dny i víkendy. Prakticky dva až osm týdnů. Test, který by měl běžet déle, je lepší přenavrhnout.

Co dělat, když mám na A/B testy málo návštěvnosti?

Testovat větší změny, které mohou přinést větší rozdíl, testovat kroky s vyšším provozem a u menších úprav se opřít o kvalitativní výzkum a opravu zjevných bariér místo testu, který nemá šanci nic prokázat.


Co si z toho vzít

A/B test nelže ze zlé vůle. Lže, když se ho zeptáte dřív, než má co říct, nebo když se ptáte dvacetkrát a vyberete si odpověď. Předem daný vzorek, jedna metrika, celé týdny a rozhodnutí až na konci — to stačí, aby čísla, podle kterých měníte web, něco znamenala.

Jestli chcete, aby tuhle disciplínu za vás držel někdo jiný, Kaen je AI agent pro optimalizaci konverzí: navrhne test i s potřebným vzorkem, změří ho a výsledek vyhlásí, až když je co vyhlásit. Bez vašeho schválení se nenasadí nic.

Mohlo by vás zajímat

Všechny články →