Wie lange muss ein A/B-Test laufen?

4 Min. Lesezeit

Kurz gesagt

So lange, dass er die kleinste Änderung finden kann, die Sie wissen wollen, in ganzen Wochen und vor dem Start festgelegt. Bei 1.000 Personen pro Woche und 4 % Ausgangsrate findet ein Test in 2 Wochen etwa +70 %, in 4 Wochen etwa +48 % und in 8 Wochen etwa +33 %.

Legen Sie die Dauer eines A/B-Tests vor dem Start fest, in ganzen Wochen, nach der kleinsten Änderung, die Sie finden wollen. Lesen Sie das Ergebnis dann einmal, am Ende. Die Dauer ergibt sich aus zwei Zahlen, die Sie heute schon kennen: wie viele Personen pro Woche in den Test kommen und wie oft sie das Ziel derzeit erreichen.

Warum nicht stoppen, sobald B vorne liegt?

Weil frühe Unterschiede meist Zufall sind. Mit einigen hundert Personen je Variante kann eine Gruppe tagelang deutlich vorne liegen und dann zurückfallen. Ein Test mit 95 % Sicherheit erklärt in etwa 5 von 100 Tests ohne echten Unterschied einen falschen Gewinner, aber nur, wenn Sie einmal hinsehen. Wer täglich prüft und beim ersten Treffer stoppt, gibt dem Zufall mit jedem Blick eine neue Chance, und der Anteil falscher Gewinner steigt um ein Mehrfaches.

Zuschauen ist erlaubt. Schief geht es erst, wenn Sie vor dem geplanten Ende entscheiden. Deshalb steht die Dauer vorher fest.

Wovon hängt die nötige Dauer ab?

Von zwei Zahlen: wie viele Personen teilnehmen und wie hoch die Ausgangsrate ist, also der Anteil, der das Ziel heute erreicht. Zusammen bestimmen sie die kleinste Änderung, die ein Test finden kann. Mehr Personen finden kleinere Änderungen, eine höhere Ausgangsrate ebenso. Ein Test mit 4.000 Personen, 2.000 je Variante:

Ausgangsrate B muss erreichen Kleinste auffindbare Änderung
1 % 2,1 % +107 %
4 % 5,9 % +48 %
10 % 12,8 % +28 %
20 % 23,7 % +18 %

Ein Kaufziel mit 1 % braucht eine Verdopplung, bevor ein Test dieser Größe sie sieht. Eine Aktion, die mehr Menschen ausführen, etwa das Hinzufügen zum Warenkorb oder der Start des Checkouts, zeigt mit denselben Personen eine viel kleinere Änderung.

Wie berechnet sich die kleinste messbare Änderung?

Mit der Arkussinus-Methode, einem zweiseitigen Test mit 95 % Sicherheit und 80 % Teststärke. Nehmen Sie die heutige Rate p und die Personen je Variante n, also die Hälfte aller Personen im Test. Die Rate, die B erreichen muss, ist

p₂ = sin²(arcsin √p + 1,4 · √(2 / n))

und die kleinste relative Änderung ist p₂ / p − 1. Die 1,4 ist die Hälfte von 1,96 + 0,84, den Werten für 95 % zweiseitig und 80 % Teststärke. In Excel mit deutscher Oberfläche, mit der Ausgangsrate als Dezimalzahl (0,04) in B1 und den Personen je Variante in B2:

=SIN(ARCSIN(WURZEL(B1))+1,4*WURZEL(2/B2))^2/B1-1

80 % Teststärke heißt: Eine echte Änderung genau dieser Größe findet der Test in etwa 8 von 10 Fällen. Kleinere echte Änderungen können auch auftauchen, nur unzuverlässiger. Und ein Test ohne Befund beweist nicht, dass sich nichts geändert hat.

Wie lange bei 1.000 Personen pro Woche und 4 % Ausgangsrate?

Angenommen, pro Woche kommen 1.000 neue Personen in den Test, und 4 % von ihnen kaufen heute. Jede Woche bringt 500 Personen je Variante:

Dauer Personen im Test je Variante B muss erreichen Kleinste Änderung
2 Wochen 2.000 1.000 6,8 % +70 %
4 Wochen 4.000 2.000 5,9 % +48 %
8 Wochen 8.000 4.000 5,3 % +33 %

Viermal so viele Personen finden eine etwa halb so große Änderung. Kleiner wird es teuer: +10 %, also von 4 % auf 4,4 %, braucht rund 79.000 Personen, bei diesem Traffic anderthalb Jahre. Im Free-Tarif, der höchstens 3 Wochen erlaubt, findet derselbe Shop etwa +56 %.

Testen Sie bei diesem Traffic also Änderungen, von denen Sie mindestens ein Drittel mehr erwarten, etwa einen kürzeren Checkout, eine neue Produktseite oder ein klareres Lieferversprechen. Kleine Retuschen lohnen sich erst mit mehr Besuchern. Der kostenlose A/B-Test-Rechner rechnet dasselbe für Ihre Ausgangsrate und Ihre Personen pro Woche.

Warum ganze Wochen?

Weil Wochentage verschieden sind. Manche stöbern am Sonntagabend und kaufen am Montag, Besuche aus Büros fehlen am Wochenende, und der Zahltag verschiebt das Monatsende. Ein Test, der an einem Donnerstag endet, gewichtet manche Tage stärker als andere; ganze Wochen gewichten alle gleich.

Planen Sie außerdem Zeit für das Ziel ein. Wer am letzten Tag in den Test kommt, braucht Zeit zum Kaufen. Ein Zeitfenster nach den geplanten Wochen lässt diesen Personen Zeit, bevor der Test bewertet wird. Wenn Ihre Käufer Tage brauchen, wählen Sie das Fenster passend: Im Beispiel-Shop vergingen im Median 10 Tage vom ersten Besuch bis zum Kauf.

Wie plant und bewertet MIRA FIVE einen Test?

Unter Experimente wählen Sie das Ziel oder die Aktion, die den Test entscheidet, eine Dauer von 2, 3, 4, 6 oder 8 Wochen und ein Zeitfenster von 1, 7, 14 oder 30 Tagen. Der Planer zeigt die kleinste Änderung, die diese Dauer finden kann, hochgerechnet aus den Personen der letzten 28 Tage, damit wiederkehrende Personen einmal zählen. Im Browser zählen nur Personen mit Einwilligung. Solange der Status „Zählung läuft“ lautet, gibt es kein Ergebnis; es fällt einmal, zum geplanten Ende plus Zeitfenster, als zweiseitiger Test mit 95 %, dessen 95-%-Bereich übereinstimmen muss, und mit mindestens 100 Personen je Variante. Es lautet „Variante B gewinnt“, schlechter, „Kein großer Unterschied“ (wenn der 90-%-Bereich innerhalb von ±10 % bleibt) oder „Kein klares Ergebnis“. Im Free-Tarif läuft ein Test höchstens 3 Wochen, Dauer plus Zeitfenster innerhalb von 28 Tagen. Im Beispiel-Shop lief ein Test am Checkout-Button 4 Wochen plus 7 Tage: Mit dem Original erreichten 49 von 1.204 Personen „Bestellung bezahlt“ (4,1 %), mit Variante B 71 von 1.188 (6,0 %), und das Ergebnis lautet „Variante B gewinnt“. Mehr unter Experimente.

Fragen und Antworten

Darf ich einen Test früher beenden, wenn B klar vorne liegt?
Besser nicht. Frühe Vorsprünge sind oft Zufall, und wer beim ersten schönen Tag stoppt, macht Zufall zum Gewinner. Lesen Sie das Ergebnis einmal, zum geplanten Ende; MIRA FIVE urteilt nicht, solange gezählt wird.
Was tun bei wenig Traffic?
Testen Sie größere Änderungen, laufen Sie länger oder entscheiden Sie über eine Aktion, die mehr Menschen ausführen, etwa den Start des Checkouts. Eine höhere Ausgangsrate findet mit denselben Personen kleinere Änderungen.
Warum in ganzen Wochen testen?
Weil Menschen montags anders einkaufen als sonntags. Ganze Wochen geben jedem Wochentag dasselbe Gewicht, und die Laufzeiten in MIRA FIVE, 2, 3, 4, 6 oder 8 Wochen, sind alle ganze Wochen.
Wie lange darf ein Test im Free-Tarif laufen?
Bis zu 3 Wochen, und Dauer plus Zeitfenster müssen in 28 Tage passen. Pro bietet jede Dauer bis 8 Wochen; Experimente sind in jedem Tarif enthalten.

Weiterlesen

Kaufziel für Bestellungen und Tarife einrichten

Conversion-Tracking mit Zielen: So richten Sie in MIRA FIVE ein Kaufziel ein, lesen Umsatz je Währung und sehen die Zeit vom ersten Besuch bis zum Kauf.

Alle Ratgeber

Sehen Sie, welcher Kanal Käufer bringt

Kostenlos bis 25.000 Events im Monat. Ohne Kreditkarte.