A/B-Tests richtig durchführen und auswerten

Ein A/B-Test ist schnell aufgesetzt, aber ebenso schnell falsch ausgewertet - von Zielmetrik und Stichprobengröße über Testlaufzeit bis zur korrekten Interpretation des Ergebnisses, durchgerechnet an einem durchgehenden Beispiel.

Ein A/B-Test lässt sich mit den meisten gängigen Tools in wenigen Minuten einrichten - genau das macht ihn tückisch. Die technische Einrichtung ist der leichte Teil; die Fehler, die zu falschen Schlüssen führen, passieren fast immer bei der Planung der Stichprobengröße und bei der Auswertung, nicht beim Aufsetzen des Tests selbst. Dieser Leitfaden zeigt, wie sich Zielmetrik, Stichprobengröße und Laufzeit vorab festlegen und Ergebnisse auswerten lassen, ohne sich von zufälligen Zwischenständen täuschen zu lassen - durchgerechnet an einem einzigen, durchgehenden Beispiel.

1. Was ein A/B-Test eigentlich testet

Ein A/B-Test prüft, ob eine konkrete Veränderung (Variante B) gegenüber dem bestehenden Zustand (Variante A, die Kontrollgruppe) zu einem messbar besseren Ergebnis bei einer vorab festgelegten Zielmetrik führt. Entscheidend ist “vorab festgelegt” - wird die Zielmetrik erst nach Testende aus mehreren möglichen Kennzahlen ausgewählt, steigt die Wahrscheinlichkeit erheblich, zufällig irgendeine Metrik zu finden, die zufällig besser aussieht.

Durchgehendes Beispiel: Ein Onlineshop testet eine verkürzte Checkout-Strecke (nur noch zwei statt vier Schritte) gegen die bestehende Version. Die aktuelle Checkout-Conversion-Rate liegt bei 3,8 %.

2. Primäre Metrik und Guardrail-Metriken festlegen

Die Zielmetrik - die primäre Metrik, an der der Test letztlich beurteilt wird - sollte so nah wie möglich am eigentlichen Geschäftsziel liegen. Ein höherer Klickanteil auf einen Button ist eine schwächere Zielmetrik als die tatsächliche Conversion Rate am Ende des Funnels - eine Änderung kann mehr Klicks, aber weniger tatsächliche Abschlüsse erzeugen, wenn sie etwa falsche Erwartungen weckt.

Daneben lohnt sich die Festlegung von Guardrail-Metriken: Kennzahlen, die sich durch die Änderung nicht spürbar verschlechtern dürfen, auch wenn sie nicht das eigentliche Testziel sind. Ein verkürzter Checkout könnte zwar die Abschlussrate steigern, gleichzeitig aber die Retourenquote oder den durchschnittlichen Bestellwert verschlechtern - ohne Guardrail-Metriken bliebe das im Testergebnis unsichtbar.

Beispiel: Primäre Metrik ist die abgeschlossene Bestellung. Guardrail-Metriken sind Retourenquote und durchschnittlicher Bestellwert - beide dürfen sich durch den verkürzten Checkout nicht relevant verschlechtern.

3. Relativer vs. absoluter Uplift

Ein häufiges Missverständnis entsteht schon bei der Frage, wie groß eine Verbesserung eigentlich ist. Steigt eine Conversion Rate von 4 % auf 5 %, lässt sich das auf zwei Arten ausdrücken: als absoluter Uplift von 1 Prozentpunkt, oder als relativer Uplift von 25 % (die Verbesserung gegenüber dem ursprünglichen Wert von 4 %). Beide Angaben sind korrekt, meinen aber Unterschiedliches - und werden in der Praxis häufig verwechselt oder ohne Klarstellung nebeneinander verwendet. Für die Planung eines Tests (siehe Stichprobengröße unten) wird meist mit dem relativen Uplift gearbeitet, für die geschäftliche Einordnung des Ergebnisses ist der absolute Uplift oft die aussagekräftigere Größe.

4. Stichprobengröße vorab festlegen

Vor Teststart sollte feststehen, wie viele Besucher oder Conversions mindestens benötigt werden, um einen erwarteten Effekt überhaupt zuverlässig messen zu können. Vier Größen bestimmen diese Stichprobengröße:

  • die aktuelle Baseline-Rate (im Beispiel: 3,8 %)
  • der kleinste Effekt, der praktisch noch relevant wäre (Minimum Detectable Effect, MDE) - je kleiner der Effekt, den man noch zuverlässig erkennen will, desto größer die benötigte Stichprobe
  • das gewählte Signifikanzniveau (siehe Abschnitt 5)
  • die gewählte statistische Power (siehe Abschnitt 5)

Beispiel: Baseline 3,8 %, gewünschte Mindestwirkung MDE +8 % relativ (also ein Anstieg auf rund 4,10 %), Signifikanzniveau 5 %, Power 80 %. Mit einer gängigen Formel für den Vergleich zweier Anteilswerte ergibt sich daraus eine benötigte Stichprobengröße von grob 64.000 Besuchern je Variante - insgesamt rund 130.000 Besucher für den gesamten Test. Konkrete Rechner oder Tools können je nach verwendeter Formel und Rundung leicht abweichende Werte liefern, die Größenordnung bleibt aber vergleichbar. Diese Zahl macht zugleich sichtbar, warum kleine Effekte auf Seiten mit wenig Traffic in angemessener Zeit oft schlicht nicht zuverlässig nachweisbar sind (siehe Abschnitt 9).

Ohne diese Vorabplanung droht entweder ein zu früh beendeter Test mit unzuverlässigem Ergebnis oder ein unnötig lange laufender Test, der Ressourcen bindet, obwohl längst genug Daten vorlägen.

5. Statistische Signifikanz und Power verstehen

Statistische Signifikanz und Power beantworten zwei unterschiedliche Fragen und werden in der Praxis oft vermischt:

Signifikanz (Signifikanzniveau, meist mit dem griechischen Buchstaben Alpha bezeichnet) kontrolliert das Risiko falsch-positiver Ergebnisse. Ein Signifikanzniveau von 5 % bedeutet: Besteht in Wirklichkeit gar kein Unterschied zwischen den Varianten, akzeptiert man ein Risiko von höchstens 5 %, trotzdem ein mindestens so extremes Ergebnis wie das beobachtete zu erhalten. Das ist enger gefasst als die verbreitete, ungenaue Kurzformel “es besteht eine 95-%-Chance, dass B besser ist” - Signifikanz sagt etwas über die Wahrscheinlichkeit des beobachteten Ergebnisses unter der Annahme aus, dass kein Unterschied besteht, nicht direkt über die Wahrscheinlichkeit, dass B tatsächlich besser ist.

Power (statistische Trennschärfe, meist mit 1 minus Beta bezeichnet) kontrolliert das umgekehrte Risiko: die Wahrscheinlichkeit, einen tatsächlich vorhandenen Effekt der angenommenen Größe (die MDE aus Abschnitt 4) im Test überhaupt zu erkennen. Eine Power von 80 % - ein gängiger Standardwert - bedeutet, dass ein real vorhandener Effekt dieser Größe mit 80-prozentiger Wahrscheinlichkeit als signifikant erkannt wird, wenn genügend Daten vorliegen. Ohne ausreichende Power kann ein Test fälschlich zu dem Schluss kommen, es gebe keinen Effekt, obwohl tatsächlich einer besteht - schlicht weil die Stichprobe zu klein war, um ihn zuverlässig aufzudecken.

Wichtig in beiden Fällen: Signifikanz allein sagt nichts über die praktische Relevanz eines Effekts aus - ein winziger, aber statistisch signifikanter Unterschied kann geschäftlich irrelevant sein, wenn die Stichprobe entsprechend groß war.

6. Konfidenzintervalle statt reiner Ja/Nein-Signifikanz

Ein reines “signifikant oder nicht” verschenkt Information. Ein Konfidenzintervall gibt zusätzlich eine Bandbreite an, in der der tatsächliche Effekt mit einer festgelegten Wahrscheinlichkeit (meist 95 %) liegt.

Beispiel, fortgeführt: Nach Abschluss des Tests (siehe Abschnitt 10) zeigt sich ein absoluter Uplift von rund 0,35 Prozentpunkten, mit einem 95-%-Konfidenzintervall von ungefähr +0,14 bis +0,57 Prozentpunkten. Das Intervall liegt vollständig über null - der Effekt ist also nicht nur signifikant, sondern die Bandbreite gibt auch eine Vorstellung davon, wie groß er realistisch mindestens und höchstens ausfallen dürfte. Ein Ergebnis, dessen Konfidenzintervall knapp über null beginnt, verdient andere geschäftliche Konsequenzen als eines, dessen Intervall deutlich im positiven Bereich liegt, selbst wenn beide formal “signifikant” sind.

7. Testlaufzeit: vollständige Geschäftszyklen abwarten

Selbst wenn die berechnete Stichprobengröße rechnerisch schon nach wenigen Tagen erreicht ist, sollte ein Test in der Regel nicht sofort beendet werden. Nutzerverhalten unterliegt wiederkehrenden Schwankungen, die eine zu kurze Testlaufzeit verzerren können:

  • Werktage unterscheiden sich häufig deutlich von Wochenenden.
  • Laufende Kampagnen verändern die Zusammensetzung des Traffics im Zeitverlauf.
  • Wiederkehrende Besucher verhalten sich anders als Erstbesucher.
  • Zahltagsnahe oder monatszyklische Muster können bei manchen Zielgruppen eine Rolle spielen.

Als grobe Faustregel gilt deshalb, einen Test über mindestens einen, oft zwei vollständige Wochenzyklen laufen zu lassen, statt ihn zu beenden, sobald die reine Stichprobengröße rechnerisch erreicht ist - unabhängig davon, wie schnell diese Zahl erreicht wurde.

8. Randomisierung und Sample Ratio Mismatch

Die statistische Auswertung ist nur so belastbar wie die Zuteilung der Nutzer zu den Varianten selbst. Grundvoraussetzungen dafür:

  • Jeder Nutzer wird zufällig einer Variante zugeteilt und bleibt für die Dauer seiner Nutzung konsequent in dieser Variante (kein Wechsel zwischen Varianten innerhalb derselben Sitzung).
  • Größere, gleichzeitig laufende Änderungen an derselben Seite sollten vermieden werden, da sie das Ergebnis des Tests verfälschen können.

Ein nützliches Warnsignal dafür, dass mit der Zuteilung etwas nicht stimmt, ist ein Sample Ratio Mismatch (SRM): Ist ein Test als 50/50-Split angelegt, das tatsächliche Verhältnis bei ausreichend großer Stichprobe aber deutlich verschoben (etwa 57/43), deutet das auf ein technisches Problem hin - etwa fehlerhaftes Tracking, ungleiche Ladezeiten der Varianten oder eine fehlerhafte Zuteilungslogik - und nicht auf einen echten Effekt der getesteten Änderung. Ein Testergebnis bei vorliegendem SRM sollte grundsätzlich nicht inhaltlich interpretiert werden, bevor die Ursache der Verzerrung geklärt ist.

9. Der häufigste Fehler: Peeking und vorzeitiger Abbruch

Der in der Praxis häufigste Fehler ist das wiederholte Zwischenprüfen eines laufenden Tests mit der Absicht, ihn bei einem vielversprechenden Zwischenstand sofort zu beenden (Peeking). Je öfter ein Test vor Erreichen der geplanten Stichprobengröße zwischenausgewertet und bei einem günstigen Ergebnis abgebrochen wird, desto höher die Wahrscheinlichkeit, einen zufälligen Ausschlag fälschlich als echten Effekt zu werten. Das eigentliche Problem ist dabei nicht das bloße Betrachten von Zwischenständen, sondern das wiederholte Treffen einer Stopp-Entscheidung anhand klassischer, für eine einmalige Auswertung konzipierter Signifikanztests. Eigene sequenzielle Testverfahren, die für fortlaufende Zwischenauswertungen ausgelegt sind, können damit kontrollierter umgehen - werden solche Verfahren nicht eingesetzt, bleibt die zuverlässigste Gegenmaßnahme, die vorab berechnete Stichprobengröße bzw. Testlaufzeit konsequent einzuhalten, statt bei jedem Blick auf ein Dashboard neu zu entscheiden.

10. Zeitabhängige Effekte

Eine neue Variante kann kurzfristig aus mehreren Gründen anders abschneiden, als es ihre tatsächliche, dauerhafte Wirkung wäre:

  • Neuheitseffekt: Eine Änderung wirkt zunächst allein deshalb positiv, weil sie neu und ungewohnt ist - der Effekt klingt häufig nach einiger Zeit ab.
  • Lern- und Gewöhnungseffekte: Umgekehrt kann eine sinnvolle, aber ungewohnte Änderung zunächst schlechter abschneiden, weil Nutzer sich erst daran gewöhnen müssen.
  • Wechselnde Trafficzusammensetzung: Wochentags- und Wochenendtraffic, aktive Kampagnen oder saisonale Effekte verändern, wer überhaupt getestet wird.

Wer einen Test zu früh beendet, riskiert, einen dieser vorübergehenden Effekte fälschlich als dauerhafte Verbesserung (oder Verschlechterung) zu interpretieren - ein weiterer Grund, weshalb die in Abschnitt 7 beschriebene, ausreichend lange Testlaufzeit über bloße Stichprobengröße hinaus relevant ist.

11. Was A/B-Tests nicht können

Bei zu geringem Traffic - etwa auf kleinen Websites mit wenigen hundert Besuchern täglich - dauert es unter Umständen Wochen oder Monate, bis ausreichend Daten für eine belastbare Aussage vorliegen, wie das Beispiel in Abschnitt 4 mit rund 130.000 benötigten Besuchern zeigt. In solchen Fällen liefert ein A/B-Test entweder keine verwertbare Aussage in angemessener Zeit oder verlangt, sich auf deutlich größere, offensichtlichere Effekte zu beschränken, statt kleine Optimierungen zu testen.

12. Das Beispiel im Zusammenhang

Die einzelnen Bausteine ergeben zusammen folgenden Ablauf:

  • Ausgangslage: Checkout-Conversion-Rate 3,8 %. Hypothese: Ein verkürzter, zweistufiger Checkout erhöht den Anteil abgeschlossener Bestellungen.
  • Primäre Metrik: abgeschlossene Bestellung. Guardrail-Metriken: Retourenquote, durchschnittlicher Bestellwert.
  • MDE: +8 % relativ (Zielwert rund 4,10 %). Signifikanzniveau: 5 %. Power: 80 %.
  • Benötigte Stichprobe: rund 64.000 Besucher je Variante, insgesamt rund 130.000.
  • Laufzeit: zwei vollständige Wochenzyklen, um Wochentags- und Kampagneneffekte auszugleichen - unabhängig davon, wann die Stichprobengröße rechnerisch erreicht wäre.
  • Ergebnis nach Testende: Kontrollgruppe 3,80 %, Testvariante rund 4,15 % - ein absoluter Uplift von etwa 0,35 Prozentpunkten (rund 9 % relativ), mit einem 95-%-Konfidenzintervall von ungefähr +0,14 bis +0,57 Prozentpunkten. Der Unterschied ist statistisch signifikant und das Konfidenzintervall liegt vollständig über null.
  • Guardrail-Check: Retourenquote und durchschnittlicher Bestellwert blieben im Rahmen der üblichen Schwankung unverändert.
  • Schluss: Die Änderung wird übernommen.

Wäre derselbe Test bereits nach drei Tagen mit einem vielversprechenden Zwischenstand beendet worden (Peeking, siehe Abschnitt 9), läge zu diesem Zeitpunkt erst ein Bruchteil der benötigten Stichprobe vor - ein zu diesem Zeitpunkt beobachteter Vorsprung der Testvariante wäre statistisch nicht belastbar und könnte ebenso gut auf Zufall oder einen kurzfristigen Neuheitseffekt zurückgehen.

13. Häufige Fehler im Überblick

  • Zielmetrik erst nach Testende aus mehreren Kandidaten auswählen, statt sie vorab festzulegen.
  • Keine Guardrail-Metriken definieren und dadurch eine Verschlechterung an anderer Stelle übersehen.
  • Relativen und absoluten Uplift ohne Klarstellung vermischen.
  • Stichprobengröße nicht vorab berechnen und Tests nach Bauchgefühl statt nach Datenlage beenden.
  • Test vorzeitig beenden, sobald ein Zwischenstand günstig aussieht (Peeking).
  • Einen Test trotz erreichter Stichprobengröße vor Ablauf eines vollständigen Geschäftszyklus beenden.
  • Ein Sample Ratio Mismatch übersehen und ein verzerrtes Ergebnis inhaltlich interpretieren.
  • Kurzfristige, zeitabhängige Effekte mit dauerhaften Verbesserungen verwechseln.
  • Tests auf zu wenig Traffic laufen lassen und trotzdem als aussagekräftig behandeln.

A/B-Test-Checkliste vor dem Start

  1. Ist die primäre Metrik vorab klar definiert? → Erst festlegen, dann testen - nie umgekehrt.
  2. Sind Guardrail-Metriken festgelegt? → Mindestens die naheliegendsten Nebenwirkungen der Änderung vorab benennen.
  3. Ist die benötigte Stichprobengröße auf Basis von Baseline, MDE, Signifikanzniveau und Power berechnet? → Test erst als abgeschlossen betrachten, wenn sie erreicht ist.
  4. Ist eine Mindestlaufzeit über mindestens einen vollständigen Wochenzyklus eingeplant? → Unabhängig davon, wie schnell die Stichprobengröße erreicht wird.
  5. Ist die Randomisierung geprüft (kein Sample Ratio Mismatch)? → Vor der inhaltlichen Auswertung kontrollieren, nicht erst danach.
  6. Reicht der aktuelle Traffic für eine Aussage in angemessener Zeit? → Bei zu wenig Traffic eher größere, eindeutigere Veränderungen statt feinteiliger Optimierungen testen.
  7. Wurde der Test vorzeitig wegen eines guten Zwischenstands beendet? → Ergebnis mit Vorsicht behandeln, im Zweifel erneut mit korrekter Laufzeit testen.
  8. Wurde der beobachtete Effekt kurz nach Testbeginn gemessen? → Neuheits- oder Gewöhnungseffekt als mögliche Erklärung einkalkulieren, bevor das Ergebnis als dauerhaft gilt.

Weiterführend