Pivix Logo
Zurück zum Glossar

Inkrementalitätstest (Incrementality Testing)

Incrementality Testing misst die zusätzlichen Conversions, die eine Marketingkampagne tatsächlich verursacht hat, über das hinaus, was auch ohne sie passiert wäre.

Das Wichtigste in Kürze

  • Lift ist die Differenz zwischen Treatment- und Holdout-Gruppe, nicht die gemeldete Conversion-Zahl.
  • Nur die Zufallszuteilung rechtfertigt die Kausalaussage; bequem gewählte Gruppen tun das nicht.
  • Die Holdout-Größe tauscht statistische Präzision gegen bewusst verzichteten Umsatz ein.
  • Ausgangsrate, Stichprobengröße und erwarteter Effekt bestimmen gemeinsam die nötige Laufzeit.
  • Ein Lift-Wert gilt nur für die getestete Zielgruppe, das Budget und den Zeitraum.

Im Detail

Ein Inkrementalitätstest teilt eine Grundgesamtheit zufällig in eine Treatment-Gruppe, die die Kampagne sehen kann, und eine Holdout-Gruppe, die sie nicht sieht, und vergleicht anschließend die Conversion-Raten beider Gruppen. Die Differenz ist der inkrementelle Lift; teilt man die inkrementellen Conversions durch die Conversions der Treatment-Gruppe, erhält man den Anteil der Ergebnisse, den die Kampagne tatsächlich verursacht hat. Erst die Zufallszuteilung macht den Vergleich gültig: Da die Zuordnung unabhängig von der Kaufabsicht erfolgt, tragen beide Gruppen dieselbe zugrunde liegende Nachfrage.

Wie viel Lift überhaupt nachweisbar ist, hängt von Stichprobengröße, Ausgangs-Conversion-Rate und der Größe des echten Effekts ab. Kleine Effekte auf seltene Conversions brauchen sehr große Gruppen oder sehr lange Laufzeiten, weshalb Teams den Lift oft an einem früheren, häufigeren Ereignis messen. Die Holdout-Größe ist der zentrale Zielkonflikt: Ein größerer Holdout verengt das Konfidenzintervall, verzichtet aber bewusst auf Umsatz. Geo-Splits kommen ganz ohne Nutzerkennungen aus, verlieren aber deutlich an Präzision, weil sich Regionen in Merkmalen unterscheiden, die eine Zufallszuteilung auf Personenebene ausgeglichen hätte.

Ein belastbarer Test beginnt mit einer schriftlichen Hypothese, einer vorab festgelegten Erfolgskennzahl und einer vor dem Start berechneten Laufzeit, die nicht nachträglich passend gewählt wird. Die Wahl der Zielkennzahl wiegt so schwer wie das Design. Klicks oder reine Formular-Einsendungen belohnen Kampagnen, die vorhandene Nachfrage abschöpfen; zählt man dagegen hoch bewertete Leads aus einer Qualifizierungs-Scorecard, misst man, ob die Kampagne passende Käufer gebracht hat. Dieselbe Teststruktur nacheinander je Kanal ergibt über mehrere Quartale eine vergleichbare Sammlung von Lift-Werten.

Ein Lift-Wert gilt für die getestete Zielgruppe, das getestete Budgetniveau und den getesteten Zeitraum und lässt sich nicht automatisch übertragen. Ein Kanal, der bei moderaten Ausgaben inkrementell ist, kann beim dreifachen Budget sättigen, sodass das Ergebnis eine unausgesprochene Obergrenze mitführt. Auch lange Entscheidungszyklen sind schwierig, weil der Holdout länger unterdrückt bleiben muss als ein typischer Abschluss dauert. Ebenso entziehen sich Markeneffekte der Messung, wenn sie erst nach dem Testzeitraum sichtbar werden. Kontamination über organische Suche, Empfehlungen oder einen geteilten Haushalt zerstört zusätzlich die Trennung, die das Design voraussetzt.

Beispiel aus der Praxis

Angenommen, ein Growth-Team vermutet, dass Branded Search organische Nachfrage für sich verbucht. Es führt einen Geo-Holdout-Test durch und pausiert diese Anzeigen in 20 % der Regionen; qualifizierte Pivix-Quiz-Abschlüsse dürften dort nur um 4 % sinken, was auf geringe Inkrementalität hindeuten würde. Es würde dieses Budget auf einen Prospecting-Kanal verlagern, der einen Lift von 28 % bei netto neuen hoch bewerteten Leads zeigen könnte.

So wird es gemessen

Die zentrale Kennzahl ist der inkrementelle Lift: Conversions der Treatment-Gruppe abzüglich der auf gleiche Gruppengröße hochgerechneten Conversions des Holdouts, ausgedrückt als Anteil an den Conversions der Treatment-Gruppe. Berichten Sie dazu immer das Konfidenzintervall, denn ein Lift von zwölf Prozent, dessen Intervall von minus fünf bis dreißig reicht, trägt keine Budgetentscheidung. Halten Sie außerdem fest, auf welches Ereignis sich der Lift bezieht, denn Lift auf Klicks und Lift auf qualifizierte Leads sind zwei verschiedene Aussagen.

Übersetzen Sie den Lift anschließend in Kosten. Teilen Sie die Kampagnenausgaben durch die inkrementellen Conversions, um die inkrementellen Akquisekosten zu erhalten, und stellen Sie diese dem gemischten Wert der Plattform gegenüber; die Lücke zeigt das Ausmaß der Überzurechnung. Bei Qualifizierungs-Funneln rechnen Sie dieselbe Formel nur mit hoch bewerteten Leads, denn zusätzliche unpassende Leads sind kein Geld wert.

Häufige Fehler

Viele Teams beenden den Test am ersten Tag, an dem die Treatment-Gruppe vorn liegt. Conversion-Zahlen schwanken anfangs stark, sodass ein früher Blick fast immer einen Unterschied zeigt, der sich noch nicht stabilisiert hat. Berechnen Sie die nötige Stichprobe vor dem Start aus Ausgangsrate und dem kleinsten Lift, der eine Entscheidung rechtfertigt, und lassen Sie den Test dann in Ruhe, bis diese Zahl erreicht ist.

Der zweite Klassiker ist ein undichter Holdout. Einen Kanal zu pausieren, während Retargeting, E-Mail und organische Suche dieselben Menschen weiter erreichen, misst kaum etwas, und der kleine gemessene Lift wird als Beweis gelesen, der Kanal sei wertlos. Listen Sie vor dem Start jeden Weg auf, über den die Holdout-Gruppe dennoch Kontakt haben kann, und unterdrücken oder dokumentieren Sie jeden einzelnen davon.

Häufig gestellte Fragen

Was ist eine Holdout-Gruppe?

Eine Holdout-Gruppe ist ein randomisierter Teil Ihrer Zielgruppe, der einer Kampagne bewusst nicht ausgesetzt wird und als Kontrolle dient. Der Vergleich der Ergebnisse zwischen der ausgesetzten Gruppe und dem Holdout zeigt den echten Lift der Kampagne.

Warum scheitern B2B-Inkrementalitätstests oft?

Lange Verkaufszyklen und geringe wöchentliche Conversion-Volumen erschweren das Erreichen statistischer Signifikanz, sodass unterdimensionierte Tests verrauschte, irreführende Ergebnisse liefern. Eine ausreichend lange Laufzeit und der Schutz der Kontrolle vor Kontamination sind für eine valide Aussage unerlässlich.

Wie groß sollte die Holdout-Gruppe sein?

Groß genug, dass der kleinste Lift, der eine Entscheidung rechtfertigt, statistisch nachweisbar wäre; das folgt aus Ihrer Ausgangs-Conversion-Rate und dem verfügbaren Traffic. Fünf bis zehn Prozent gelten bei reichweitenstarken Kampagnen als Faustregel, während volumenschwache B2B-Programme oft einen deutlich größeren Anteil oder eine längere Laufzeit brauchen, um dieselbe Sicherheit zu erreichen.

Worin unterscheiden sich Incrementality Testing und Attribution?

Attribution verteilt Zurechnung auf erfasste Touchpoints; Incrementality fragt, ob die Conversion ohne die Kampagne überhaupt stattgefunden hätte. Attribution kann abgeschöpfte nicht von geschaffener Nachfrage trennen, weil sie nur Menschen sieht, die konvertiert sind. Der Holdout liefert dagegen den Vergleichsfall, weshalb beide Methoden bei Brand Search regelmäßig zu gegensätzlichen Ergebnissen kommen.

Wie lange sollte ein Inkrementalitätstest laufen?

Lang genug für mindestens einen vollständigen Conversion-Zyklus plus die Zeit, die zum Erreichen der berechneten Stichprobe nötig ist. Schließen Leads typischerweise nach drei Wochen, schneidet ein zweiwöchiger Test noch laufende Conversions ab und unterschätzt den Lift. Legen Sie das Enddatum vor dem Start fest und verlängern Sie nicht nur deshalb, weil das Ergebnis unerwünscht ausfällt.

Was ist ein Geo-Holdout-Test?

Ein Design, das die Kampagne nicht einzelnen Nutzern, sondern zufällig ausgewählten Regionen vorenthält und die Ergebnisse beider Regionengruppen vergleicht. Es kommt ohne Nutzerkennungen aus und passt daher zu datenschutzbeschränkten Kanälen und Offline-Medien. Der Preis ist Präzision: Regionen unterscheiden sich in Saisonalität, Wettbewerb und Kundenmix, weshalb viele und sorgfältig gepaarte Regionen nötig sind.

Kann eine Kampagne negative Inkrementalität zeigen?

Ja, und das kommt häufiger vor als erwartet. Retargeting und Brand Search erreichen oft Menschen, die ohnehin konvertiert hätten, sodass bezahlte Ausgaben organische Conversions kannibalisieren und der gemessene Lift nahe null oder leicht darunter landet. Ein solches Ergebnis ist ein Grund, die Ausgaben für diese Platzierung zu senken, und kein Hinweis auf einen fehlerhaften Test.

Wie oft sollten Inkrementalitätstests wiederholt werden?

Immer dann, wenn sich eine wesentliche Größe ändert: Budgetniveau, Zielgruppendefinition, Kreativstrategie oder Saisonalität. Ein Lift-Wert altert, weil Sättigung und Wettbewerb sich verschieben; ein Ergebnis, das älter als ein paar Quartale ist, sollten Sie als Hypothese behandeln. Viele Teams testen rotierend einen Kanal pro Quartal, statt dauerhafte Holdouts zu betreiben.

Verwandte Begriffe

Aus Glossar-Theorie werden qualifizierte Leads

Erstelle in Minuten einen Scorecard-Quiz-Funnel, der Leads qualifiziert und erfasst — ganz ohne Code.

Kostenlos starten
  • Keine Kreditkarte
  • Kostenloser Plan
  • In Minuten startklar