Inkrementalität messen: der Test, der Deine Meta-Zahl korrigiert
Dein Werbekonto meldet 1.000 Käufe. Die Frage ist nicht, ob es 1.000 waren. Die Frage ist, wie viele davon ohne die Anzeige nicht stattgefunden hätten.
Eine Meta-Auswertung über 15 Advertiser fand, dass nur 34 Prozent der zugeschriebenen Conversions inkrementell waren. Auf 30.000 Euro Spend und 1.000 gemeldete Käufe angewandt: aus 30 Euro CPA wird ein echter CAC von 88 Euro. Gemessen wird das mit Conversion Lift, Geo-Holdout, Kampagnenpause oder MMM. Metas Untergrenze von 10.000 Personen im Holdout erkennt allerdings nur Effekte um 30 Prozent, nicht um 10.
Warum Attribution die Frage nicht beantwortet
Attribution verteilt Verdienst. Inkrementalität misst Wirkung. Das sind zwei verschiedene Fragen, und nur die zweite entscheidet über das Budget. Meta rechnet einen Kauf der Anzeige zu, wenn er nach einem Klick oder einer Ansicht stattfand. Ob er auch ohne die Anzeige stattgefunden hätte, steht in keinem Bericht.
Eine Meta-interne Auswertung über 15 Advertiser hat genau das geprüft: nur 34 Prozent der zugeschriebenen Conversions waren tatsächlich inkrementell. Der Rest wollte ohnehin kaufen. Das ist kein Vorwurf an die Plattform, sondern die logische Folge davon, wie Werbung an Menschen ausgeliefert wird, die schon Kaufabsicht zeigen.
Wenn Du Deine Zahlen bisher über die Kanalzahl steuerst, ist der Abgleich zwischen Meta, GA4 und Shopify der erste Schritt. Inkrementalität ist der zweite und der unbequemere.
Der Rechenweg, der die Entscheidung dreht
Eine Brand gibt 30.000 Euro im Monat auf Meta aus. Meta meldet 1.000 Käufe. Der gemeldete CPA liegt bei 30 Euro. Bei 85 Euro Warenkorb und 40 Prozent DB-Marge verdient jede Bestellung 34 Euro Deckungsbeitrag. Auf dem Papier bleiben also 4 Euro je Bestellung übrig: knapp, aber positiv.
1.000 gemeldete Käufe × 0,34 = 340 inkrementelle Käufe.
30.000 Euro geteilt durch 340 = 88 Euro echter CAC.
34 Euro Deckungsbeitrag minus 88 Euro CAC = minus 54 Euro je inkrementellem Neukunden.
Aus plus 4 wird minus 54. Ohne dass eine einzige Zahl im Werbekonto falsch war. Nur die Frage war falsch gestellt.
Der Faktor 0,34 ist dabei ein Branchenmittel und kein Naturgesetz. Er ist bei kalter Zielgruppenwerbung deutlich höher und bei Retargeting und Markensuche deutlich niedriger, weil dort fast jeder ohnehin gekauft hätte. Genau deshalb wird er gemessen und nicht geschätzt.
Die vier Testverfahren
| Verfahren | Wie | Mindestbedingung |
|---|---|---|
| Conversion Lift | Meta teilt die Zielgruppe zufällig, eine Gruppe sieht keine Anzeigen | 10.000 Personen im Holdout, 2 Wochen |
| Geo-Holdout | Regionen statt Personen als Test und Kontrolle | mind. 10 vergleichbare Regionen |
| Kampagnenpause | Kanal komplett aus, Gesamtumsatz beobachten | 2 bis 4 Wochen, stabile Saison |
| MMM-Kalibrierung | Modell über alle Kanäle, mit Testergebnissen geeicht | 24 Monate Historie |
Für die Auswertung von Geo-Experimenten brauchst Du kein Budget: Metas GeoLift und Googles CausalImpact sind beide frei verfügbar und rechnen den Effekt statistisch belastbar, statt zwei Balken zu vergleichen. Googles Meridian erfüllt dieselbe Rolle auf der Modellseite.
Die Stichprobenrechnung, die niemand macht
Metas Mindestangabe von 10.000 Personen im Holdout klingt nach einer Lösung. Sie ist eine Untergrenze und sagt nichts darüber, welche Effektgröße Du damit erkennen kannst. Das lässt sich ausrechnen. Bei einer Basiskonversion von 1,5 Prozent, 80 Prozent Teststärke und 5 Prozent Signifikanzniveau braucht ein Zwei-Gruppen-Vergleich je Gruppe:
| Gesuchter Lift | Konversion Testgruppe | Nötige Größe je Gruppe |
|---|---|---|
| 10 % | 1,65 % | ca. 108.000 |
| 20 % | 1,80 % | ca. 28.000 |
| 30 % | 1,95 % | ca. 13.000 |
Lies die Tabelle von unten nach oben. Mit 10.000 pro Gruppe erkennst Du einen Lift von 30 Prozent, mit etwas Glück. Einen Lift von 10 Prozent erkennst Du nicht, und das Ergebnis lautet dann "kein signifikanter Effekt", was viele als "der Kanal wirkt nicht" lesen. Das ist der häufigste Fehler in selbst gebauten Holdout-Tests: ein untermotorisierter Test, dessen Nullergebnis als Befund verkauft wird.
Die Konsequenz ist unbequem und einfach: Wenn Deine Reichweite für einen nutzerbasierten Test nicht reicht, teste geografisch oder pausiere ganz. Beides misst gröbere Effekte, aber es misst sie.
Der Testplan für ein Quartal
- Woche 1: Basislinie festhalten. Gesamtumsatz, Kassenbestellungen, Spend je Kanal, DB-Marge. Ohne saubere Basislinie ist jeder Test wertlos.
- Woche 2 bis 4: Ein Test, nicht drei. Beginne mit dem Kanal mit dem größten Budget und dem höchsten Verdacht, meist Retargeting oder Markensuche.
- Woche 5: Auswerten mit Konfidenzintervall, nicht mit Punktschätzung. Ein Lift von 18 Prozent mit einem Intervall von minus 4 bis plus 40 ist kein Ergebnis.
- Woche 6 bis 12: Faktor auf die Kanalzahl anwenden, Budget umschichten, nächsten Kanal testen. Nach vier Quartalen hast Du für jeden Kanal einen eigenen Faktor statt einer Branchenzahl.
Nur 52 Prozent der Marketer testen Inkrementalität überhaupt, weitere 36 Prozent planen es im kommenden Jahr. Das heißt: Wer jetzt anfängt, steuert gegen Zahlen, gegen die die Hälfte des Marktes noch nicht steuert.
Was das für Deine Steuerungsgröße bedeutet
Inkrementalität ersetzt die Kanalzahl nicht, sie korrigiert sie. Die Größe, gegen die Du am Monatsende steuerst, bleibt eine Zahl aus der Kasse: MER oder Deckungsbeitrag nach Marketing. Der Inkrementalitätsfaktor sagt Dir, wie Du das Budget innerhalb dieser Größe verteilst. Und der Break-even-ROAS sagt Dir, ab welchem Punkt sich ein Kanal überhaupt trägt, bevor Du ihn inkrementell prüfst.
Wenn Du diese Kette einmal sauber aufgebaut haben willst, ohne dass drei Dienstleister drei Zahlen liefern, steht im System, wie wir das zusammenhängen, und auf der Preisseite, was es kostet.
Häufige Fragen
Was ist Inkrementalität im Marketing?
Inkrementalität ist der Teil des Ergebnisses, der ohne die Werbung nicht entstanden wäre. Attribution verteilt dagegen nur Verdienst auf Kontaktpunkte. Eine Meta-interne Auswertung über 15 Advertiser hat gezeigt, dass nur 34 Prozent der zugeschriebenen Conversions tatsächlich inkrementell waren. Der Rest hätte auch ohne Anzeige gekauft.
Wie groß muss ein Holdout-Test sein?
Meta nennt 10.000 Personen im Holdout und mindestens zwei Wochen als Untergrenze für Signifikanz. Das erkennt aber nur grobe Effekte. Bei 1,5 Prozent Basiskonversion, 80 Prozent Teststärke und 5 Prozent Signifikanzniveau brauchst Du je Gruppe rund 13.000 Personen für einen Lift von 30 Prozent, rund 28.000 für 20 Prozent und rund 108.000 für 10 Prozent. Reicht die Reichweite nicht, teste geografisch oder pausiere den Kanal ganz.
Welche Werkzeuge brauche ich für einen Geo-Test?
Keine bezahlten. Metas GeoLift und Googles CausalImpact sind beide frei verfügbar und rechnen den Effekt eines Geo-Experiments statistisch aus, statt zwei Balken zu vergleichen. Auf der Modellseite erfüllt Googles Meridian dieselbe Rolle für Marketing-Mix-Modelle. Was Du brauchst, sind mindestens zehn vergleichbare Regionen und eine saubere Basislinie.
Was mache ich mit dem Inkrementalitätsfaktor?
Du wendest ihn auf die Kanalzahl an, um das Budget innerhalb Deiner Steuerungsgröße zu verteilen. Beispiel: 30.000 Euro Spend, 1.000 gemeldete Käufe, gemeldeter CPA 30 Euro. Bei einem Faktor von 0,34 sind es 340 inkrementelle Käufe und damit 88 Euro echter CAC. Bei 34 Euro Deckungsbeitrag je Bestellung ist der Kanal dann nicht knapp positiv, sondern 54 Euro je Neukunden im Minus.
Wir prüfen, welcher Kanal bei Dir wirklich trägt.
Wir sehen uns Deinen Shop an und schicken Dir innerhalb von 48 Stunden ein persönliches Video mit drei Hebeln. Danach entscheidest Du, ob SITE FX zu Dir passt.
Quellen & Datenbasis
Inkrementalitätslücke und Meta-Advertiser-Studie: alexneiman.com · Conversion Lift, Holdout-Größe und Laufzeit: withblip.com, triplewhale.com · Geo-Experimente, GeoLift, CausalImpact und Meridian: spaceads.agency, metricuno.com · Verbreitung von Inkrementalitätstests: adlibrary.com