Lead-Deduplizierung
Lead-Deduplizierung ist der Prozess, doppelte Datensätze, die dieselbe Person oder Firma darstellen, zu erkennen und zu einem einzigen Datensatz zusammenzuführen. So bleibt die Datenbank korrekt.
Das Wichtigste in Kürze
- Matching findet Kandidatenpaare; Survivorship-Regeln entscheiden, welche Feldwerte überleben.
- Jeder zusätzliche Eingang vervielfacht Dubletten, sofern beim Absenden nicht nachgeschlagen wird.
- Lockere Schwellen zerstören Daten unwiederbringlich, enge zerteilen die Historie eines Käufers.
- Sammelpostfächer und zentrale Rufnummern hebeln Matching aus, weil die Daten mehrdeutig sind.
- Zusammenführungen brauchen ein Protokoll, sonst ist der Vorgang nicht umkehrbar.
Im Detail
Deduplizierung läuft in zwei Stufen. Zuerst vergleicht eine Matching-Stufe Datensätze anhand von Schlüsseln, die eindeutig sein sollten: normalisierte E-Mail, Telefonnummer in kanonischem Format, Firmendomain sowie unscharfe Vergleiche von Name und Adresse für Beinahe-Treffer. Paare oberhalb einer Konfidenzschwelle werden markiert. Danach entscheidet eine Survivorship-Stufe Feld für Feld über den zusammengeführten Datensatz: früheste Quelle behalten, aktuellste Position, höchster Score, vereinigte Aktivitätshistorie.
Die Zahl der Dubletten steigt mit der Zahl der Eingänge: mehrere Formulare, importierte Listen, Event-Scans, Chat-Erfassung und Integrationen, die eigenständig Datensätze anlegen. Sie steigt auch, wenn ein Formular nur die E-Mail abfragt, weil später kein zweites Merkmal zum Abgleich existiert. Der zentrale Trade-off liegt zwischen falschen Zusammenführungen und übersehenen Dubletten: Eine lockere Schwelle vernichtet unwiederbringlich Daten, eine zu enge lässt Fragmente stehen und zwei Mitarbeitende dieselbe Person anrufen.
Die meisten Teams betreiben Prävention und Bereinigung gemeinsam. Prävention heißt: beim Absenden nachschlagen, sodass ein bestehender Kontakt aktualisiert statt neu angelegt wird, plus Normalisierung von Schreibweise und Telefonformat direkt am Eingang. Die Bereinigung läuft geplant gegen den Bestand. Quiz-Funnel bringen einen Sonderfall: Dieselbe Person wiederholt eine Scorecard oft Wochen später. Richtig ist ein Lead mit Score-Historie, bei dem das neueste Ergebnis aktiv bleibt und frühere Antworten sichtbar bleiben.
Deduplizierung löst keine Fälle, in denen die Daten zwei Personen tatsächlich nicht unterscheiden. Sammelpostfächer wie info@ und zentrale Rufnummern erzeugen Datensätze, die identisch aussehen und es nicht sind. Sie entscheidet auch keine Geschäftsfragen: ob zwei Tochtergesellschaften ein Account sind oder ob jemand nach Arbeitgeberwechsel seine Historie behält, sind Richtlinienentscheidungen. Und jede Zusammenführung ist destruktiv; ohne Protokoll und Rückgängig-Pfad geht irgendwann etwas Wichtiges verloren.
Beispiel aus der Praxis
So wird es gemessen
Die Leitzahl ist die Dublettenquote: eindeutige Personen geteilt durch Gesamtdatensätze oder deren Kehrwert. Verfolgen Sie sie nach Quelle, denn meist verursacht eine einzelne Integration den Großteil. Daneben gehört die Fehlerquote der Prüfliste beobachtet, also der Anteil vorgeschlagener Zusammenführungen, den ein Mensch ablehnt. Eine steigende Ablehnungsquote zeigt, dass die Matching-Schwelle für die aktuellen Daten zu locker geworden ist.
Operative Effekte überzeugen leichter als Datenqualität. Zählen Sie vom Vertrieb gemeldete Doppelansprachen, Kontakte, die dieselbe Kampagne zweimal erhalten, und die Differenz zwischen gemeldetem Leadvolumen und eindeutigen Personen. Diese letzte Lücke korrigiert die Kosten pro Lead. Bewegt sich nach einer Bereinigung keine dieser Zahlen, waren die zusammengeführten Dubletten nicht die problematischen.
Häufige Fehler
Der teuerste Fehler ist automatisches Zusammenführen bei einer ungetesteten Konfidenzschwelle. Lassen Sie die Regel zuerst im Nur-Bericht-Modus laufen, prüfen Sie eine Stichprobe der Paare und zählen Sie die Fehltreffer. Wie viele unabhängige Personen sich ein Support-Postfach oder eine Zentrale teilen, überrascht die meisten Teams. Führen Sie nur exakte Schlüsseltreffer automatisch zusammen und leiten Sie unscharfe Treffer in eine Prüfliste.
Der zweite Fehler ist wiederholtes Bereinigen, ohne die Quelle der Dubletten zu schließen. Ein monatlicher Merge-Job, der die erzeugenden Formulare nie anfasst, ist Dauerarbeit ohne Ende. Reparieren Sie zuerst den Eingang: E-Mail und Telefon beim Absenden normalisieren, vor dem Anlegen bestehende Kontakte suchen und Importe stoppen, die diese Regeln umgehen. Die Bereinigung schrumpft dann auf einen überschaubaren Rückstand.
Häufig gestellte Fragen
Welche Felder eignen sich am besten zum Abgleich?
Die E-Mail ist der stärkste Einzelschlüssel, gefolgt von Telefon und Firmendomain, wobei normalisierte Namen für unscharfes Matching dienen. Die Kombination mehrerer Schlüssel reduziert sowohl Fehlzusammenführungen als auch übersehene Duplikate.
Was ist Survivorship bei der Deduplizierung?
Survivorship ist das Regelwerk, das festlegt, welche Feldwerte beim Zusammenführen gewinnen, etwa der neueste Quiz-Score oder die früheste Quelle. Klare Survivorship-Regeln verhindern, dass gute Daten beim Merge überschrieben werden.
Warum ist Deduplizierung für die Abrechnung wichtig?
Viele Tarife zählen eindeutige Leads gegen ein Monatslimit, daher können Duplikate die Nutzung aufblähen und die Kosten pro Lead verzerren. Deduplizierung stellt sicher, dass jede reale Person nur einmal gezählt wird.
Welches Feld sollte der primäre Abgleichsschlüssel sein?
Meist die normalisierte E-Mail, weil sie nahezu personeneindeutig ist und in fast jedem Formular erfasst wird. Normalisieren Sie zuerst: Kleinschreibung, Leerzeichen entfernen und ausdrücklich entscheiden, ob Plus-Adressierung entfernt wird. Telefon eignet sich als Zweitschlüssel, sobald das Format kanonisch ist. Die Firmendomain trifft Accounts statt Personen und sollte Kontakte nie allein zusammenführen.
Was sind Survivorship-Regeln?
Sie entscheiden, welcher Wert gewinnt, wenn zwei Datensätze in einem Feld abweichen. Üblich sind: aktuellster Wert für Position und Score, frühester für Quelle und Anlagedatum, gefüllt vor leer bei dünn besetzten Feldern und Vereinigung bei Listen wie Tags und Aktivitäten. Halten Sie sie je Feld schriftlich fest, denn eine spontan gewählte Regel wird selten nochmals geprüft.
Wie geht man mit doppelten Quiz-Teilnahmen um?
Einen Lead behalten und die Teilnahmen als Historie speichern. Eine Wiederholung ist ein echtes Interesse-Signal, deshalb verliert Überschreiben Information darüber, wie sich die Lage verändert hat. Machen Sie das jüngste Ergebnis zum aktiven Score für das Routing und legen Sie frühere als Ereignisse ab. Jede Teilnahme als neuen Lead zu zählen bläht das Volumen auf und verzerrt die Kosten pro Lead.
Sollten Dubletten zusammengeführt oder gelöscht werden?
Zusammengeführt, wobei der unterlegene Datensatz möglichst archiviert erhalten bleibt. Löschen entfernt Aktivitätshistorie und die daran hängende Einwilligung, was rechtlich wie kommerziell relevant sein kann. Ein archiviertes Original ermöglicht zudem das Rückgängigmachen, wenn sich eine Regel als falsch erweist, was häufiger vorkommt, als die meisten Teams erwarten.
Wie wirken sich Dubletten auf das Lead-Scoring aus?
Sie zerteilen die Belege. Die Hälfte der Seitenaufrufe liegt auf dem einen, die Hälfte auf dem anderen Datensatz, sodass keiner die Schwelle überschreitet und ein qualifizierter Käufer zweimal lauwarm wirkt. Zusammenführen hebt Scores daher meist an. Rechnen Sie Scores nach einer großen Bereinigung neu, weil zusammengeführte Datensätze eine kombinierte Historie tragen.
Wie oft sollte dedupliziert werden?
Laufend am Eingang und zusätzlich als Batch im Takt des Zulaufs: wöchentlich bei volumenstarkem Inbound, monatlich bei langsameren Pipelines. Führen Sie sie immer vor großen Importen und vor jedem Kampagnenversand aus, denn dort richten Dubletten sichtbaren Schaden an. Eine spontane Bereinigung kurz vor dem Board-Report ist der am wenigsten nützliche Zeitpunkt.