Pivix Logo
Zurück zum Glossar

Prädiktives Lead-Scoring

Prädiktives Lead-Scoring nutzt auf historischen Konversionsdaten trainiertes maschinelles Lernen, um die Kaufwahrscheinlichkeit jedes Leads zu schätzen, statt Punkteregeln von Hand zu setzen.

Das Wichtigste in Kürze

  • Trainingszeilen sind frühere Leads, Spalten sind Erfassungsmerkmale, Labels sind gewonnen oder verloren.
  • Feature-Leakage aus nachträglich gefüllten Feldern lässt ein nutzloses Modell hochpräzise wirken.
  • Der Schattenbetrieb vergleicht Modellrangfolge und Regeln, bevor das Routing davon abhängt.
  • Frühere Vertriebsgewohnheiten stecken in den Labels, sodass Vernachlässigung als Misserfolg gelernt wird.
  • Quizantworten sind strukturierte First-Party-Merkmale, die vor dem Training kaum Bereinigung brauchen.

Im Detail

Ein prädiktives Modell behandelt Scoring als überwachtes Lernproblem. Sie bauen eine Trainingstabelle, in der jede Zeile ein früherer Lead ist, die Spalten die zum Erfassungszeitpunkt bekannten Merkmale enthalten und das Label festhält, ob dieser Lead Kunde wurde. Ein Algorithmus, meist eine logistische Regression oder ein Gradient-Boosted-Tree, bestimmt die Gewichte, die beide Labels am besten trennen, und gibt für jeden neuen Lead eine Wahrscheinlichkeit zwischen null und eins aus. Diese Wahrscheinlichkeit ist der Score, nicht eine per Hand vergebene Punktsumme.

Die Güte steigt mit der Zahl der gelabelten Ergebnisse und ihrer Ausgewogenheit; ein Datensatz, in dem einer von fünfhundert Leads konvertiert, bietet wenig zu lernen. Feature-Leakage treibt die Güte falsch nach oben: Ein Feld, das erst nach Abschluss gefüllt wird, erzeugt ein Modell, das perfekt aussieht und nichts vorhersagt. Der Preis gegenüber regelbasiertem Scoring ist die Nachvollziehbarkeit. Ein Baum-Ensemble kann Leads besser sortieren als jede handgebaute Tabelle und trotzdem keinem Vertriebler sagen, warum.

Der Rollout beginnt üblicherweise im Schattenbetrieb: Das Modell bewertet eingehende Leads, während das Routing weiter den alten Regeln folgt, und beide Rangfolgen werden über einen vollen Sales-Zyklus verglichen, bevor jemand umschaltet. Das Nachtrainieren läuft nach Plan, monatlich oder quartalsweise, sobald neue Ergebnisse vorliegen. Quizantworten sind ungewöhnlich gute Merkmale, weil sie strukturiert, First-Party und für alle Teilnehmer identisch sind; ein Pivix-Ergebnis samt CRM-Ausgang braucht vor dem Training kaum Bereinigung.

Das Modell kann nur die Vergangenheit reproduzieren, samt ihrer Fehler. Wenn der Vertrieb Leads kleiner Firmen bisher ignoriert hat, wurden diese nie Kunden, also lernt das Modell, dass kleine Firmen nie konvertieren, und die Verzerrung erfüllt sich selbst. Plötzliche Marktverschiebungen, eine neue Produktlinie oder eine veränderte Positionierung entwerten die Trainingsdaten schneller, als der Trainingsplan es merkt. Und eine Wahrscheinlichkeit ist kein Plan: Bei 0,4 muss immer noch jemand entscheiden, was 0,4 wert ist.

Beispiel aus der Praxis

Ein SaaS-Unternehmen mit 40.000 historischen Leads exportiert seine Pivix-Quizantworten und CRM-Ergebnisse und trainiert ein Modell, das findet: Mid-Market-Leads mit "Team aus 11-50" plus "diese Quartal nötig" konvertieren dreimal so oft wie der Durchschnitt. Diese Antworten werden höher gewichtet und passende Leads direkt an erfahrene Vertriebler geleitet, was die Abschlussquote messbar erhöht.

So wird es gemessen

Entscheidend ist die Sortiergüte, nicht die reine Trefferquote. Sortieren Sie Leads nach vorhergesagter Wahrscheinlichkeit, teilen Sie sie in zehn gleich große Gruppen und vergleichen Sie die tatsächliche Konversionsrate der obersten mit der untersten. Ein brauchbares Modell zeigt ein steiles Gefälle über die Dezile. Trefferquote allein täuscht bei seltenen Konversionen, weil die Vorhersage "niemand konvertiert" meist schon stimmt.

Die zweite Lesart ist die Kalibrierung: Von den Leads um 0,3 sollten etwa drei von zehn tatsächlich konvertieren. Ein Modell, das gut sortiert, aber schlecht kalibriert ist, taugt zur Priorisierung, seine Zahlen aber nicht zur Prognose. Verfolgen Sie beides bei jedem Trainingslauf und beobachten Sie die Lücke zwischen Validierungs- und Live-Leistung als Frühwarnung, dass sich der Markt bewegt hat.

Häufige Fehler

Häufig wird auf jedem CRM-Feld trainiert, ohne zu fragen, wann es überhaupt gefüllt wird. Auftragswert, letzte Quelle und Account-Verantwortliche entstehen oft erst nach der Qualifizierung, wodurch das Modell die Antwort mitliest. Die Validierungswerte sehen glänzend aus, im Live-Betrieb bricht die Leistung ein. Bauen Sie die Merkmalsliste aus dem Wissensstand zum Erfassungszeitpunkt und streichen Sie alles, was ein Vertriebler später bearbeitet.

Der zweite Fehler ist, prädiktives Scoring einzukaufen, bevor es Ergebnisse zum Trainieren gibt. Ein junges Produkt mit zweihundert Leads und elf Kunden trägt kein Modell; der Anbieter baut trotzdem eines, und es sortiert nahezu zufällig. Arbeiten Sie mit expliziten Regeln, bis die Pipeline über mehrere Kohorten genug gewonnene und verlorene Fälle geliefert hat, und nutzen Sie diese Zeit, um Ergebnisse konsistent zu erfassen.

Häufig gestellte Fragen

Wie unterscheidet sich prädiktives von regelbasiertem Scoring?

Regelbasiertes Scoring beruht auf Punkten, die ein Mensch je Attribut setzt, während prädiktives Scoring Gewichte automatisch aus historischen Konversionsdaten lernt. Prädiktive Modelle passen sich an und erkennen übersehene Muster, brauchen aber viele saubere Daten.

Wie viele Daten braucht prädiktives Lead-Scoring?

Es gibt kein universelles Minimum, aber in der Regel sollten Tausende vergangener Leads mit bekanntem Ausgang und ein vernünftiges Verhältnis von Konversionen zu Nicht-Konversionen vorliegen. Bei dünnen oder verzerrten Daten ist ein transparentes regelbasiertes Modell meist sicherer.

Kann prädiktives Scoring verzerrt oder unfair sein?

Ja, denn ein Modell übernimmt die Verzerrungen seiner Trainingsdaten und kann sie verstärken. Prüfen Sie Merkmale auf Stellvertreter geschützter Attribute und überwachen Sie die Ergebnisse, damit bestimmte Segmente nicht systematisch falsch bewertet werden.

Wie viele Leads brauche ich, damit prädiktives Scoring funktioniert?

Zählen Sie konvertierte Leads, nicht Gesamt-Leads, denn das Signal steckt in den positiven Fällen. Einige hundert abgeschlossene Gewinne über mindestens ein Jahr an Kohorten sind eine praktikable Untergrenze für ein einfaches Modell; komplexere brauchen mehr. Ebenso wichtig ist, dass Verluste erfasst und nicht offen gelassen werden, weil ein nur auf Gewinnen trainiertes Modell nichts zum Vergleich hat.

Kann prädiktives Scoring erklären, warum ein Lead hoch bewertet wurde?

Teilweise. Lineare Modelle zeigen ihre Koeffizienten direkt, sodass sich die treibenden Merkmale auflisten lassen. Baum-Ensembles brauchen ein Attributionsverfahren, das den Beitrag jedes Merkmals für eine einzelne Vorhersage schätzt. In beiden Fällen erhalten Sie eine Liste beitragender Faktoren, keine kausale Erklärung. Geben Sie dem Vertrieb die drei stärksten als Kontext und kennzeichnen Sie sie als Korrelationen.

Wie oft muss ein prädiktives Modell nachtrainiert werden?

Koppeln Sie den Rhythmus an den Sales-Zyklus: nachtrainieren, sobald etwa ein Zyklus neuer Ergebnisse zusammengekommen ist, für die meisten B2B-Teams monatlich oder quartalsweise. Sofort nachtrainieren sollten Sie nach jeder Änderung, die verändert, wer kauft, etwa neue Preise oder ein neues Segment. Dazwischen beobachten Sie das Dezil-Gefälle; wird es flacher, ziehen Sie das Training vor.

Ist prädiktives Scoring besser als regelbasiertes?

Besser im Sortieren, schwächer im Erklären und ohne Historie unbrauchbar. Regeln sind richtig für neue Funnels, kleine Mengen und alles, was Aufsicht oder Vertrieb prüfen können muss. Prognosen lohnen bei hohem Volumen, wo Handjustierung nicht mitkommt und kleine Sortiergewinne sich summieren. Viele Teams betreiben beides: Regeln als Untergrenze, das Modell zur Reihung innerhalb einer Stufe.

Welche Merkmale gehören in ein prädiktives Lead-Scoring-Modell?

Alles, was bei der Erfassung verlässlich bekannt und über die Zeit stabil ist: Firmendaten, Traffic-Quelle, Gerät, Verweildauer, Formular- oder Quizantworten und Zählungen erfasster Aktionen vor dem Absenden. Freitext nur mit bewusster Aufbereitung, Felder, die der Vertrieb später ändert, gar nicht, geschützte Merkmale ebenfalls nicht. Eine kurze Liste sauberer Merkmale schlägt meist eine lange verrauschte.

Kann ein prädiktives Modell bestimmte Leads benachteiligen?

Ja, und die Ursache liegt meist im Label, nicht im Algorithmus. Wurde ein Segment kaum bearbeitet, konvertierte es kaum, also bewertet es das Modell niedrig und der Vertrieb bearbeitet es noch weniger. Prüfen Sie Konversionsraten je Segment vor und nach dem Rollout, geben Sie einen kleinen Zufallsanteil niedriger Scores zur menschlichen Sichtung frei und verwenden Sie keine geschützten Merkmale.

Verwandte Begriffe

Aus Glossar-Theorie werden qualifizierte Leads

Erstelle in Minuten einen Scorecard-Quiz-Funnel, der Leads qualifiziert und erfasst — ganz ohne Code.

Kostenlos starten
  • Keine Kreditkarte
  • Kostenloser Plan
  • In Minuten startklar