Das Entscheidungs-Audit für KI-Schritte
Ein Arbeitsblatt für Ihren GTM-Stack: finden Sie die KI-Schritte, die nur Ja/Nein sagen, rechnen Sie ihre Kosten und legen Sie eine Konfidenz-Schwelle fest.
Wofür dieser Leitfaden gut ist
In fast jedem GTM-Stack beantwortet ein großes Sprachmodell Fragen, die nur ein Ja, ein Nein oder eine Kategorie brauchen. Passt die Firma zum ICP? Ist diese Antwort eine Abwesenheitsnotiz? Ist die Person Entscheider? Das Modell schreibt dafür keinen Text. Bezahlt wird es trotzdem wie ein Autor.
Dieser Leitfaden gibt Ihnen ein Audit, das in einem Nachmittag durchläuft: jeden KI-Schritt einordnen, die Kosten pro Million Entscheidungen ausrechnen, eine Schwelle festlegen, ab der ein Mensch übernimmt. Am Ende steht eine Liste, was umzieht, was bleibt und was eine Formel wird.
Die Ausgangslage, in vier Zahlen
Wir haben das im eigenen Workspace gemessen: 170 echte Entscheidungen aus 13 Tabellenspalten, jede mit rund 1.000 Token Eingabe. Dieselbe Eingabe, vier Modelle, gerechnet zu Listenpreisen:
| Modell | Kosten pro 1 Million Entscheidungen |
|---|---|
| Claude Sonnet | rund 2.300 $ |
| Claude Haiku | rund 1.150 $ |
| Gemini Flash | rund 380 $ |
| Jev (Typesafe), ein typisiertes Entscheidungsmodell | rund 41 $ |
Billig zählt nur, wenn es stimmt. Wo Jev und das gespeicherte Urteil auseinanderlagen, hat ein stärkeres Modell blind entschieden, wer der Regel der Spalte folgt. Jev lag in 126 von 129 geprüften Zeilen richtig. Bei einer Konfidenz ab 0,8, das waren 81 Prozent der Zeilen, in 104 von 104.
Das deckt sich mit der Forschung. Bucher und Martini zeigen, dass kleine, spezialisierte Modelle große Sprachmodelle bei Textklassifizierung weiterhin schlagen (arXiv 2406.08660). FrugalGPT von Chen, Zaharia und Zou erreicht mit einer Kaskade aus billigen und teuren Modellen die Leistung des besten Einzelmodells bei bis zu 98 Prozent weniger Kosten (arXiv 2305.05176).
Was sich nicht verschiebt
Bevor Sie rechnen: Der größte Kostenblock in den meisten KI-Stacks ist nicht die Entscheidung, sondern das Lesen. Ein Agent, der eine Website, einen Gesprächsverlauf und drei Datenquellen liest, zahlt für den Kontext. Bei uns sind das drei Viertel der Modellkosten, Tabellenspalten nur rund ein Achtel. Ein Entscheidungsmodell ersetzt die Wahl am Ende, nicht das Lesen davor.
Ehrlich gerechnet ist das Audit also kein Hebel für die halbe Rechnung. Es ist der billigste Hebel, den Sie haben, weil er nichts an der Qualität kostet.
Schritt 1: Jeden KI-Schritt einordnen
Schreiben Sie jede Stelle auf, an der ein Modell aufgerufen wird: Tabellenspalten, Workflow-Schritte, Agenten-Aufgaben. Dann eine Spalte pro Stelle, eine von vier Klassen:
- Entscheidet nur. Die Ausgabe ist ausschließlich Ja/Nein, eine Kategorie aus einer festen Liste oder eine benannte Stufe. Kandidat für den Umzug.
- Entscheidet und schreibt. Ein Urteil plus eine Begründung, ein Hook, eine Zusammenfassung. Nur der Entscheidungsteil kann umziehen, der Text bleibt beim Sprachmodell.
- Schreibt nur. Copy, Anrede, Antwortentwurf. Bleibt beim Sprachmodell.
- Rechnet eigentlich. Ein Feld, das andere Felder kombiniert („passt = alle vier Kriterien erfüllt”) oder einen Wert nur zurückliest. Das ist eine Formel, keine Frage. Kostet dann gar nichts.
Die vierte Klasse wird am häufigsten übersehen. In unserem eigenen Test lag ein zusammengesetztes Feld bei nur 48 Prozent Übereinstimmung, und zwar nicht wegen des Modells, sondern weil man eine UND-Verknüpfung ausrechnet und nicht erfragt.
Schritt 2: Die Kosten pro Million Entscheidungen ausrechnen
Die Formel reicht für eine Überschlagsrechnung:
Kosten pro Entscheidung = Eingabe-Token × Eingabepreis + Ausgabe-Token × Ausgabepreis
Kosten pro Million = Kosten pro Entscheidung × 1.000.000
Zwei Dinge dazu:
Messen Sie die Eingabe, statt sie zu schätzen. Die Eingabe ist der Prompt samt Regeln und Daten der Zeile, meist 500 bis 4.000 Token. Ein Entscheidungsmodell rechnet nach Eingabe ab. Wer mit 500 Token rechnet und 3.800 schickt, liegt um den Faktor sieben daneben.
Rechnen Sie Ihr Monatsvolumen hoch. Anzahl Entscheidungen pro Monat mal Kosten pro Entscheidung, einmal mit dem heutigen Modell, einmal mit dem Entscheidungsmodell. Die Differenz ist die Obergrenze der Ersparnis, nicht die Ersparnis.
Schritt 3: Eine Konfidenz-Schwelle festlegen
Ein Sprachmodell schreibt „nein” mit derselben Miene, ob es sicher war oder nicht. Ein Entscheidungsmodell gibt eine Konfidenz mit. Das ist der eigentliche Zugewinn, nicht der Preis.
Die Regel, die wir verwenden:
- Konfidenz ab 0,8: das Urteil gilt.
- Konfidenz unter 0,8: das Urteil ist als unsicher markiert und geht an einen Menschen oder an ein größeres Modell.
Das Prinzip heißt in der Forschung selektive Klassifizierung: Ein Klassifikator darf bei unsicheren Fällen abgeben und hält damit eine vorgegebene Fehlerquote ein (Geifman und El-Yaniv 2017, arXiv 1705.08500). Dass Modelle ihre eigene Treffsicherheit brauchbar einschätzen können, zeigen Kadavath und andere (arXiv 2207.05221). Und dass sich ein Teil der Anfragen gezielt an ein billiges Modell leiten lässt, ohne die Antwortqualität zu senken, belegt RouteLLM (arXiv 2406.18665).
Was die Weitergabe kostet, gehört in die Rechnung. Bei uns fielen 19 Prozent unter die Schwelle. Mit Sonnet als Rückfall kostet eine Million Entscheidungen dann rund 478 $ statt 2.300 $, mit Gemini Flash rund 113 $ statt 380 $.
Schritt 4: An einer Stichprobe vergleichen, bevor das Alte weicht
Stellen Sie keine Spalte um, ohne beide Seiten nebeneinander laufen zu lassen:
- 50 bis 100 Zeilen ziehen, geschichtet: gleich viele Ja- wie Nein-Urteile des heutigen Modells.
- Das Entscheidungsmodell auf dieselben Zeilen mit denselben Regeln und Daten.
- Übereinstimmung zählen. Unter 90 Prozent die Abweichungen von Hand lesen.
- Bei Abweichungen fragen: Wer folgt der Regel? In unserem Test war das bei 35 von 40 strittigen Zeilen das Entscheidungsmodell. Das gespeicherte Urteil ist ein Vergleichspunkt, nicht die Wahrheit.
Zwei Muster, die wir dabei gefunden haben:
- Standard-Ja-Fragen tragen schlecht. „Falsch nur bei klarer Neugründung” lieferte 26 Prozent. Fragen Sie positiv („ist es eine Neugründung?”) und drehen Sie das Ergebnis um.
- Abgeschnittene Regeln sehen aus wie ein schlechtes Modell. Wenn die Abweichungen alle in eine Richtung laufen, prüfen Sie zuerst, ob das Modell die ganze Regel bekommen hat.
Das Arbeitsblatt
Eine Zeile pro KI-Schritt. Eine Seite, kein Deck.
Schritt / Spalte: __________________________________________
Klasse: entscheidet nur / entscheidet + schreibt / schreibt nur / rechnet
Ausgabe: ja-nein / Kategorie (Liste: ______) / Stufe (______)
Eingabe-Token (gemessen): ______
Entscheidungen pro Monat: ______
Kosten heute pro Million: ______ $
Kosten Entscheidungsmodell/Mio.: ______ $
Obergrenze Ersparnis/Monat: ______ $
Konfidenz-Schwelle: 0,8 / andere: ______
Unter der Schwelle geht an: Mensch / Modell: ______
Stichprobe: ___ Zeilen, Übereinstimmung ___ %, Regel-Sieger: ______
Entscheidung: umziehen / nur Entscheidungsteil / bleibt / wird Formel
Zwei Regeln für das Blatt:
Eine leere Zeile bei den Token ist kein Schätzwert. Ohne gemessene Eingabe keine Kostenzahl.
„Umziehen” braucht eine Stichprobe. Ohne Vergleich ist es eine Vermutung mit Sparziel.
Vier Grundsätze, die bleiben
Schreiben kostet, entscheiden nicht. Zahlen Sie Autorenpreise nur für Text.
Die Konfidenz ist der Gewinn. Ein Urteil, das seine Unsicherheit meldet, lässt sich weitergeben. Eines, das es nicht tut, lässt sich nur hoffen.
Kombinierte Felder werden ausgerechnet. Eine UND-Verknüpfung ist keine Frage.
Das Lesen bleibt. Wer Agenten-Kosten senken will, muss den Kontext kürzen, nicht die Entscheidung verbilligen.
Die Kurzfassung
Jeden KI-Schritt einordnen, die Eingabe messen, die Kosten pro Million rechnen, ab 0,8 Konfidenz dem Entscheidungsmodell vertrauen und darunter weitergeben. Vorher an einer Stichprobe vergleichen.
Der Aufwand ist ein Nachmittag. Das Ergebnis ist eine Liste, auf der steht, wofür Sie heute Autorenpreise für ein Ja oder Nein zahlen.
Quellen
- Bucher, M. J. J., Martini, M. (2024): Fine-Tuned ‘Small’ LLMs (Still) Significantly Outperform Zero-Shot Generative AI Models in Text Classification. arXiv:2406.08660
- Chen, L., Zaharia, M., Zou, J. (2023): FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. arXiv:2305.05176
- Ong, I. et al. (2024): RouteLLM: Learning to Route LLMs with Preference Data. arXiv:2406.18665
- Geifman, Y., El-Yaniv, R. (2017): Selective Classification for Deep Neural Networks. arXiv:1705.08500
- Kadavath, S. et al. (2022): Language Models (Mostly) Know What They Know. arXiv:2207.05221
- Eigene Messung im CegTec-Workspace, September 2026: 170 Tabellen-Entscheidungen aus 13 Spalten, blinde Adjudikation von 129 Zeilen, Kosten zu Anbieter-Listenpreisen.
Nächster Schritt
GTM Goat setzt genau das um, was Sie gerade gelesen haben.