Alle Guides
AI im B2B-Vertrieb 10 Min. Lesezeit

Welches LLM eignet sich für automatisierte Firmenrecherche? Unser Benchmark mit 18 Modellen

Wir haben 18 Sprachmodelle auf 100 anonymisierten Recherche-Fällen verglichen: Antwortqualität, Kosten pro 1.000 Firmen, Modellzeit und gültiges JSON. Plus zwei Lehren: Bekannte Firmen messen Gedächtnis, und das Harness entscheidet mit.

LC
Gründer, CegTec · 9. Oktober 2026

Welches LLM eignet sich für automatisierte Firmenrecherche?

Wir haben 18 Sprachmodelle auf denselben 100 anonymisierten Recherche-Fällen getestet. Sechs Modelle liegen in der Antwortqualität innerhalb des Messfehlers beieinander: claude-haiku-5.5, deepseek-v4.1-flash, gemini-3.5-flash-lite, gpt-6-luna, qwen3.5-flash und unsere Referenz gemini-3.1-flash-lite. Dort entscheiden Kosten, Laufzeit und die Frage, ob das Modell in unserem Agent sauber läuft. deepseek-v4.1-flash kostete bei gleicher Qualität gut ein Drittel der Referenz. Der Test hat uns aber auch gezeigt, dass ein Replay-Ergebnis nicht reicht: Im vollen Agent-Lauf lief ein Teil der Modelle gar nicht.

Die Messungen stammen von uns, aus der Entwicklung des Research Agent. Wir sind Anbieter eines Recherche-Produkts und haben ein Interesse an der Antwort. Deshalb steht unten die Methode, und deshalb steht dort auch, was wir nicht gemessen haben.

Ergebnis im Überblick

Replay auf 100 Fällen, sortiert nach Antwortqualität. Pro Fall laufen ein Seitenfilter (ist diese Seite relevant?) auf allen aufgezeichneten Seiten und ein Antwortschritt (Aufgabe plus Seiten in JSON nach Schema). Kosten sind der Listenpreis der Tokens, hochgerechnet auf 1.000 Fälle. Modellzeit ist die Summe der Modellaufrufe pro Fall, nicht die Zeit einer ganzen Recherche.

ModellAntwortqualität (1 bis 5)FaktentreueKosten pro 1.000 FälleModellzeit pro FallGültiges JSON (roh, von 100)
claude-haiku-5.54,004,710,61 $1,9 s98
deepseek-v4.1-flash3,994,550,29 $3,8 s100
gemini-3.5-flash-lite3,974,481,11 $2,0 s100
gpt-6-luna3,884,600,36 $4,1 s100
qwen3.5-flash3,864,120,21 $2,1 s100
gemini-3.1-flash-lite (Referenz)3,853,990,88 $2,4 s100
gpt-5-mini3,714,080,94 $5,0 s100
glm-5.3-flash3,704,310,37 $12,0 s98
qwen3.8-flash3,663,880,45 $4,0 s100
gemma-4-31b-it3,483,990,41 $16,8 s100
qwen3.6-35b-a3b3,392,870,35 $2,9 s92
qwen3.8-27b (Reasoning aus)3,293,760,49 $3,2 s100
nemotron-3.5-lightning3,102,140,19 $3,7 s100
gemma-4-26b-a4b-it3,083,630,22 $4,4 s98
qwen3.8-27b (Reasoning niedrig)3,073,682,26 $13,5 s100
gpt-5-nano3,063,240,20 $5,8 s100
deepseek-v3.22,882,790,81 $42,3 s98
mimo-v2.6-flash2,773,330,58 $3,3 s70
deepseek-v4-flash2,742,910,30 $8,9 s83

Stand: Läufe vom 7. Oktober 2026. Jedes Modell lief gegen einen festen Endpunkt, mit je eigener Einstellung für Reasoning und Ausgabeformat. Fehlgeschlagene Aufrufe zählen als ungültig. Qualitätsnote ist der Mittelwert aus Faktentreue, Vollständigkeit und Format.

So liest sich die Tabelle:

  • Die ersten sechs Zeilen sind nicht trennbar. Die Qualität pro Fall schwankt mit einer Standardabweichung von 0,75, der Mittelwert über 100 Fälle ist auf etwa ±0,15 genau. Gegenüber der Referenz lagen deepseek-v4.1-flash bei +0,14 und gemini-3.5-flash-lite bei +0,12, beide am Rand des Messfehlers.
  • Die Vollständigkeit ist bei allen niedrig, zwischen 1,9 und 2,6, weil der Replay nur die Seiten kennt, die schon aufgezeichnet waren. Die Unterschiede in der Gesamtnote kommen vor allem aus der Faktentreue.
  • Kosten streuen stärker als Qualität. Zwischen der Referenz (0,88 $) und deepseek-v4.1-flash (0,29 $) liegt ein Faktor von etwa drei bei gleicher Note. Reasoning verteuert: qwen3.8-27b kostete mit Reasoning auf niedrig das 4,6-Fache und wurde schlechter (3,07 statt 3,29).
  • Gültiges JSON ist nicht selbstverständlich. mimo-v2.6-flash lieferte nur in 70 von 100 Fällen gültiges JSON, deepseek-v4-flash in 83. Teils liefen Antworten in Schleifen bis zum Token-Limit.
  • Schema-treu heißt nicht brauchbar. gpt-5-nano war zu 100 % gültig, füllte Antworten aber mit Platzhaltern auf: 30 Einträge vom Typ “Not found”, im Schnitt 2,45 Leads pro Antwort gegenüber 1,33 bei der Referenz.

Der Test im vollen Agent-Lauf

Der Replay prüft nur den Antwortschritt. Deshalb sind drei ausgewählte Modelle zusätzlich durch den vollständigen Agent-Loop gelaufen: Suche, Seitenabruf, Seitenfilter, mehrere Schritte, Ausgabe nach Schema. Zehn Firmen, Standardtiefe, ohne Rückfall auf ein anderes Modell. Als brauchbar zählt ein Lauf, wenn der Agent selbst zu Ende kam, das JSON schema-gültig war und das gewählte Modell alle Aufrufe bedient hat. Die Qualität der Antworten haben wir in diesem Test nicht bewertet.

ModellBrauchbare LäufeSekunden pro Lauf (Median)Kosten pro Lauf (Mittel)Kosten gegenüber Referenz
gemini-3.1-flash-lite (Referenz)10 von 10690,0042 $1,00
deepseek-v4.1-flash10 von 10170,00095 $0,23
qwen3.5-flash, Standardeinstellung0 von 10900,0130 $5,1
qwen3.5-flash, Reasoning aus (nur Test)9 von 10150,0023 $1,2
gpt-6-luna, Standardeinstellung2 von 101220,0090 $3,6
gpt-6-luna, Reasoning aus (nur Test)5 von 10520,0057 $1,9

Die beiden qwen- und luna-Zeilen stammen aus einem früheren Lauf desselben Tages, mit einer Referenz auf den ersten fünf Firmen (Median 16 s, 0,0028 $ pro Lauf). Die Referenz war im späteren Lauf langsamer und machte mehr Suchen, 4,8 statt 2,6 pro Lauf. Gegen den früheren Lauf liegt deepseek-v4.1-flash bei 0,31 der Kosten. Das passt zu den rund 33 % aus dem Replay.

Im Replay lagen qwen3.5-flash und gpt-6-luna auf Augenhöhe mit der Referenz. Im Agent-Lauf liefen sie in der Standardeinstellung kaum durch.

Was wir daraus gelernt haben

Das Harness entscheidet mit, nicht nur das Modell

Unser Agent arbeitet in Schritten: Gedanke, Aktion, Beobachtung, pro Antwort genau ein Schritt. Modelle, die mehrere Schritte in eine Antwort schreiben, werden abgelehnt, und die Suchen laufen dann nie. Das betraf qwen3.5-flash und gpt-6-luna im Agent-Lauf. Es betraf auch deepseek-v4.1-flash, vor allem beim Aufbau von Firmenlisten: 2 von 3 Listen kamen zustande, mit 172 bis 602 Sekunden pro Liste und 24 abgelehnten Schritten. Die Zeilen, die dabei herauskamen, waren echte, passende Firmen. Das Problem sitzt im Format, nicht im Wissen oder Urteil des Modells.

Am 9. Oktober 2026 lieferte ein DeepSeek-Lauf in der Live-App nach etwa fünf Sekunden “Not found”. Das war derselbe Mechanismus, kein Qualitätsurteil über das Modell. Dasselbe Modell war im Replay eines der besten. Wer ein Modell nur über den Antwortschritt bewertet, übersieht, ob es im eigenen Agent überhaupt zum Antworten kommt. Wir passen das Harness an und messen danach mit denselben Listen und Firmen erneut.

Bekannte Firmen messen Gedächtnis, nicht Recherche

Unsere Live-Tests liefen auf öffentlich bekannten Firmen. Über sie wissen viele Modelle auch ohne Suche etwas. Beim Test mit qwen3.5-flash und abgeschaltetem Reasoning machten 4 der 9 brauchbaren Läufe keinen einzigen Tool-Aufruf: Das Modell antwortete aus dem Gedächtnis. Solche Läufe zählen im Test als brauchbar und sagen wenig über die Recherche bei einem unbekannten Mittelständler, wo es nichts aus dem Training abzurufen gibt. Für einen belastbaren Live-Test brauchen wir Firmen, über die ein Modell nichts wissen kann.

Eval und Produktion messen unterschiedliche Dinge

Im Juli hatten wir zwei Läufe im vollen Agent-Loop, jeweils 12 Aufgaben mit Live-Suche und schneller Recherchetiefe. Alle getesteten Modelle liefen zu 100 % zuverlässig und schema-treu. Die Qualität lag im Juli bei 3,44 bis 3,56 (erster Lauf) und 2,94 bis 3,61 (zweiter Lauf). Gleiche Modelle, zwei Läufe, verschiedene Werte: gemini-3.1-flash-lite kostete 0,00244 $ pro Lauf im ersten und 0,00292 $ im zweiten, gpt-5-nano 0,00061 $ und 0,00094 $.

Juli 2026, Agent-Loop, 12 AufgabenQualität (Judge)Kosten pro Lauf
gemini-3.1-flash-lite, Lauf 1 / Lauf 23,47 / 3,470,00244 $ / 0,00292 $
gpt-5-nano, Lauf 1 / Lauf 23,56 / 3,580,00061 $ / 0,00094 $
deepseek-v3.2, Lauf 13,500,00056 $
deepseek-v4-flash, Lauf 13,440,00179 $
gpt-5-mini, Lauf 13,560,00079 $
gemini-2.5-flash, Lauf 23,610,01030 $
gemini-2.5-flash-lite, Lauf 22,940,00294 $
gemini-3.5-flash, Lauf 23,420,03134 $

deepseek-v3.2 erreichte im Juli 3,50 im Agent-Lauf mit n=12 und im Oktober 2,88 im Replay mit n=100, mit 42 Sekunden Modellzeit pro Fall. Die Messungen sind nicht vergleichbar: andere Aufgaben, anderer Umfang, anderer Testaufbau. Genau das ist die Lehre. Ein einzelner Benchmark-Wert für ein Modell ist keine Eigenschaft des Modells, sondern eine Eigenschaft von Modell, Testset, Harness und Judge zusammen.

Im Juli kam dazu: gemini-2.5-flash-lite kostete so viel wie die Referenz bei messbar schlechterer Qualität (2,94 gegenüber 3,47). gemini-3.5-flash kostete das 10,7-Fache der Referenz ohne Qualitätsvorsprung (3,42).

Methode und Grenzen

  • Testset: die ersten 100 Fälle eines anonymisierten Testsets echter Recherche-Aufgaben, ohne Nennung einzelner Firmen. Im Juli waren es 12 Aufgaben im Agent-Loop.
  • Replay: pro Fall ein Seitenfilter auf allen aufgezeichneten Seiten und ein Antwortschritt nach Schema. Die Suche ist nicht Teil des Replays.
  • Judge: claude-haiku-4.5, kein Kandidat des Replays, bewertet Faktentreue, Vollständigkeit und Format gegen den Quelltext jeweils von 1 bis 5. Bei claude-haiku-5.5 haben wir mit einem Judge eines anderen Anbieters gegengeprüft (mistral-medium-3.1): 4,05 gegenüber 3,84 für die Referenz, im Haupt-Judge 4,00 gegenüber 3,85. Beide Judges sehen das Modell vor der Referenz.
  • Preise: Listenpreis pro Million Tokens (Eingabe / Ausgabe) auf dem jeweils verwendeten Endpunkt, Stand 7. Oktober 2026. Die abgerechneten Kosten lagen darauf, mit wenigen Ausnahmen: gpt-6-luna berechnet für Prompts ab 1.024 Token einen Eingabeaufschlag von 25 %, der Antwortschritt wurde mit dem 1,21-Fachen des Listenpreises abgerechnet.
  • Latenz: gemessen ist die Modellzeit pro Aufruf und pro Fall, nicht die Zeit einer Recherche von der Anfrage bis zur Antwort. Latenz Ende zu Ende: nicht gemessen.
  • Nicht gemessen: Kosten pro Firma im laufenden Produktivbetrieb, Qualität der Antworten im vollen Agent-Lauf, Recherche zu unbekannten Firmen im Live-Test.
  • Rauschen: Bei n=100 ist die Qualität auf etwa ±0,15 genau, bei n=12 deutlich weniger. Für Rangfolgen innerhalb von 0,15 Punkten ist der Test zu schwach.

Was Sie daraus mitnehmen können

  1. Die Modellwahl an Kosten und Zuverlässigkeit festmachen, die Qualität nur als Mindestschwelle prüfen. Bei uns sprach für den Wechsel auf ein günstigeres Modell nicht die Note, sondern ein ähnliches Qualitätsniveau bei einem Drittel der Kosten.
  2. Das Modell im eigenen Harness testen, nicht nur im Antwortschritt. Zählen Sie abgelehnte Schritte, Läufe ohne Tool-Aufruf und Läufe, die das Zeitlimit erreichen.
  3. Mit Firmen testen, die das Modell nicht kennt. Sonst messen Sie Gedächtnis.
  4. Rohes JSON zählen, nicht repariertes. Eine Reparaturstufe vor der Auswertung macht Ergebnisse sauberer, als es die Produktion ist.
  5. Zwei Läufe fahren. Derselbe Test brachte bei uns für dasselbe Modell unterschiedliche Kosten.

Selbst ausprobieren

Der Research Agent ist unser Produkt für Live-Recherche zu Firmen und Leads, per API oder MCP aus Claude, Cursor und anderen MCP-Clients. Konto und Zugang gibt es unter app.research-agent.net. Wer wissen will, welches Setup zum eigenen Recherchebedarf passt, bucht ein kostenloses Erstgespräch. Wir schauen auf den Use Case und sagen ehrlich, ob sich ein Wechsel rechnet.

Quellen

Alle Zahlen stammen aus eigenen Messungen des Research-Agent-Teams: Replay-Benchmark und Live-Agent-Check vom 7. bis 9. Oktober 2026 (18 Modelle, 100 Fälle, 10 Firmen im Agent-Lauf), Agent-Läufe vom 11. und 13. Juli 2026 (12 Aufgaben). Preise nach Listenpreisen, Stand 7. Oktober 2026. Modellnamen und Versionen sind die der jeweiligen Anbieter. Funktionsumfänge und Preise ändern sich schnell. Die Ergebnisse gelten für unseren Testaufbau und sind keine allgemeine Rangfolge der Modelle.

LLM BenchmarkFirmenrechercheResearch AgentKI-AgentenModellvergleich

Häufige Fragen

Welches LLM eignet sich am besten für automatisierte Firmenrecherche?

Auf unseren 100 anonymisierten Fällen lagen claude-haiku-5.5 (4,00), deepseek-v4.1-flash (3,99), gemini-3.5-flash-lite (3,97), gpt-6-luna (3,88), qwen3.5-flash (3,86) und unsere Referenz gemini-3.1-flash-lite (3,85) in der Antwortqualität eng beieinander. Der Messfehler des Mittelwerts liegt bei etwa ±0,15 auf der Skala 1 bis 5, ein Ranking innerhalb dieser Gruppe ist also nicht belastbar. Deutlicher trennen Kosten und Zuverlässigkeit: Bei ähnlicher Qualität kostete deepseek-v4.1-flash 0,29 $ pro 1.000 Fälle, die Referenz 0,88 $.

Wie viel kostet es, eine Firma mit einem LLM zu recherchieren?

In unserem Replay, der nur Seitenfilter und Antwortschritt misst, lagen die Modelle zwischen 0,19 $ (nemotron-3.5-lightning) und 2,26 $ (qwen3.8-27b mit Reasoning) pro 1.000 Fälle, die Referenz bei 0,88 $. Das ist nicht der Preis einer vollständigen Recherche mit Suche und mehreren Schritten. Im vollen Agent-Lauf mit zehn Firmen kostete die Referenz im Mittel 0,0042 $ pro Lauf, deepseek-v4.1-flash 0,00095 $. Kosten pro Firma im laufenden Produktivbetrieb haben wir nicht gemessen.

Warum reicht ein Eval nicht, um ein Modell für die Recherche zu wählen?

Weil ein Eval nur misst, was er misst. Unser Replay bekommt vorab aufgezeichnete Seiten und prüft den Antwortschritt. Im vollen Agent-Lauf kamen drei weitere Effekte dazu: Der Agent erwartet pro Antwort einen Schritt, manche Modelle schreiben mehrere, und die Suchen laufen dann nie. Qwen3.5-flash schaffte so 0 von 10 Läufen, mit abgeschaltetem Reasoning 9 von 10. Außerdem messen Tests mit sehr bekannten Firmen teils Gedächtnis statt Recherche. Ein Modell gehört deshalb im echten Harness mit unbekannten Firmen getestet.

Ist DeepSeek ein schlechtes Modell für Firmenrecherche?

Nein. deepseek-v4.1-flash war im Replay mit 3,99 eines der besten Modelle und mit 0,29 $ pro 1.000 Fälle eines der günstigsten. Als ein DeepSeek-Lauf in der Live-App am 9. Oktober 2026 nach etwa fünf Sekunden mit "Not found" endete, lag das an einem Formatproblem unseres Agent-Harness, nicht am Modell: DeepSeek schreibt mehrere Schritte in eine Antwort, der Agent verarbeitet pro Antwort nur einen. Frühere deepseek-Varianten schnitten im selben Replay deutlich schwächer ab, auch das steht in der Tabelle.

Wie belastbar sind die Zahlen?

Belastbar sind Kosten, Laufzeit und der Anteil gültiger JSON-Antworten, weil sie gezählt statt bewertet werden. Die Qualität stammt von einem LLM-Judge (claude-haiku-4.5) auf einer Skala von 1 bis 5 und ist verrauscht: Die Standardabweichung pro Fall liegt bei 0,75, der Mittelwert über 100 Fälle ist auf etwa ±0,15 genau. Der Judge ist selbst ein Modell, bei einem Kandidaten haben wir ihn mit einem zweiten Judge eines anderen Anbieters gegengeprüft. Latenz pro Firma Ende zu Ende und Qualität im vollen Agent-Lauf haben wir nicht gemessen.

Nächster Schritt

GTM Goat setzt genau das um, was Sie gerade gelesen haben.

Erstgespräch buchen 30 Minuten, danach 4 Wochen kostenlos
Lieber selbst starten? Preise und Free Trial →

Playbooks für B2B Outbound freischalten

Kostenlos. E-Mail eintragen → Passwort erhalten → Playbooks lesen.