Gratis-Guide:planbar neue Kunden gewinnen 2026 · 10 Seiten, kostenlosJetzt sichern
← zurück zum Glossar
Performance

Modell-Evaluierung

Das wiederholbare Prüfen von KI-Ausgaben gegen definierte Kriterien und echte Testfälle - vor dem Start und bei jeder Änderung, statt einmaligem Ausprobieren.

Was ist Modell-Evaluierung?

Eine Modell-Evaluierung besteht aus drei Teilen: einem Satz echter Testfälle, definierten Kriterien für eine gute Ausgabe und einer Messung, die sich wiederholen lässt. Der Unterschied zum verbreiteten "wir haben es ausprobiert und es sah gut aus" liegt in der Wiederholbarkeit: Dieselben Fälle, dieselben Kriterien, dokumentiertes Ergebnis - dadurch werden zwei Prompt-Versionen, zwei Modelle oder zwei Zeitpunkte vergleichbar. Das Testset entsteht aus echten Vorgängen, nicht aus ausgedachten Beispielen, denn die Sonderfälle, an denen Systeme scheitern, denkt sich niemand aus.

Gemessen wird, was für den Einsatz zählt: fachliche Korrektheit, die Rate an `Halluzinationen`, Treue zu Format und Tonalität, bei Agenten zusätzlich die Wahl der richtigen Werkzeuge. Die Methoden reichen von der menschlichen Stichprobe über automatische Prüfungen bis zum Einsatz eines zweiten Modells als Bewerter, das eigene blinde Flecken hat und selbst geprüft gehört. Zur Abgrenzung: Ein A/B-Test misst die Wirkung auf Nutzer im Live-Betrieb, die Modell-Evaluierung misst die Qualität der Ausgabe davor und währenddessen - das eine ersetzt das andere nicht.

Ihren eigentlichen Wert zeigt die Evaluierung nach dem Start. Modelle werden ausgetauscht, Prompts angepasst, Wissensquellen erweitert, und jede dieser Änderungen kann Qualität kosten, die vorher da war. Wer sein Testset bei jeder Änderung laufen lässt, tauscht bekannte Qualität nur bewusst gegen neue - wer es nicht tut, merkt Verschlechterungen erst an Beschwerden. Deshalb gehört das Testset zum Produkt: Es wächst mit jedem echten Fehlerfall und hat einen Besitzer, der es pflegt.

Warum ist Modell-Evaluierung wichtig?

McKinsey hat gemessen, wie selten diese Disziplin ist: Weniger als eines von fünf Unternehmen verfolgt klar definierte Kennzahlen für seine GenAI-Lösungen - und dasselbe KPI-Tracking gehört zu den stärksten Prädiktoren dafür, dass unterm Strich ein messbarer Gewinnbeitrag ankommt. Die Evaluierung ist damit nicht Bürokratie, sondern der Unterschied zwischen einem Werkzeug und einer Wette.

Modell-Evaluierung in der Praxis

  1. 01Angebots-Assistent: 50 echte Anfragen aus dem letzten Quartal bilden das Testset - jede Änderung am Prompt läuft erst dagegen, dann in den Betrieb.
  2. 02Support-Chat: Jede Woche bewertet eine Person 20 zufällige Gespräche nach drei Kriterien - korrekt, vollständig, im richtigen Ton - und die Kurve dieser Werte steht neben den Nutzungszahlen im Dashboard.
  3. 03Modellwechsel: Bevor das günstigere Modell übernimmt, laufen beide auf demselben Testset - entschieden wird am Ergebnis, nicht am Preisblatt.

Verwandte Begriffe

Dazu im Journal

Diese Themen sind dein Tagesgeschäft?

Wir bauen Marketing-Systeme entlang genau dieser Disziplinen - in Strategie, Umsetzung und Tech-Integration.

Dein Projekt als nächster Case.

Wir bauen Marketing nicht als Dienstleistung, sondern als System. Starten wir mit einem Gespräch.

30 min. · kostenlos · 24 h Antwort · ohne Agentur-Deck