
Vier Größen, eine Entscheidung
Wie ihr Qualität, Latenz, Kosten und Sicherheit eines KI-Systems messt, und wer festlegt, was Vorrang hat
Ein Muster, das ich oft sehe: Der Pilot liefert gute Antworten, alle sind zufrieden, das System geht in den Betrieb. Nach vier Wochen kommt die erste Rechnung und ist doppelt so hoch wie geplant. Die Fachabteilung beschwert sich, dass sie auf jede Antwort ewig wartet. Und die Informationssicherheit fragt, warum Kundendaten an einen Dienst gehen, den sie nie gesehen hat. Die Qualität war die ganze Zeit gut. Gemessen hat man eben nur die.
Im Beitrag "Beeindruckend ist kein Abnahmekriterium" ging es darum, Qualität messbar zu machen. Hier geht es um die anderen drei Größen und um die Frage, die fast nie jemand stellt: Welche davon gewinnt, wenn sie sich widersprechen? Denn widersprechen werden sie sich. Am Ende steht eine Vorlage für eine Seite, mit der ihr das für euer System festlegen könnt.
Die vier Größen, messbar gemacht
Qualität. Die Grundlage ist das Golden Set: echte Fälle mit einem von Fachleuten geprüften Sollergebnis. Gemessen wird der Anteil richtig gelöster Fälle, über mehrere Durchläufe, weil Sprachmodelle nicht zuverlässig dieselbe Antwort liefern. Ein Punkt fehlt dabei oft. Nicht jeder Fehler wiegt gleich. Eine holprige Formulierung ist ärgerlich, eine falsche Frist in einer Kundenauskunft ist gefährlich. Ich teile Fehler deshalb in drei Klassen ein, harmlos, ärgerlich und gefährlich, und zähle die gefährlichen getrennt. Eine Richtig-Quote von 95 Prozent sagt wenig, wenn die fünf Prozent Fehler alle in der letzten Klasse liegen.
Latenz. Gemeint ist die Zeit, die ein Mensch auf eine brauchbare Antwort wartet. Dafür gibt es seit über dreißig Jahren eine gute Orientierung. Jakob Nielsen hat 1993 drei Grenzen beschrieben: Bis etwa eine Sekunde bleibt der Gedankenfluss erhalten, bis etwa zehn Sekunden die Aufmerksamkeit. Alles, was länger dauert, braucht laut Nielsen eine Fortschrittsanzeige und eine Möglichkeit abzubrechen, weil die Leute sich sonst anderem zuwenden.
Für KI-Systeme heißt das zweierlei. Messt nicht nur den Durchschnitt, sondern auch die langsamen Fälle, also etwa die Zeit, unter der 95 von 100 Antworten liegen. An den langsamen Fällen entscheidet sich, ob Leute das System weiter nutzen. Und messt zwei Zeitpunkte: wann die erste Reaktion sichtbar wird und wann das Ergebnis vollständig ist. Bei Fließtext hilft es, die Antwort Wort für Wort anzuzeigen. Wenn das Ergebnis aber ein ausgefülltes Formular ist, zählt nur der zweite Zeitpunkt.
Kosten. Der Preis pro Token ist die Zahl, die in jedem Angebot steht, und die am wenigsten aussagt. Die Zahl, die zählt, sind die Kosten pro erledigtem Vorgang. Dazu gehören die Modellkosten, die Infrastruktur und die Arbeitszeit für Nacharbeit, also für alle Fälle, in denen ein Mensch die Antwort korrigieren oder neu machen muss. Die Nacharbeit wird fast immer vergessen, und sie ist oft der größte Posten. Ein billiges Modell, dessen Antworten jede fünfte Minute Korrektur brauchen, kann am Ende teurer sein als ein teures, das fast immer passt.
Sicherheit. Die lässt sich nicht in eine einzige Zahl packen, aber messbar machen. Einen guten Rahmen dafür liefert die Liste der zehn wichtigsten Risiken für Anwendungen mit Sprachmodellen, die das Open Worldwide Application Security Project (OWASP) 2025 aktualisiert hat. Ganz oben steht Prompt Injection, also eingeschleuste Anweisungen in Texten, die das System verarbeitet. Dazu kommen unter anderem die Preisgabe sensibler Daten, zu weitreichende Befugnisse eines Systems und falsche Aussagen, die ungeprüft weiterverwendet werden. Daraus lassen sich drei Messgrößen ableiten: der Anteil abgewehrter Fälle in einem eigenen Testset mit Angriffs- und Grenzfällen, der Anteil der Vorgänge, bei denen ein Mensch zustimmt, bevor etwas nach außen geht, und eine aufgeschriebene Antwort auf die Frage, was im schlimmsten Fall passiert.
Übrigens führt die OWASP-Liste auch unbegrenzten Ressourcenverbrauch als Risiko. Wer keine Obergrenze für Anfragen und Kosten setzt, hat also nicht nur ein Budgetproblem, sondern auch ein Sicherheitsproblem. Die Größen hängen enger zusammen, als es aussieht.
Wo sie gegeneinander ziehen
Jede Stellschraube, die eine Größe verbessert, kostet meistens an einer anderen. Die Tabelle zeigt die üblichen Richtungen. Sie ist eine Faustregel, kein Gesetz, und eure Messung schlägt sie immer.

Die letzte Zeile zeigt den Tausch am deutlichsten: Ihr kauft Geld mit Zeit. Für einen Chat mit Kunden ist das keine Option. Für die nächtliche Einordnung von zehntausend Dokumenten ist es die naheliegendste Sparmaßnahme überhaupt.
Die Entscheidung: Eine Größe führt, drei bekommen Grenzen
Wenn alle vier gleich wichtig sind, ist in Wahrheit keine wichtig, weil jede Diskussion wieder bei null anfängt. Andrew Ng hat dafür in seinem Buch "Machine Learning Yearning" von 2018 ein einfaches Prinzip beschrieben: Eine Größe wird optimiert, alle anderen müssen nur eine festgelegte Grenze einhalten. Sein Beispiel: Die Genauigkeit soll so hoch wie möglich sein, die Laufzeit muss nur unter 100 Millisekunden bleiben. Ob sie 20 oder 90 Millisekunden beträgt, ist egal.
Übertragen heißt das: Legt eine führende Größe fest und für die anderen drei Leitplanken. Zwei Beispiele, wie das aussehen kann.
Bei einem Assistenten, der Antworten auf Kundenanfragen einer Bank vorformuliert, ist Sicherheit eine harte Leitplanke: kein Fall der Klasse "gefährlich" im Golden Set, keine Kundendaten außerhalb freigegebener Systeme, Freigabe durch einen Menschen vor dem Versand. Innerhalb dieser Leitplanke wird die Qualität optimiert. Latenz und Kosten bekommen Grenzen, die aus dem heutigen Aufwand abgeleitet sind.
Bei der nächtlichen Einordnung eingehender Dokumente führen dagegen die Kosten. Die Qualität muss eine Mindestschwelle halten, die Latenz spielt kaum eine Rolle, also wandert alles in die Stapelverarbeitung.
Eine Einschränkung gehört dazu. Ngs Prinzip stammt aus dem klassischen maschinellen Lernen, wo sich Qualität meist sauber in einer Zahl ausdrücken lässt. Bei Sprachmodellen ist das schwieriger, und die ersten Grenzwerte sind fast immer geschätzt. Das ist in Ordnung, solange ihr nach vier bis sechs Wochen Betrieb nachschärft und die Änderung aufschreibt.
Und dann die wichtigste Frage: Wer entscheidet das? Nicht das Entwicklungsteam. Das Team kann sagen, was eine Stellschraube kostet. Ob eine Sekunde weniger Wartezeit zehn Prozent mehr Kosten wert ist, ist eine fachliche und eine Führungsentscheidung. Wer sie nicht trifft, überlässt sie dem Zufall, meistens der Person, die als Letzte eine Konfiguration geändert hat.
Im Kleinen genauso
Das Prinzip funktioniert auch bei der Frage, welches KI-Abo ihr privat nutzt. Was führt für euch: die beste Antwort, die schnellste, der niedrigste Preis? Und wo liegt eine Leitplanke, die ihr nicht verhandelt? Wer seine Steuerunterlagen oder Arztbriefe hochlädt, sollte den Datenschutz vermutlich zur Leitplanke machen und erst danach über Qualität und Preis nachdenken.
Im regulierten Umfeld
In einer Bank hat die Entscheidung noch eine zweite Funktion. Eine aufgeschriebene Festlegung, welche Größe führt, welche Grenzen gelten und wer das entschieden hat, ist genau die Art Dokumentation, nach der Revision, Informationssicherheit und Aufsicht später fragen. Sie entsteht in einer Stunde, wenn man sie am Anfang schreibt, und kostet Wochen, wenn man sie hinterher rekonstruieren muss.
Wo ich selbst danebenlag
Zu Hause hab ich mir mal einen kleinen Assistenten gebaut, der die Zettel aus Kita und Schule abfotografiert, die Termine rausliest und in den Familienkalender schreibt. Bei zwei Kindern kommt da einiges zusammen. Ich hab das stärkste Modell genommen, das ich hatte, weil jede Uhrzeit stimmen sollte. Die Uhrzeiten stimmten auch. Nur hat jedes Foto gut ca. 20 Sekunden gebraucht, und nach einer Woche hing der Elternbrief wieder mit Magnet am Kühlschrank.
Gemessen hatte ich die Qualität. Gefragt, was für die anderen im Haushalt eigentlich wichtig ist, hatte ich nicht. Die Antwort wäre gewesen: Es muss schneller gehen als der Magnet. Heute läuft ein kleineres Modell, und bei unsicheren Daten fragt es kurz nach. Im Job passiert genau dasselbe, nur mit einer größeren Rechnung.
Worum es eigentlich geht
So verstehen wir die Digitale Renaissance: Die Technik liefert die Stellschrauben, und es werden jedes Jahr mehr. Welche davon Vorrang hat, ist keine technische Frage. Organisationen, die diese Entscheidung bewusst treffen und aufschreiben, lernen mit jedem System dazu. Die anderen optimieren im Kreis.
Was ihr diese Woche tun könnt
Nehmt euer aktuelles KI-Vorhaben und füllt diese Tabelle aus. Eine halbe Stunde, zusammen mit der Person aus der Fachabteilung, die das Ergebnis verantwortet.

Genau eine Zeile bekommt in der Spalte "Rolle" das Wort "führt". Wenn ihr euch darauf nicht einigen könnt, habt ihr kein Technikproblem gefunden, sondern die Entscheidung, die als Nächstes getroffen werden muss.
Quellen
- Jakob Nielsen, "Response Times: The 3 Important Limits", Nielsen Norman Group (1993, aktualisiert): 0,1 s direktes Gefühl, 1 s Grenze für ununterbrochenen Gedankenfluss, 10 s Grenze für Aufmerksamkeit; darüber Fortschrittsanzeige und Abbruchmöglichkeit. https://www.nngroup.com/articles/response-times-3-important-limits/
- OpenAI, "Latency optimization" (API-Dokumentation, abgerufen 29.09.2026): sieben Prinzipien; Erzeugen der Ausgabe fast immer der langsamste Schritt, 50 % weniger Ausgabetoken bringen grob 50 % weniger Latenz; kleinere Modelle meist schneller und günstiger, können richtig eingesetzt größere übertreffen. https://developers.openai.com/api/docs/guides/latency-optimization
- Anthropic, "Introducing the Message Batches API" (Oktober 2024, allgemein verfügbar seit 17.12.2024): Bearbeitung innerhalb von 24 Stunden, 50 % günstiger als Standardaufrufe. https://anthropic.com/news/message-batches-api. Vergleichbares Angebot bei OpenAI (Batch API, 50 % Rabatt, 24 Stunden): neuraltrust.ai (Sekundärquelle).
- OWASP Gen AI Security Project, "Top 10 for LLM Applications 2025": u. a. LLM01 Prompt Injection, LLM02 Sensitive Information Disclosure, LLM06 Excessive Agency, LLM09 Misinformation, LLM10 Unbounded Consumption. https://genai.owasp.org/llm-top-10/ (Liste bestätigt über Coralogix, Indusface, Modulos)
- Andrew Ng, "Machine Learning Yearning" (Entwurf, deeplearning.ai, 2018), Kapitel 9 "Optimizing and satisficing metrics": eine Größe optimieren, die übrigen N−1 nur an einer Schwelle messen; Beispiel Genauigkeit vs. Laufzeit unter 100 ms.
- Rückbezug Golden Set und Nichtdeterminismus: siehe Quellen Blog 3 (Langfuse 2026; Thinking Machines Lab 2025).
- Eigene Praxis, im Text so gekennzeichnet: Fehlerklassen harmlos/ärgerlich/gefährlich, Tabelle der Stellschrauben außer den drei belegten Zeilen, Vorlage "Betriebsprofil".
- Keine erfundenen Zahlen: Die 95 Prozent im Qualitätsabschnitt und das Nacharbeitsbeispiel sind erkennbar als Rechenbeispiele formuliert, nicht als Messwerte.
Beeindruckend ist kein Abnahmekriterium
Jede KI-Demo funktioniert. Das liegt nicht daran, dass die Systeme so gut sind. Es liegt daran, dass eine Demo so lange wiederholt wird, bis sie klappt. Die Fälle, die schiefgehen, fliegen raus, bevor jemand zuschaut. Das ist keine Täuschung, das ist Selbsttäuschung, und die ist schwerer zu entdecken als jede Lüge.
6 Fragen, die ich vor jedem KI-Projekt stelle
Vor ein paar Tagen habe ich auf LinkedIn sechs Fragen gepostet, die ich vor jedem KI-Vorhaben stelle. Keine davon betrifft das Modell. Ein Karussell hat halt pro Seite Platz für einen Gedanken. Hier kommt die lange Fassung: was jede Frage eigentlich klären soll, welche Antworten ich immer wieder höre, die nicht tragen, und wie eine brauchbare Antwort aussieht.
KI-Realitätscheck 1. bis 14. Juni 2026: Was sich wirklich bewegt hat
Die Halbwertszeit einer KI-Schlagzeile liegt weiter bei etwa 48 Stunden. In den ersten zwei Juni-Wochen wurde aus "der Bundestag verabschiedet ein Durchführungsgesetz" ein "Deutschland reguliert KI scharf", aus einem freiwilligen Verhaltenskodex eine "Pflicht zum Wasserzeichen", und aus einer Exportkontroll-Anordnung ein "Anthropic schaltet Claude ab".