71 · Rechenleistung & Kosten
Latenz
Reaktionszeit bis zur Antwort.
Die Wartezeit bis zur Antwort — für Chatbots Komfortfrage, für Telefon-Assistenten, Autovervollständigung oder Echtzeitsysteme die Existenzfrage. Latenz konkurriert direkt mit Qualität: Größere Modelle und längeres Nachdenken liefern bessere Antworten, aber später. Gute Systeme wählen deshalb pro Aufgabe, nicht pauschal.
Ein Beispiel
Im Chat sind drei Sekunden Wartezeit unauffällig, weil der Text laufend erscheint und man mitliest. In einer Telefonanlage, die gesprochen antwortet, sind drei Sekunden Stille ein Gesprächsabbruch — Menschen erwarten dort unter einer Sekunde. Dasselbe Modell, dieselbe Qualität, und im einen Fall trägt die Lösung, im anderen nicht. Die Anforderung kommt aus dem Anwendungsfall, nicht aus der Technik.
Genauer betrachtet
Zwei Werte zählen getrennt: die Zeit bis zum ersten Token und die Rate danach. Für Gespräche ist der erste entscheidend, für lange Ausgaben der zweite. Streaming verbessert das Erleben, ohne die Gesamtdauer zu ändern.
Warum das zählt
Latenz ist die Anforderung, die am häufigsten zu spät gestellt wird, und die, die die Modellwahl am härtesten einschränkt. Reasoning-Modelle sind gut und langsam; große Kontexte sind mächtig und langsam; Selbstbetrieb ist datenschutzfreundlich und bei schwankender Last langsam. Wer die Zielzeit erst nach dem Bauen festlegt, muss oft Qualität zurückbauen. Nützlich ist ein einfacher Grundsatz: Die Zielzeit wird vor der Modellwahl festgeschrieben, und zwar aus dem Ablauf heraus — nicht als „möglichst schnell“.
Häufig missverstanden
Agenten mit vielen Schritten addieren Wartezeiten. Was einzeln nach zwei Sekunden aussieht, wird über fünfzehn Aufrufe zur halben Minute — und fällt in der Abnahme nicht auf, weil dort einzeln getestet wird.
Nachbarschaft
Verwandte Begriffe
Newsletter
Der Brief.
Ein Artikel pro Woche, dazu was uns beim Bauen aufgefallen ist. Kein Wochenrückblick, keine Werbung, keine Weitergabe der Adresse. Abmelden mit einem Klick in jeder Ausgabe.