Latenz bezeichnet bei KI-Systemen die Verzögerung zwischen Eingabe und Antwort. Im KI-Kontext steht der Begriff für die praktische Reaktionsgeschwindigkeit eines Modells oder Produkts: Er verbindet Modellwahl, Inferenz, Infrastruktur, On-Device-Verarbeitung, Kosten und Nutzererlebnis.

Kurzdefinition

Latenz ist die Verzögerung zwischen einer Anfrage und der Antwort eines KI-Systems oder zwischen einer Eingabe und der sichtbaren beziehungsweise hörbaren Reaktion.

Ein Beispiel beschreibt Latenz auch direkt als Antwortzeit: Bei Googles Modell-Updates ging es um die Reduzierung von Kosten und Latenzen, also Antwortzeiten.

Bedeutung im KI-Kontext

AI-Breakdown verwendet Latenz als Praxisbegriff: Ein KI-System kann qualitativ stark sein, sich aber trotzdem unbrauchbar anfühlen, wenn die Antwort zu spät kommt.

Besonders relevant ist das bei Realtime-Sprache, Coding, Agenten und Computer Use, weil diese Anwendungen schnelle Rückmeldungen brauchen. Ein Beispiel nennt Echtzeitgespräche mit etwa 320 Millisekunden Latenz und ordnet diese Größenordnung als menschlicher Konversation ähnlich ein.

Latenz ist damit nicht nur eine technische Kennzahl, sondern auch ein Maß dafür, ob ein KI-Produkt im Alltag flüssig, direkt und verlässlich wirkt.

Wodurch Latenz beeinflusst wird

Die vorhandenen Beispiele zeigen mehrere Hebel: Modelle können gezielt schneller und günstiger gemacht werden, Prompts können gecacht werden, und Systeme können näher am Gerät laufen.

Beim Beispiel Apple ReaLM wird beschrieben, dass ein Sprachmodell möglichst direkt auf dem Gerät laufen soll; als Nutzen werden mehr Datenschutz und geringere Latenz genannt.

Bei Claude Prompt Caching wird erklärt, dass wiederverwendbare Prompt-Bestandteile in einem Cache gespeichert werden können. Dadurch lassen sich Kosten und Antwortzeiten teilweise deutlich reduzieren.

Bei OpenAI wird im Newsletter auf eine Anleitung verwiesen, mit der Large-Language-Modelle zu schnelleren Antworten gebracht und Antwortzeiten reduziert werden sollen. Das zeigt: Latenzoptimierung kann auf mehreren Ebenen stattfinden, nicht nur durch ein anderes Modell.

Abgrenzung zu verwandten Begriffen

Inferenz ist der Berechnungsvorgang, bei dem ein Modell aus einer Eingabe eine Ausgabe erzeugt. Latenz ist dagegen die wahrgenommene oder gemessene Verzögerung bis zur Reaktion.

Edge AI beziehungsweise On-Device-KI kann Latenz senken, weil Verarbeitung näher am Gerät stattfinden kann. Edge AI ist aber eine Architekturentscheidung, während Latenz die Verzögerung beschreibt.

KI-Chips und GPUs können die Reaktionszeit beeinflussen, ersetzen aber nicht die Kennzahl selbst: Hardware ist ein möglicher Faktor, Latenz ist das Ergebnis, das Nutzer oder Systeme bemerken.

Praktische Beispiele aus dem Newsletter

Bei GPT-4o wird Latenz konkret als Reaktionszeit in Echtzeitgesprächen greifbar: Ein Beispiel nennt etwa 320 Millisekunden und vergleicht das mit menschlicher Konversation.

Bei Google Gemini-Updates wird Latenz zusammen mit Kosten genannt. Das zeigt, dass Antwortzeit und Wirtschaftlichkeit in KI-Produkten oft gemeinsam optimiert werden.

Bei Claude Prompt Caching wird Latenz über Wiederverwendung erklärt: Wenn ein Teil des Prompts bereits im Cache liegt, muss nicht alles jedes Mal neu verarbeitet werden; dies wird mit dem Café-Bild "das Übliche" erläutert.

Bei Apple ReaLM wird On-Device-Verarbeitung als Weg genannt, Datenschutz zu erhöhen und Latenz zu verringern.

Warum der Begriff wichtig ist

Latenz hilft, Modellqualität von Produktqualität zu unterscheiden: Ein Modell kann gute Antworten liefern, aber bei zu langen Antwortzeiten in interaktiven Szenarien trotzdem schlecht nutzbar sein.

Der Begriff verbindet Modellarchitektur, Inferenz, Infrastruktur und Nutzererlebnis. In den Belegen taucht er deshalb bei sehr unterschiedlichen Themen auf: On-Device-KI, Echtzeitgespräche, Prompt Caching, Modellupdates und Latenzoptimierung.

Für Leserinnen und Leser ist Latenz ein nützlicher Prüfbegriff: Wenn ein KI-Feature "schnell", "realtime" oder "günstiger" beworben wird, lohnt sich die Frage, welche Antwortzeit tatsächlich gemeint ist.

Weitere Seiten

Quellen und Belege

AI-Breakdown-Ausgaben

Externe Quellen