Latenz bezeichnet bei KI-Systemen die Verzögerung zwischen Eingabe und Antwort. Im KI-Kontext steht der Begriff für die praktische Reaktionsgeschwindigkeit eines Modells oder Produkts: Er verbindet Modellwahl, Inferenz, Infrastruktur, On-Device-Verarbeitung, Kosten und Nutzererlebnis.
Kurzdefinition
Latenz ist die Verzögerung zwischen einer Anfrage und der Antwort eines KI-Systems oder zwischen einer Eingabe und der sichtbaren beziehungsweise hörbaren Reaktion.
Ein Beispiel beschreibt Latenz auch direkt als Antwortzeit: Bei Googles Modell-Updates ging es um die Reduzierung von Kosten und Latenzen, also Antwortzeiten.
Bedeutung im KI-Kontext
AI-Breakdown verwendet Latenz als Praxisbegriff: Ein KI-System kann qualitativ stark sein, sich aber trotzdem unbrauchbar anfühlen, wenn die Antwort zu spät kommt.
Besonders relevant ist das bei Realtime-Sprache, Coding, Agenten und Computer Use, weil diese Anwendungen schnelle Rückmeldungen brauchen. Ein Beispiel nennt Echtzeitgespräche mit etwa 320 Millisekunden Latenz und ordnet diese Größenordnung als menschlicher Konversation ähnlich ein.
Latenz ist damit nicht nur eine technische Kennzahl, sondern auch ein Maß dafür, ob ein KI-Produkt im Alltag flüssig, direkt und verlässlich wirkt.
Wodurch Latenz beeinflusst wird
Die vorhandenen Beispiele zeigen mehrere Hebel: Modelle können gezielt schneller und günstiger gemacht werden, Prompts können gecacht werden, und Systeme können näher am Gerät laufen.
Beim Beispiel Apple ReaLM wird beschrieben, dass ein Sprachmodell möglichst direkt auf dem Gerät laufen soll; als Nutzen werden mehr Datenschutz und geringere Latenz genannt.
Bei Claude Prompt Caching wird erklärt, dass wiederverwendbare Prompt-Bestandteile in einem Cache gespeichert werden können. Dadurch lassen sich Kosten und Antwortzeiten teilweise deutlich reduzieren.
Bei OpenAI wird im Newsletter auf eine Anleitung verwiesen, mit der Large-Language-Modelle zu schnelleren Antworten gebracht und Antwortzeiten reduziert werden sollen. Das zeigt: Latenzoptimierung kann auf mehreren Ebenen stattfinden, nicht nur durch ein anderes Modell.
Abgrenzung zu verwandten Begriffen
Inferenz ist der Berechnungsvorgang, bei dem ein Modell aus einer Eingabe eine Ausgabe erzeugt. Latenz ist dagegen die wahrgenommene oder gemessene Verzögerung bis zur Reaktion.
Edge AI beziehungsweise On-Device-KI kann Latenz senken, weil Verarbeitung näher am Gerät stattfinden kann. Edge AI ist aber eine Architekturentscheidung, während Latenz die Verzögerung beschreibt.
KI-Chips und GPUs können die Reaktionszeit beeinflussen, ersetzen aber nicht die Kennzahl selbst: Hardware ist ein möglicher Faktor, Latenz ist das Ergebnis, das Nutzer oder Systeme bemerken.
Praktische Beispiele aus dem Newsletter
Bei GPT-4o wird Latenz konkret als Reaktionszeit in Echtzeitgesprächen greifbar: Ein Beispiel nennt etwa 320 Millisekunden und vergleicht das mit menschlicher Konversation.
Bei Google Gemini-Updates wird Latenz zusammen mit Kosten genannt. Das zeigt, dass Antwortzeit und Wirtschaftlichkeit in KI-Produkten oft gemeinsam optimiert werden.
Bei Claude Prompt Caching wird Latenz über Wiederverwendung erklärt: Wenn ein Teil des Prompts bereits im Cache liegt, muss nicht alles jedes Mal neu verarbeitet werden; dies wird mit dem Café-Bild "das Übliche" erläutert.
Bei Apple ReaLM wird On-Device-Verarbeitung als Weg genannt, Datenschutz zu erhöhen und Latenz zu verringern.
Warum der Begriff wichtig ist
Latenz hilft, Modellqualität von Produktqualität zu unterscheiden: Ein Modell kann gute Antworten liefern, aber bei zu langen Antwortzeiten in interaktiven Szenarien trotzdem schlecht nutzbar sein.
Der Begriff verbindet Modellarchitektur, Inferenz, Infrastruktur und Nutzererlebnis. In den Belegen taucht er deshalb bei sehr unterschiedlichen Themen auf: On-Device-KI, Echtzeitgespräche, Prompt Caching, Modellupdates und Latenzoptimierung.
Für Leserinnen und Leser ist Latenz ein nützlicher Prüfbegriff: Wenn ein KI-Feature "schnell", "realtime" oder "günstiger" beworben wird, lohnt sich die Frage, welche Antwortzeit tatsächlich gemeint ist.
Weitere Seiten
Quellen und Belege
AI-Breakdown-Ausgaben
- AI-Breakdown KW 15/2024: Apple mischt auch kräftig mit und hat ein eigenes Sprachmodell namens ReaLM vorgestellt. Es soll Siri schlauer machen, damit sie endlich versteht, was wir von ihr wollen. Dabei soll es möglichst direkt auf dem Gerät laufen. Zum einen erhöht das den Datenschutz und verringert die Latenz. Im Juni findet die Entwicklerkonferenz von Apple statt. Spätestens dann wissen wir mehr. 🍏
- AI-Breakdown KW 40/2024: Schneller und günstiger: Google verbessert seine KI-Modelle. Dabei geht es aktuell um die Reduzierung der Kosten und der Latenzen, also der Antwortzeiten.
- AI-Breakdown KW 20/2024: Echtzeitgespräche mit einer Latenz von ca. 320 Millisekunden, was einer menschlichen Konversation entspricht
- AI-Breakdown KW 34/2024: Prompt caching: Claude hat ein neues API-Tool vorgestellt. Dabei können Prompts gespeichert werden, landen also im Cache. Dadurch lassen sich sowohl die Kosten als auch die Antwortzeiten des Modells teilweise deutlich reduzieren. Das Caching kann man sich wie folgt vorstellen: Du bist in einem Café. Beim ersten Besuch musst du dem Barista deine gesamte Bestellung sagen. Aber beim nächsten Mal? Sag einfach "das Übliche."
- AI-Breakdown KW 46/2024: Schnelle Antworten: OpenAI hat eine Anleitung veröffentlicht, wie man Large Language Modelle zu schnelleren Antworten bringen kann. Mit verschiedenen Techniken sollen sich so die Antwortzeiten deutlich reduzieren lassen.
- AI-Breakdown KW 16/2025: Kleiner, schneller & günstiger: GPT‑4.1 mini und nano bieten hohe Qualität bei deutlich reduzierten Latenzzeiten und Kosten
Externe Quellen
- Text generation: Verifizierte offizielle Quelle im Quellmaterial für OpenAI-API- und Textgenerierungs-Kontext; unterstützt die Einordnung von Antworten aus Sprachmodellen.
- Hugging Face documentation: Verifizierte Dokumentationsquelle im Quellmaterial für Modelle, Datasets, Inferenz- und Trainingskontext.
- What Is Edge AI and How Does It Work?: Verifizierte Quelle im Quellmaterial für Edge-AI-Kontext, der bei der Abgrenzung zu On-Device- und Edge-Verarbeitung relevant ist.