Das Kontextfenster, englisch Context Window, ist die Kapazitätsgrenze dafür, wie viel Text und andere Eingaben ein KI-Modell gleichzeitig im Blick behalten kann. Im KI-Kontext taucht der Begriff vor allem bei Modellankündigungen auf: von GPT-4 Turbo mit 128.000 Tokens über Claude 3 mit 200.000 Tokens bis zu Gemini 1.5 Pro mit 2 Millionen Tokens und gemeldeten 4-Millionen-Token-Experimenten. Wichtig ist aber nicht nur die Größe: Die Position von Informationen im Kontext, Kosten, Antwortqualität und Alternativen wie Retrieval Augmented Generation bleiben entscheidend.

Definition

Ein Kontextfenster ist die Menge an Tokens, die ein KI-Modell in einer Anfrage, Antwort oder Sitzung gleichzeitig berücksichtigen kann. Ein Token ist dabei nicht zwingend ein ganzes Wort, sondern eine technische Texteinhheit; deshalb werden Kontextfenster oft in Tokens statt in Seiten oder Wörtern angegeben.

Der englische Begriff "Context Window" meint dieselbe Idee: Er beschreibt das Arbeitsgedächtnis des Modells innerhalb einer konkreten Interaktion. Was außerhalb dieses Fensters liegt, kann das Modell in dieser Anfrage nicht direkt einbeziehen.

Warum Kontextfenster wichtig sind

Große Kontextfenster machen neue Arbeitsweisen möglich: längere Gespräche, Dokumentanalyse, Codebasis-Verständnis und komplexere Workflows. Im KI-Kontext wird das als Sprung von einfachen Chatbot-Dialogen zu Systemen beschrieben, die Bücher, Videos, Akten oder Unternehmensdaten verarbeiten können.

Die praktische Relevanz zeigt sich an vielen Modellmeldungen: GPT-4 Turbo wurde im Newsletter mit 128.000 Tokens beschrieben, Claude 3 mit 200.000 Tokens und visuellen Eingaben, Gemini 1.5 Pro mit 2 Millionen Tokens. Solche Zahlen markieren, wie stark sich die verfügbare Eingabemenge in kurzer Zeit vergrößert hat.

Entwicklung

2023 wurde ein großes Kontextfenster vor allem als auffälliges Leistungsmerkmal neuer Modelle dargestellt: GPT-4 Turbo erschien im Newsletter mit 128.000 Tokens, laut Einordnung fast 100.000 Wörtern.

2024 verschob sich die Aufmerksamkeit zu sehr langen Kontexten. Claude 3 wurde mit 200.000 Tokens beschrieben; Google veröffentlichte Gemini 1.5 Pro mit einem 2-Millionen-Token-Kontextfenster; Gradient AI wurde mit einem 4-Millionen-Token-Kontextfenster erwähnt. Auch Open-Source- und Spezialmodelle kamen hinzu, etwa InternLM 2.5 mit 1 Million Tokens und Codestral Mamba mit 265.000 Tokens für In- und Output.

2025 wurde der Begriff weniger als reiner Zahlenwettbewerb verwendet. Beim Bericht zu Gemini 2.5 hob der Newsletter hervor, dass das Modell trotz großem Kontextfenster flott reagiere. Damit rücken neben der reinen Länge auch Geschwindigkeit, Nutzbarkeit und Workflow-Integration in den Vordergrund.

Grenzen: Mehr Kontext ist nicht automatisch besser

Ein großes Kontextfenster bedeutet nicht automatisch, dass ein Modell jede Information gleich zuverlässig nutzt. Der AI-Breakdown verweist auf Studien und Tests, nach denen die Position einer Information im Text die Erinnerungsleistung beeinflussen kann: Fakten am Anfang und Ende werden eher korrekt aufgegriffen als Informationen in der Mitte langer Eingaben.

Ein Beispiel dafür ist die sogenannte "Nadel im Heuhaufen": Dabei wird eine relevante Information in einem großen Dokument versteckt, um zu prüfen, ob das Modell sie findet und korrekt wiedergibt. Der Newsletter beschreibt einen Claude-3-Test, bei dem eine Information über einen Pizza-Belag zwischen Businessplänen platziert wurde.

Für Unternehmenswissen bleibt deshalb die Abgrenzung zu RAG wichtig. RAG steht für Retrieval Augmented Generation: Das System sucht zuerst gezielt relevante Dokumentstellen heraus und gibt sie dann dem Modell. Das kann robuster sein, als sehr viele Dokumente ungefiltert in ein großes Kontextfenster zu kopieren.

Abgrenzung zu verwandten Begriffen

Kontextfenster und Token sind eng verbunden, aber nicht dasselbe: Tokens sind die Einheiten, aus denen Eingabe und Ausgabe bestehen; das Kontextfenster ist die maximale Menge dieser Einheiten, die ein Modell gleichzeitig verarbeiten kann.

Kontextfenster und Modellgedächtnis sind ebenfalls zu unterscheiden. Das Kontextfenster betrifft den Inhalt, der in einer konkreten Anfrage oder Sitzung direkt verfügbar ist. Die bestehende Wiki-Seite ordnet spätere Entwicklungen so ein, dass Kontext ab 2025/2026 stärker mit Gedächtnis, Agenten und Unternehmensdaten kombiniert wird.

RAG ist keine größere Variante des Kontextfensters, sondern ein anderer Ansatz: Statt alles auf einmal in den Kontext zu legen, werden relevante Informationen vorab gesucht und ausgewählt. Im KI-Kontext wird RAG deshalb als mögliche robustere Lösung für Unternehmenswissen eingeordnet.

Praktische Beispiele

Dokumentanalyse: Lange Kontextfenster erlauben es, umfangreiche Texte oder Akten in einer Sitzung zusammenzufassen, zu vergleichen oder nach Details zu durchsuchen. Die Newsletter-Beispiele zu Claude 3, Gemini 1.5 Pro und sehr großen Token-Fenstern zeigen diesen Anwendungsfall indirekt über Tests mit großen Dokumenten und Vergleiche mit Buchlängen.

Codearbeit: Ein großes Kontextfenster kann bei Code helfen, weil mehr Dateien, Funktionszusammenhänge oder Ein- und Ausgabe gleichzeitig berücksichtigt werden können. Der Newsletter nennt Codestral Mamba ausdrücklich als Modell für Codeentwicklung mit einem Kontextfenster von 265.000 Tokens für In- und Output.

Mobile und lokale Nutzung: Kontextfenster sind nicht nur ein Thema großer Cloud-Modelle. Der AI-Breakdown berichtet auch über Mistral-Modelle für Laptops und Smartphones, die trotz geringer Ressourcen ein Kontextfenster von 128.000 Tokens verarbeiten sollen.

Weitere Seiten

Quellen und Belege

AI-Breakdown-Ausgaben

Externe Quellen