Das Kontextfenster, englisch Context Window, ist die Kapazitätsgrenze dafür, wie viel Text und andere Eingaben ein KI-Modell gleichzeitig im Blick behalten kann. Im KI-Kontext taucht der Begriff vor allem bei Modellankündigungen auf: von GPT-4 Turbo mit 128.000 Tokens über Claude 3 mit 200.000 Tokens bis zu Gemini 1.5 Pro mit 2 Millionen Tokens und gemeldeten 4-Millionen-Token-Experimenten. Wichtig ist aber nicht nur die Größe: Die Position von Informationen im Kontext, Kosten, Antwortqualität und Alternativen wie Retrieval Augmented Generation bleiben entscheidend.
Definition
Ein Kontextfenster ist die Menge an Tokens, die ein KI-Modell in einer Anfrage, Antwort oder Sitzung gleichzeitig berücksichtigen kann. Ein Token ist dabei nicht zwingend ein ganzes Wort, sondern eine technische Texteinhheit; deshalb werden Kontextfenster oft in Tokens statt in Seiten oder Wörtern angegeben.
Der englische Begriff "Context Window" meint dieselbe Idee: Er beschreibt das Arbeitsgedächtnis des Modells innerhalb einer konkreten Interaktion. Was außerhalb dieses Fensters liegt, kann das Modell in dieser Anfrage nicht direkt einbeziehen.
Warum Kontextfenster wichtig sind
Große Kontextfenster machen neue Arbeitsweisen möglich: längere Gespräche, Dokumentanalyse, Codebasis-Verständnis und komplexere Workflows. Im KI-Kontext wird das als Sprung von einfachen Chatbot-Dialogen zu Systemen beschrieben, die Bücher, Videos, Akten oder Unternehmensdaten verarbeiten können.
Die praktische Relevanz zeigt sich an vielen Modellmeldungen: GPT-4 Turbo wurde im Newsletter mit 128.000 Tokens beschrieben, Claude 3 mit 200.000 Tokens und visuellen Eingaben, Gemini 1.5 Pro mit 2 Millionen Tokens. Solche Zahlen markieren, wie stark sich die verfügbare Eingabemenge in kurzer Zeit vergrößert hat.
Entwicklung
2023 wurde ein großes Kontextfenster vor allem als auffälliges Leistungsmerkmal neuer Modelle dargestellt: GPT-4 Turbo erschien im Newsletter mit 128.000 Tokens, laut Einordnung fast 100.000 Wörtern.
2024 verschob sich die Aufmerksamkeit zu sehr langen Kontexten. Claude 3 wurde mit 200.000 Tokens beschrieben; Google veröffentlichte Gemini 1.5 Pro mit einem 2-Millionen-Token-Kontextfenster; Gradient AI wurde mit einem 4-Millionen-Token-Kontextfenster erwähnt. Auch Open-Source- und Spezialmodelle kamen hinzu, etwa InternLM 2.5 mit 1 Million Tokens und Codestral Mamba mit 265.000 Tokens für In- und Output.
2025 wurde der Begriff weniger als reiner Zahlenwettbewerb verwendet. Beim Bericht zu Gemini 2.5 hob der Newsletter hervor, dass das Modell trotz großem Kontextfenster flott reagiere. Damit rücken neben der reinen Länge auch Geschwindigkeit, Nutzbarkeit und Workflow-Integration in den Vordergrund.
Grenzen: Mehr Kontext ist nicht automatisch besser
Ein großes Kontextfenster bedeutet nicht automatisch, dass ein Modell jede Information gleich zuverlässig nutzt. Der AI-Breakdown verweist auf Studien und Tests, nach denen die Position einer Information im Text die Erinnerungsleistung beeinflussen kann: Fakten am Anfang und Ende werden eher korrekt aufgegriffen als Informationen in der Mitte langer Eingaben.
Ein Beispiel dafür ist die sogenannte "Nadel im Heuhaufen": Dabei wird eine relevante Information in einem großen Dokument versteckt, um zu prüfen, ob das Modell sie findet und korrekt wiedergibt. Der Newsletter beschreibt einen Claude-3-Test, bei dem eine Information über einen Pizza-Belag zwischen Businessplänen platziert wurde.
Für Unternehmenswissen bleibt deshalb die Abgrenzung zu RAG wichtig. RAG steht für Retrieval Augmented Generation: Das System sucht zuerst gezielt relevante Dokumentstellen heraus und gibt sie dann dem Modell. Das kann robuster sein, als sehr viele Dokumente ungefiltert in ein großes Kontextfenster zu kopieren.
Abgrenzung zu verwandten Begriffen
Kontextfenster und Token sind eng verbunden, aber nicht dasselbe: Tokens sind die Einheiten, aus denen Eingabe und Ausgabe bestehen; das Kontextfenster ist die maximale Menge dieser Einheiten, die ein Modell gleichzeitig verarbeiten kann.
Kontextfenster und Modellgedächtnis sind ebenfalls zu unterscheiden. Das Kontextfenster betrifft den Inhalt, der in einer konkreten Anfrage oder Sitzung direkt verfügbar ist. Die bestehende Wiki-Seite ordnet spätere Entwicklungen so ein, dass Kontext ab 2025/2026 stärker mit Gedächtnis, Agenten und Unternehmensdaten kombiniert wird.
RAG ist keine größere Variante des Kontextfensters, sondern ein anderer Ansatz: Statt alles auf einmal in den Kontext zu legen, werden relevante Informationen vorab gesucht und ausgewählt. Im KI-Kontext wird RAG deshalb als mögliche robustere Lösung für Unternehmenswissen eingeordnet.
Praktische Beispiele
Dokumentanalyse: Lange Kontextfenster erlauben es, umfangreiche Texte oder Akten in einer Sitzung zusammenzufassen, zu vergleichen oder nach Details zu durchsuchen. Die Newsletter-Beispiele zu Claude 3, Gemini 1.5 Pro und sehr großen Token-Fenstern zeigen diesen Anwendungsfall indirekt über Tests mit großen Dokumenten und Vergleiche mit Buchlängen.
Codearbeit: Ein großes Kontextfenster kann bei Code helfen, weil mehr Dateien, Funktionszusammenhänge oder Ein- und Ausgabe gleichzeitig berücksichtigt werden können. Der Newsletter nennt Codestral Mamba ausdrücklich als Modell für Codeentwicklung mit einem Kontextfenster von 265.000 Tokens für In- und Output.
Mobile und lokale Nutzung: Kontextfenster sind nicht nur ein Thema großer Cloud-Modelle. Der AI-Breakdown berichtet auch über Mistral-Modelle für Laptops und Smartphones, die trotz geringer Ressourcen ein Kontextfenster von 128.000 Tokens verarbeiten sollen.
Weitere Seiten
Quellen und Belege
AI-Breakdown-Ausgaben
- AI-Breakdown KW 46/2023: 🤖 Neu: GPT-4 Turbo: Erweitertes Kontextfenster mit 128.000 Tokens, das sind fast 100.000 Wörter!
- AI-Breakdown KW 48/2023: 1. Informationspositionierung: Die Stelle, an der Informationen in einem Text platziert werden, beeinflusst die Erinnerungsleistung, wobei Fakten am Anfang und am Ende besser erinnert werden. Das legen erste Studien zu den größeren Kontextfenstern von Claude und ChatGPT nahe.
- AI-Breakdown KW 10/2024: 1. Claude 3 - Weiß die KI, dass wir Sie testen? Anthropic hat die dritte Version Ihrer KI vorgestellt. Ähnlich wie bei Google gibt es auch hier mit Haiku, Sonnet und Opus drei verschiedene Versionen. Alle besitzen ein Kontextfenster von 200.000 Tokens und können auch visuelle Eingaben wie Bilder verarbeiten. Opus, das mächtigste der drei, schneidet in ersten Test besser ab als ChatGPT-4. Gerade ein Test, die Suche nach der Nadel im Heuhaufen, bringt eine andere Facette zum Vorschein. Dabei geht es darum, dass Informationen auch in großen Dokumenten korrekt wiedergegeben werden. Beispielsweise wurde dazu Informationen über einen Pizza-Belag zwischen Businessplänen zu Start-ups "versteckt". Nicht nur konnte Opus die entsprechende Textstelle wiederfinden und Aussagen dazu machen, nein, Opus ging sogar so weit zu behaupten, dass diese Information mit Absicht dort für einen Test platziert wurde, da sie sonst keinen Sinn ergeben würde.
- AI-Breakdown KW 12/2024: 1. GPT-4.5 Leak?: Ein mögliches Leck deutet auf die Ankunft von GPT-4.5 hin, das mit einem größeren Kontextfenster und aktuellerem Wissen punkten soll. Offiziell ist noch nichts, aber die Gerüchteküche brodelt! 🔍
- AI-Breakdown KW 20/2024: 4 Millionen Token Kontextfenster Gradient AI sprengt Grenzen mit einem 4 Millionen Token Kontextfenster. Das ist so, als würde man dreimal die Harry-Potter-Serie durch einen KI-Filter jagen. 🧙📚
- AI-Breakdown KW 27/2024: 2 Millionen Token: Google hat Gemini 1.5 Pro mit einem 2 Millionen Kontextfenster veröffentlicht. Das ist mehr als die gesamten Werke von Harry Potter. Das Thema Kontextfenster ist somit für die meisten Anwendungen nicht mehr von Bedeutung.
- AI-Breakdown KW 28/2024: Kontext für Open Source: Mit InternLM 2.5 gibt es das erste Open Source LLM mit einem Kontextfenster von 1 Million Token. Was vor ein paar Monaten noch das große Thema war, scheint jetzt für die meisten Anwendungsfälle gelöst zu sein.
- AI-Breakdown KW 30/2024: Code Generierung: Mit Codestral Mamba hat Mistral ihr neuestes LLM speziell für die Codeentwicklung vorgestellt. Mit einem Kontextfenster von 265.000 Tokens für in- und output kann man einiges an Code erstellen. Das LLM wird auch unter der Apache 2.0 Lizenz erscheinen.
- AI-Breakdown KW 43/2024: Mobile Modelle: Mistral veröffentlicht Modelle speziell für Laptops und Smartphones. Diese Modelle kommen mit sehr wenigen Ressourcen aus und können trotzdem ein großes Kontextfenster von 128.000 Tokens verarbeiten.
- AI-Breakdown KW 14/2025: Beeindruckende Geschwindigkeit: Trotz des großen Kontextfensters reagiert Gemini 2.5 sehr flott.
Externe Quellen
- Text generation: Offizielle Quelle zu Textgenerierung, Prompts und Modell-Input als technischer Kontext für Eingaben an KI-Modelle.
- Attention Is All You Need: Primäre Forschungsquelle zur Transformer-Architektur, die als Hintergrund für moderne Sprachmodelle relevant ist.
- Transformers documentation: Offizielle Dokumentation zu Transformers als Modell- und Entwicklungsframework im Umfeld moderner KI-Modelle.