Eine Halluzination bezeichnet bei KI-Modellen eine Antwort, die überzeugend klingt, aber sachlich falsch, erfunden oder nicht ausreichend belegt ist. Im KI-Kontext erscheint der Begriff vor allem als Qualitäts- und Sicherheitsproblem: Anbieter werben wiederholt mit geringeren Halluzinationsraten, zugleich zeigen Beispiele aus sensiblen Bereichen wie Medizin, dass menschliche Prüfung, Quellenbelege und technische Gegenmaßnahmen wichtig bleiben.
Definition
Eine Halluzination ist im KI-Kontext eine plausible, aber falsche oder unbelegte Ausgabe eines KI-Modells. Umgangssprachlich kann man auch von einer Falschantwort sprechen; der Begriff Konfabulation betont, dass das Modell eine scheinbar stimmige Antwort erzeugt, obwohl die zugrunde liegende Behauptung nicht zuverlässig belegt ist.
Wichtig ist: Eine Halluzination muss nicht offensichtlich absurd wirken. Gerade weil sie sprachlich sauber, selbstbewusst und passend formuliert sein kann, ist sie für Nutzerinnen und Nutzer schwerer zu erkennen als ein klarer technischer Fehler.
Bedeutung im KI-Kontext
Im KI-Kontext wird Halluzination als eines der zentralen Risiken beim Einsatz großer Sprachmodelle beschrieben. Die bestehende Wiki-Seite nennt Suche, Medizin, Recht, Unternehmensarbeit und psychische Gesundheit als wiederkehrende Kontexte, in denen falsche oder unbelegte KI-Antworten indirekt eine Rolle spielen.
Die Belege zeigt außerdem, dass geringere Halluzinationsraten regelmäßig als Produktversprechen auftauchen: Bei Claude 2.1 wurde 2023 eine reduzierte Halluzinationsrate erwähnt, bei GPT-4.5 2025 weniger Halluzinationen, bei DeepSeek R1 0528 eine Reduktion von Falschaussagen und bei GPT-5.2 Verbesserungen bei der Reduzierung von Fehlern.
Warum Halluzinationen gefährlich sein können
Halluzinationen sind besonders riskant, wenn Nutzerinnen und Nutzer die Ausgabe für fachlich geprüft halten. In einem Newsletter-Beispiel aus der Medizin wird berichtet, dass eine medizinische KI ein nicht existierendes Gehirnareal erfand und dieser Fehler selbst bei einer Überprüfung durch Mediziner zunächst übersehen wurde.
Das Beispiel zeigt die praktische Gefahr: Nicht nur Laien können von plausibel klingenden KI-Antworten getäuscht werden. Auch Fachleute können eine erfundene Information übersehen, wenn sie überzeugend in einen fachlichen Kontext eingebettet ist.
Abgrenzung zu verwandten Begriffen
Eine Halluzination ist nicht dasselbe wie eine unvollständige Antwort. Eine unvollständige Antwort kann korrekt, aber lückenhaft sein; eine Halluzination enthält dagegen eine falsche, erfundene oder unbelegte Behauptung.
Sie ist auch nicht automatisch ein Zeichen dafür, dass ein Modell insgesamt unbrauchbar ist. Die Newsletter-Belege zeigen, dass Anbieter Modelle mit verbesserten Leistungswerten und weniger Halluzinationen vorstellen, Halluzinationen aber weiterhin als eigenes Qualitätsproblem behandelt werden.
Gegenmaßnahmen: Quellen, RAG, Evals und Prüfung
Die bestehende Wiki-Seite nennt RAG, Evals, Quellenpflicht und menschliche Prüfung als zentrale Gegenmittel. RAG steht für Retrieval-Augmented Generation: Das Modell erhält vor oder während der Antwort zusätzliche Informationen aus einer Such- oder Dokumentenquelle, statt nur aus seinem internen Modellwissen zu formulieren.
Evals sind systematische Tests, mit denen ein Modell oder eine Anwendung auf Fehler, Zuverlässigkeit und typische Problemfälle geprüft wird. Quellenpflicht bedeutet, dass Aussagen mit überprüfbaren Belegen verbunden werden sollen. Menschliche Prüfung bleibt besonders dort wichtig, wo falsche Antworten rechtliche, medizinische, finanzielle oder organisatorische Folgen haben können.
Externe Quellen stützen diese Einordnung nur allgemein: Ein RAG-Survey behandelt Retrieval-Augmented Generation als Technik rund um Wissenszugriff und Generierung, das NIST AI Risk Management Framework bietet einen Governance-Rahmen für KI-Risiken, und OpenAIs Prompt-Engineering-Leitfaden ist eine offizielle Quelle für Prompting-Strategien. Diese Quellen ersetzen aber keine konkrete Prüfung einzelner Newsletter-Behauptungen.
Einordnung über die Zeit
Die vorhandene Wiki-Seite beschreibt eine Entwicklung: 2023 und 2024 wurde Halluzination vor allem als Chatbot-Problem diskutiert; 2025 rückten Sicherheitsmechanismen, Jugendschutz, Quellenbelege und Unternehmensrisiken stärker in den Vordergrund.
Die PageIndex-Belege unterstützen zumindest einen Teil dieser Entwicklung: Mehrere Modellmeldungen aus 2023 und 2025 nennen reduzierte Halluzinationen ausdrücklich als Verbesserung oder Produktmerkmal. Gleichzeitig zeigt das medizinische Beispiel Ende 2025, dass das Problem trotz solcher Verbesserungsversprechen nicht verschwunden ist.
Quellen und Belege
AI-Breakdown-Ausgaben
- AI-Breakdown KW 48/2023: 1. Claude 2.1: Mit verbesserten Funktionen, darunter ein 200.000-Kontext-Fenster, verspricht dieses Modell eine verbesserte Informationsverarbeitung und reduzierte Halluzinationsrate.
- AI-Breakdown KW 10/2025: 1. Haupt-Neuerung: Bessere Schreibstile ("Vibe"), weniger Halluzinationen, solide Ergebnisse bei einfachem Q&A. Bei komplexem Reasoning landen andere Modelle (z. B. Grok 3) laut aktuellen Benchmarks aber teils weiter vorn.
- AI-Breakdown KW 23/2025: 1. DeepSeek R1 mit Verbesserungen: Eine neue Version des DeepSeek R1 Modells (Version 0528) wurde veröffentlicht. Sie bietet verbesserte Leistungswerte, eine Reduktion von Falschaussagen (Halluzinationen) und unterstützt jetzt JSON-Ausgaben sowie Funktionsaufrufe.
- AI-Breakdown KW 51/2025: Leistung: Die "Thinking"-Version schlägt oder erreicht in 71 % der Fälle das Niveau von menschlichen Profis bei echten Arbeitsaufgaben (wie Tabellenkalkulation). Verbesserungen gibt es vor allem beim Programmieren, Sehen und der Reduzierung von Fehlern ("Halluzinationen").
- AI-Breakdown KW 52/2025: 1. Halluzination in der Medizin: Vorsicht bleibt geboten. Eine medizinische KI von Google hat in einer Studie ein nicht existierendes Gehirnareal erfunden - ein Fehler, der selbst bei der Überprüfung durch Mediziner zunächst übersehen wurde.
Externe Quellen
- Retrieval-Augmented Generation for Large Language Models: A Survey: Survey-Quelle für Retrieval-Augmented Generation als technische Gegenmaßnahme im Umfeld von Halluzinationen und wissensgestützter Generierung.
- AI Risk Management Framework: Offizieller Rahmen zur Einordnung von KI-Risiken, Governance und Vertrauenswürdigkeit; geeignet als Hintergrundquelle für Risikomanagement bei Halluzinationen.
- Prompt engineering: Offizielle Quelle für Prompting-Strategien; als ergänzende Quelle zu praktischen Maßnahmen geeignet, ohne konkrete Newsletter-Claims zu ersetzen.