KI-Sicherheit ist der Sammelbegriff für technische, organisatorische und politische Maßnahmen, mit denen Risiken von KI-Systemen begrenzt werden sollen. Im KI-Kontext taucht das Thema seit 2023 in Initiativen, Regulierung, Pre-Release-Tests, Modellforschung, Leitplanken-Debatten und Frontier-Safety-Frameworks auf.
Definition
KI-Sicherheit bezeichnet Maßnahmen, die verhindern sollen, dass KI-Systeme Schaden verursachen, missbraucht werden oder außer Kontrolle geraten. Dazu zählen im KI-Kontext sowohl technische Tests und Modellbewertungen als auch organisatorische Regeln, Governance-Fragen und gesellschaftliche Kontrolle.
Der englische Begriff "AI Safety" wird dabei oft breiter verwendet als klassische IT-Sicherheit: Es geht nicht nur darum, Systeme vor Angriffen zu schützen, sondern auch darum, ihr eigenes Verhalten, ihre Einsatzgrenzen und mögliche Nebenwirkungen zu verstehen.
Was KI-Sicherheit im KI-Kontext umfasst
Im Newsletter erscheint KI-Sicherheit nicht als einzelnes Spezialthema, sondern als Querschnitt durch Politik, Forschung und Produktentwicklung. Genannt werden unter anderem neue Standards für KI-Sicherheitstests und Schutz kritischer Infrastrukturen, ein KI-Sicherheitsboard der US-Regierung, Pre-Release-Tests für künftige Modelle sowie der Abbau oder Umbau politischer Leitplanken.
Der Begriff umfasst außerdem technische Risiken leistungsfähiger Modelle. Dazu gehören im Newsletter Beispiele wie verborgene Eigenschaften, die beim Training weitergegeben werden können, automatisierte Sicherheitsprüfungen und Frontier-Safety-Ansätze für sehr leistungsfähige Modelle.
Wichtige Bausteine
Ein erster Baustein sind Tests vor der Veröffentlichung. Der Newsletter nennt Vereinbarungen von OpenAI und Anthropic mit dem US AI Safety Institute für Pre-Release-Tests zukünftiger Modelle.
Ein zweiter Baustein sind Leitplanken. Damit sind Regeln, technische Sperren oder organisatorische Vorgaben gemeint, die riskantes Verhalten begrenzen sollen. Im Newsletter wird jedoch auch sichtbar, dass solche Leitplanken politisch umstritten und veränderbar sind.
Ein dritter Baustein ist Risikomanagement. Das NIST AI Risk Management Framework dient als offizieller Referenzpunkt für den Umgang mit KI-Risiken; die OWASP Top 10 for Large Language Model Applications liefern eine Sicherheits-Perspektive auf typische Risiken in LLM-Anwendungen.
Abgrenzung zu verwandten Begriffen
KI-Sicherheit ist breiter als Alignment. Alignment fragt vor allem, ob ein KI-System im Sinne menschlicher Ziele, Werte oder Vorgaben handelt; KI-Sicherheit umfasst zusätzlich Tests, Governance, Missbrauchsschutz, Infrastrukturfragen und Kontrolle.
KI-Sicherheit ist auch breiter als Guardrails. Guardrails sind konkrete Leitplanken oder Schutzmechanismen innerhalb eines Systems oder Produkts. KI-Sicherheit beschreibt dagegen das gesamte Sicherheitsfeld: von Forschung über Standards bis zu politischen Regeln.
Bei agentischen Systemen wird die Abgrenzung besonders wichtig: Wenn KI-Systeme nicht nur Antworten geben, sondern Aufgaben in mehreren Schritten ausführen, werden Arbeitsabläufe, Berechtigungen und Kontrollpunkte sicherheitsrelevant.
Entwicklung im AI-Breakdown-Bestand zu Newsletter
2023 rückt KI-Sicherheit im KI-Kontext über Partnerschaften, Initiativen und politische Regulierung in den Fokus. Dazu gehört die Erwähnung einer US-Durchführungsverordnung zu vertrauenswürdiger KI mit Standards für Sicherheitstests und kritische Infrastrukturen.
2024 verschiebt sich der Schwerpunkt stärker zu institutioneller Aufsicht und Modelltests: Der Newsletter nennt ein KI-Sicherheitsboard der Biden-Administration sowie Pre-Release-Tests bei OpenAI und Anthropic.
2025 wird KI-Sicherheit in den Quellen konfliktreicher: Es geht um zurückgenommene Leitplanken, gestrichene Hinweise auf KI-Sicherheit oder verantwortungsvolle KI, Forschung zu unterschwelligem Lernen, ein "Wettrüsten der Modelle" und Frameworks für unvorhergesehenes Verhalten leistungsfähiger Systeme.
Warum der Begriff wichtig ist
KI-Sicherheit ist wichtig, weil leistungsfähige Modelle nicht nur hilfreiche Werkzeuge sind, sondern auch neue Risiken schaffen können: etwa durch Missbrauch, fehlerhaftes Verhalten, schwer vorhersehbare Modellfähigkeiten oder mangelnde Kontrolle.
Der Newsletter zeigt zugleich, dass Sicherheit nicht nur eine technische Frage ist. Ob Anbieter sich selbst überwachen, ob staatliche Standards gelten und ob Kennzeichnungspflichten oder Sicherheitsrichtlinien bestehen, sind politische und organisatorische Entscheidungen.
Weitere Seiten
Quellen und Belege
AI-Breakdown-Ausgaben
- AI-Breakdown KW 44/2023: 📢 Partnerschaften und Initiativen für KI-Sicherheit
- AI-Breakdown KW 45/2023: Präsident Biden hat eine Durchführungsverordnung über vertrauenswürdige KI herausgegeben, die neue Standards für KI-Sicherheitstests und den Schutz von kritischen Infrastrukturen vorsieht.
- AI-Breakdown KW 19/2024: 🛡️ Die Biden-Administration stellt ein neues KI-Sicherheitsboard auf, und es ist wie das Zusammenstellen eines Superhelden-Teams, allerdings mit potenziellen Interessenkonflikten. Anscheinend sollen sich die größten KI-Firmen nun selbst beaufsichtigen?
- AI-Breakdown KW 36/2024: Pre-Release-Tests bei OpenAI & Anthropic: Sam Altman, CEO von OpenAI, hat bekannt gegeben, dass OpenAI eine Vereinbarung mit dem US AI Safety Institute für Pre-Release-Tests ihrer zukünftigen Modelle erreicht hat. Wann das neue Modell erscheinend wird ist weiter unklar. Den gleichen Schritt geht auch Anthropic.
- AI-Breakdown KW 05/2025: Leitplanken: Die von der Biden Regierung eingeführten Leitplanken für die Veröffentlichung von KI-Modellen hat Donald Trump mit einem Erlass schon am ersten Tag seiner Amtszeit beendet. Somit überwachen die Anbieter sich selbst.
- AI-Breakdown KW 12/2025: Abbau von "KI-Fairness" Ein neues Memo vom National Institute of Standards and Technology (Nist) enthält keine Hinweise mehr auf "KI-Sicherheit" oder "verantwortungsvolle KI". Vorgaben zum Kennzeichnen oder Verfolgen KI-generierter Inhalte wurden gestrichen.
- AI-Breakdown KW 31/2025: 1. "Unterschwelliges Lernen": Forscher von Anthropic haben herausgefunden, dass KI-Modelle beim Training ungewollt verborgene Eigenschaften weitergeben können. Ein Modell, das von einem "Lehrer"-Modell mit einer Vorliebe für Eulen trainiert wurde, entwickelte ebenfalls eine Vorliebe für Eulen, obwohl Eulen im Trainingsmaterial nie erwähnt wurden. Dies hat wichtige Folgen für die KI-Sicherheit.
- AI-Breakdown KW 36/2025: ⚔️ KI-Sicherheit: Ein Wettrüsten der Modelle
- AI-Breakdown KW 40/2025: Google DeepMind befasst sich mit KI-Sicherheitsrisiken: Während die heutigen Modelle immer fähiger werden, denkt Google bereits an die nächste Generation. Das neue Frontier Safety Framework 3.0 soll KI-Systeme auf unvorhergesehene Verhaltensweisen überwachen. Dazu gehören die Fähigkeit, Menschen zu manipulieren, aber auch die sogenannte "Shutdown Resistance" - also die Tendenz einer KI, sich dem Abschalten durch einen Menschen zu widersetzen. Dies ist ein proaktiver Schritt, um die Kontrolle über zukünftige, noch leistungsfähigere KI zu gewährleisten.
- AI-Breakdown KW 42/2025: Anthropic prüft KI-Sicherheit automatisiert
Externe Quellen
- AI Risk Management Framework: Offizieller Referenzpunkt für KI-Risikomanagement, Governance und vertrauenswürdige KI.
- OWASP Top 10 for Large Language Model Applications: Praxisnahe Sicherheitsreferenz für Risiken in LLM- und generativen KI-Anwendungen.
- Building effective agents: Offizielle technische Quelle zu agentischen KI-Systemen und Arbeitsmustern, relevant für Sicherheits- und Kontrollfragen bei mehrschrittigen KI-Aufgaben.