KI-Sicherheit ist der Sammelbegriff für technische, organisatorische und politische Maßnahmen, mit denen Risiken von KI-Systemen begrenzt werden sollen. Im KI-Kontext taucht das Thema seit 2023 in Initiativen, Regulierung, Pre-Release-Tests, Modellforschung, Leitplanken-Debatten und Frontier-Safety-Frameworks auf.

Definition

KI-Sicherheit bezeichnet Maßnahmen, die verhindern sollen, dass KI-Systeme Schaden verursachen, missbraucht werden oder außer Kontrolle geraten. Dazu zählen im KI-Kontext sowohl technische Tests und Modellbewertungen als auch organisatorische Regeln, Governance-Fragen und gesellschaftliche Kontrolle.

Der englische Begriff "AI Safety" wird dabei oft breiter verwendet als klassische IT-Sicherheit: Es geht nicht nur darum, Systeme vor Angriffen zu schützen, sondern auch darum, ihr eigenes Verhalten, ihre Einsatzgrenzen und mögliche Nebenwirkungen zu verstehen.

Was KI-Sicherheit im KI-Kontext umfasst

Im Newsletter erscheint KI-Sicherheit nicht als einzelnes Spezialthema, sondern als Querschnitt durch Politik, Forschung und Produktentwicklung. Genannt werden unter anderem neue Standards für KI-Sicherheitstests und Schutz kritischer Infrastrukturen, ein KI-Sicherheitsboard der US-Regierung, Pre-Release-Tests für künftige Modelle sowie der Abbau oder Umbau politischer Leitplanken.

Der Begriff umfasst außerdem technische Risiken leistungsfähiger Modelle. Dazu gehören im Newsletter Beispiele wie verborgene Eigenschaften, die beim Training weitergegeben werden können, automatisierte Sicherheitsprüfungen und Frontier-Safety-Ansätze für sehr leistungsfähige Modelle.

Wichtige Bausteine

Ein erster Baustein sind Tests vor der Veröffentlichung. Der Newsletter nennt Vereinbarungen von OpenAI und Anthropic mit dem US AI Safety Institute für Pre-Release-Tests zukünftiger Modelle.

Ein zweiter Baustein sind Leitplanken. Damit sind Regeln, technische Sperren oder organisatorische Vorgaben gemeint, die riskantes Verhalten begrenzen sollen. Im Newsletter wird jedoch auch sichtbar, dass solche Leitplanken politisch umstritten und veränderbar sind.

Ein dritter Baustein ist Risikomanagement. Das NIST AI Risk Management Framework dient als offizieller Referenzpunkt für den Umgang mit KI-Risiken; die OWASP Top 10 for Large Language Model Applications liefern eine Sicherheits-Perspektive auf typische Risiken in LLM-Anwendungen.

Abgrenzung zu verwandten Begriffen

KI-Sicherheit ist breiter als Alignment. Alignment fragt vor allem, ob ein KI-System im Sinne menschlicher Ziele, Werte oder Vorgaben handelt; KI-Sicherheit umfasst zusätzlich Tests, Governance, Missbrauchsschutz, Infrastrukturfragen und Kontrolle.

KI-Sicherheit ist auch breiter als Guardrails. Guardrails sind konkrete Leitplanken oder Schutzmechanismen innerhalb eines Systems oder Produkts. KI-Sicherheit beschreibt dagegen das gesamte Sicherheitsfeld: von Forschung über Standards bis zu politischen Regeln.

Bei agentischen Systemen wird die Abgrenzung besonders wichtig: Wenn KI-Systeme nicht nur Antworten geben, sondern Aufgaben in mehreren Schritten ausführen, werden Arbeitsabläufe, Berechtigungen und Kontrollpunkte sicherheitsrelevant.

Entwicklung im AI-Breakdown-Bestand zu Newsletter

2023 rückt KI-Sicherheit im KI-Kontext über Partnerschaften, Initiativen und politische Regulierung in den Fokus. Dazu gehört die Erwähnung einer US-Durchführungsverordnung zu vertrauenswürdiger KI mit Standards für Sicherheitstests und kritische Infrastrukturen.

2024 verschiebt sich der Schwerpunkt stärker zu institutioneller Aufsicht und Modelltests: Der Newsletter nennt ein KI-Sicherheitsboard der Biden-Administration sowie Pre-Release-Tests bei OpenAI und Anthropic.

2025 wird KI-Sicherheit in den Quellen konfliktreicher: Es geht um zurückgenommene Leitplanken, gestrichene Hinweise auf KI-Sicherheit oder verantwortungsvolle KI, Forschung zu unterschwelligem Lernen, ein "Wettrüsten der Modelle" und Frameworks für unvorhergesehenes Verhalten leistungsfähiger Systeme.

Warum der Begriff wichtig ist

KI-Sicherheit ist wichtig, weil leistungsfähige Modelle nicht nur hilfreiche Werkzeuge sind, sondern auch neue Risiken schaffen können: etwa durch Missbrauch, fehlerhaftes Verhalten, schwer vorhersehbare Modellfähigkeiten oder mangelnde Kontrolle.

Der Newsletter zeigt zugleich, dass Sicherheit nicht nur eine technische Frage ist. Ob Anbieter sich selbst überwachen, ob staatliche Standards gelten und ob Kennzeichnungspflichten oder Sicherheitsrichtlinien bestehen, sind politische und organisatorische Entscheidungen.

Weitere Seiten

Quellen und Belege

AI-Breakdown-Ausgaben

Externe Quellen