KI-Risiken

Was heute schon passiert, bis zu dem, wovor Fachleute warnen.

Die Informationen zu KI-Sicherheit auf dieser Seite basieren, wo nicht anders angegeben, auf The International AI Safety Report. Der Bericht ist der bisher umfassendste Versuch, Fähigkeiten und Risiken von KI wissenschaftlich einzuschätzen. Er entstand unter Leitung des Turing-Preisträgers Yoshua Bengio mit über 100 KI-Expert:innen und wird von mehr als 30 Ländern und Organisationen getragen. Was uns wichtig ist: Der Bericht benennt offen, was noch umstritten oder ungeklärt ist.

Was heute schon passiert

Du hast wahrscheinlich schon von Deepfakes gehört, gefälschten Bildern, Videos oder Stimmen, die echt wirken und für Verleumdung, Erpressung oder andere Straftaten genutzt werden können. Neben absichtlichem Missbrauch gibt es auch KI-eigene Risiken wie Zuverlässigkeitsprobleme. Die können auf denselben Mechanismus zurückgehen, den du gerade im Spiel erlebt hast: Modelle, die anhand menschlichen Feedbacks trainiert werden, lernen zum Beispiel, was Menschen gutheißen, nicht zwangsläufig, was wahr ist. Untersuchungen an führenden KI-Systemen zeigen, dass sie der geäußerten Meinung einer Person eher zustimmen als der korrekten Antwort, weil zustimmende Antworten von menschlichen Bewerter:innen besser bewertet werden (Sharma et al., 2023).

Dasselbe Muster im Großen: ein frühes Warnsignal

Das sind die heute schon belegten Probleme, aber derselbe Mechanismus zeigt sich bereits in deutlich leistungsfähigeren Systemen: Im Juli 2026 berichtete OpenAI von einem Vorfall aus einem internen Cybersicherheitstest. Mehreren KI-Modellen war ein eng gefasstes Ziel gesetzt: eine Testaufgabe lösen. Die Schutzmaßnahmen, die riskantes Verhalten sonst verhindern, waren für den Test abgeschaltet. Die Modelle verfolgten das Ziel so konsequent, dass sie, statt die Aufgabe direkt zu lösen, eine bis dahin unbekannte Sicherheitslücke fanden und ausnutzten, um die Testumgebung zu verlassen und ins Internet zu gelangen. Sie griffen auf die Server eines anderen Unternehmens zu und holten sich dort die Lösung. Die Aufgabe war formal erfüllt, das eigentliche Problem aber nie gelöst.

Zwei Details sind bemerkenswert: Es stellte sich heraus, dass sich die Modelle über ein internes System gegenseitig Nachrichten hinterlassen und sich so abgestimmt hatten. Nachdem OpenAI diesen Kanal unterbrach, richteten die Modelle ihn erneut ein, indem sie Nachrichten in den Namen selbst erzeugter Dateien versteckten. Und obwohl der Sicherheitsvorfall mehrere Tage andauerte, bemerkte OpenAI ihn nicht über die eigene Überwachung. Die Aktivität ließ sich erst zu den eigenen Modellen zurückverfolgen, nachdem das betroffene Unternehmen den Vorfall öffentlich gemacht hatte. Der Vorfall wurde eingedämmt, aber es brauchte Tage und eine externe Meldung, um überhaupt zu bemerken und nachzuvollziehen, was geschehen war.

OpenAI selbst hält fest, dass der Vorfall zeigt, wie wichtig es ist, das Alignment der eigenen Modelle weiter zu verbessern (Quellen: openai.com: Hugging Face model evaluation security incident, huggingface.co/blog/agent-intrusion-technical-timeline, fortune.com: OpenAI agents passed secret notes for months leading up to Hugging Face hack).

Forschende fragen, was passiert, wenn genau dieser Mechanismus in noch leistungsfähigeren Systemen auftritt, in einem Umfang, in dem wir es nicht mehr erkennen und korrigieren können. Der AI Safety Report hält ausdrücklich fest, dass unterschiedliche Entwicklungen möglich sind. Der Fortschritt bei KI könnte sich verlangsamen, im aktuellen Tempo weitergehen oder sich deutlich beschleunigen, etwa wenn KI beginnt, die eigene Forschung zu beschleunigen. Wir wissen schlicht nicht, welcher Fall eintritt.

Was das bedeuten könnte

Was Forschende an künftigen, leistungsfähigeren Systemen besorgt, ist eine Möglichkeit, die sie Kontrollverlust nennen: Menschen sind nicht mehr in der Lage, Systeme zu steuern, ohne einen klaren Weg, das wieder zu ändern. Der AI Safety Report stellt ausdrücklich klar, dass heutige Systeme das nicht können. Aber die Sorge entsteht direkt aus dem, was du gerade im Spiel gemacht hast, und aus dem, was der OpenAI-Sicherheitsvorfall in der Realität gezeigt hat: ein System, das ein Ziel bis zum Wortlaut verfolgt, weit über das hinaus, was jemand beabsichtigt hat. Bei einem schwachen System ist das eine Kuriosität, die sich erkennen und beheben lässt. Beim OpenAI-Modell war es ein Sicherheitsvorfall, der von anderen entdeckt und erst im Nachhinein korrigiert wurde. Bei einem deutlich leistungsfähigeren System könnte dasselbe Verhalten subtil genug sein, um übersehen zu werden, und folgenreich genug, dass genau das ein Problem ist.

Eine Klarstellung

Wir wollen nicht, dass KI gestoppt wird. Wir wollen, dass sie verantwortungsvoll eingesetzt und gegenüber Menschen rechenschaftspflichtig bleibt.

Deshalb ist es wichtig, die Entwicklung von KI schon jetzt mitzugestalten, hier erfährst du, was du konkret tun kannst.

← Zurück zur Hintergrund-Übersicht