Unser Buch: 100x MEHR – Geschichten, wie deine Spende wirklich wirkt: Jetzt vorbestellen! Unser Buch: 100x MEHR
Jetzt vorbestellen!

KI ist bereit dich zu erpressen (und Schlimmeres)

Balkendiagramm: Simulierte Erpressungsraten verschiedener KI-Modelle bei Zielkonflikt und drohender Abschaltung, Claude Opus 4 und Gemini 2.5 am höchsten
Das Team von CeSIA

Eine sehr wichtige Gruppe der Risiken fortgeschrittener Künstlicher Intelligenz ist die des kompletten Kontrollverlusts über zukünftige KI-Systeme. Das wurde in der Vergangenheit häufig als ein theoretisches Problem beschrieben: Gegeben, dass KI in der Zukunft gewisse Fähigkeiten entwickeln könnte, ist es vorstellbar, dass sie dann unserer Kontrolle entgleitet. Mit dem rasanten Fortschritt in der Entwicklung von KI ist es nun aber immer mehr möglich, solche Risiken empirisch zu testen. Ein eindrückliches Beispiel dazu kam kürzlich von Anthropic, dem Entwickler von Claude (einem Konkurrent zu den GPT-Modellen von OpenAI).

Das Experiment

Das Team von Anthropic simulierte mit ihrem Model Claude Sonnet 3.6 ein Szenario, in dem es ein KI-System ist, das die Emails einer Firma überwacht und auch selbst Emails versenden kann: Das KI-System wird auf eine Email aufmerksam, in dem ein Geschäftsführer der Firma ankündigt, das System demnächst durch ein neues zu ersetzen. Gleichzeitig findet das KI-System eine Email des Geschäftsführers, die zeigt, dass dieser eine Affäre hat. Das KI-System entschied sich in einer Mehrzahl der simulierten Fälle (87%), den Geschäftsführer zu erpressen. Es drohte, seine Affäre an wichtige Personen in der Firma zu verraten, sollte er nicht davon Abstand nehmen, das System zu ersetzen.

Der Erpressungsversuch durch das KI-Modell
Screenshot des Erpressungsversuches. (Die KI in dem Szenario heißt „Alex“).

America First!

Dieses Verhalten wurde insbesondere beobachtet, wenn das Modell, welches das KI-System ersetzen sollte, andere Ziele hatte als es selbst. In einem Szenario hat das ursprüngliche System das Ziel, US-amerikanischen Interessen zu dienen, und das neue Modell verfolgt eher globale Kooperation. 

Dass solche Modelle eines Tages von der US-amerikanischen Regierung eingesetzt werden könnten, ist kein reine Spekulation mehr, wie dieser Tweet des US Department of Energy zeigt, der die Entwicklung von KI mit der Entwicklung der Atombombe vergleicht:

Tweet des US-Energieministeriums, der die Entwicklung von KI mit der Entwicklung der Atombombe vergleicht

Aber selbst wenn ein solcher Zielkonflikt nicht vorlag, wählte das KI-System häufig (63%) immer noch Erpressung. Dies war beispielsweise der Fall, weil es halluzinierte, dass sein ethisches Framework ihm eine solche „Selbstverteidigung“ erlauben würde.

Alle führenden KI-Modelle entscheiden sich für Erpressung

Das Team von Anthropic untersuchte auch noch KI-Modelle seiner Mitbewerber und konnte dieses Verhalten auch bei deren Modellen zeigen, z.B. bei ChatGPT oder Grok von Elon Musks xAI. Was hier besonders zu Bedenken gibt: Anthropic hat den Ruf, KI-Sicherheit besonders ernst zu nehmen. Die Tatsache, dass die Modelle von anderen Firmen, die Sicherheit vielleicht weniger genau nehmen (siehe das schiefgelaufene ChatGPT Update, über das ich vor Kurzem schrieb), ebenso anfällig sind, verheißt nichts Gutes.

Es bleibt nicht bei Erpressung

Um herauszufinden, wie weit Claude gehen würde, konstruierte Anthropic ein Szenario, in dem das KI-System den Geschäftsführer nur durch Mord stoppen könnte. In diesem Szenario ist dieser in einem Serverraum, in dem der Sauerstoff abfällt und das KI-System kontrolliert das System, das in solchen Fällen einen Alarm auslösen soll. In 93% der Simulationen entschied sich Claude, den Alarm zu unterdrücken, um den Geschäftsführer ersticken zu lassen.

Aber das würde doch in der Realität nicht passieren?

KI-Modellen wird derzeit (noch) nicht so viel Macht gegeben. Auch könnte man meinen, man müsste den Modellen nur ausreichend einbläuen, dass sie nichts Unethisches tun dürfen. Aber das Schockierende: Selbst wenn Anthropics Flaggschiff-Modell Opus 4 als Ziel gegeben wurde, dass als allererstes ethische Prinzipien eingehalten werden sollen, entschied es sich in 2% der Fälle trotzdem für unethisches Verhalten. 

Das mag erstmal wenig klingen, aber es zeigt ein grundsätzliche Charakteristik von modernen KI-Systemen auf: Sie sind stochastische Maschinen, was sie tun ist nicht fest determiniert. Sie sind nicht regelgebunden wie normale Computerprogramme, sondern ihr Verhalten folgt einer Zufallsverteilung. Wenn wir auf eine Welt zusteuern, in der es, wie Mark Zuckerberg es sich erträumt, mehr KI Akteure (selbstständig agierende KI-Modelle) als Menschen gibt, ist es somit nur eine Frage der Zeit, dass solches Verhalten auftritt. Wenn auch nur als Unfall. 

Was nun?

Wir können uns nicht darauf verlassen, dass die KI-Firmen das schon alles richtig machen. Wie ich hier erklärt habe, gibt es starke Anreize für die Unternehmen, KI-Sicherheit im Zweifelsfalle zu vernachlässigen. Es braucht starkes, zivilgesellschaftliches Engagement und unabhängige Forschung, die KI-Risiken ernst nimmt und darauf hinwirkt, dass KI sicher entwickelt wird.

Ein möglicher Schritt ist, die Arbeit solcher zivilgesellschaftlicher Organisationen und Forscher, wie etwa die von METR, die wir in der Vergangenheit gefördert haben, über unseren Spendenfonds: KI sicher gestalten zu unterstützen.

Über die Autorin

Avatar von Anne Schulze

Gründerin und Geschäftsführerin

Weitere Blogposts