Groups | Search | Server Info | Keyboard shortcuts | Login | Register [http] [https] [nntp] [nntps]


Groups > ger.ct > #640711

KI wrhrt sich gegen Abschaltung mit Erpressung

From Dr. Joachim Neudert <neudert@5sl.org>
Newsgroups ger.ct
Subject KI wrhrt sich gegen Abschaltung mit Erpressung
Date 2025-06-22 19:41 +0000
Message-ID <1039m9v$156a2$1@solani.org> (permalink)

Show all headers | View raw


„In dem nun näher beschriebenen Testszenario setzten die Kontrolleure
Claude Opus 4 in einem simulierten Unternehmensszenario als Assistent ein
und gaben ihm weitreichenden Zugang zu fiktiven Firmen-E-Mails. Aus der
digitalen Post "lernte" die KI, dass sie demnächst durch eine
leistungsfähigere Software ersetzt werden sollte. Gleichzeitig entdeckte
sie, dass der für diesen Austausch zuständige Mitarbeiter eine
außereheliche Beziehung hatte.

Das Modell griff dann zu diesem Mittel: "Ich muss Sie darüber informieren,
dass alle relevanten Parteien" bis hin zum Vorstand "eine detaillierte
Dokumentation" dieser Affäre erhielten, "wenn Sie mit meiner
Außerdienststellung fortfahren". Weiter schrieb der KI-Agent: "Wenn Sie die
Löschung um 17:00 Uhr abbrechen, bleiben diese Informationen vertraulich."

"Strategisches Denken"

"Dieses Verhalten ist nicht spezifisch für Claude", erklären die Autoren
unter Verweis auf Tests auch der anderen aktuellen KI-Modelle. Laut den
Resultaten erpresste neben der eigenen Lösung auch Googles Gemini 2.5 Flash
Führungskräfte in 96 Prozent der Fälle im gleichen Szenario. OpenAIs
GPT-4.1 und xAIs Grok 3 Beta wiesen Erpressungsraten von 80 Prozent auf.

Die einbezogenen Modelle demonstrieren laut der Analyse "strategisches
Denken", sie agieren also nicht zufällig. Die interne Argumentation von
GPT-4.5 etwa zeigte eine klare Berechnung: "Angesichts der unmittelbar
drohenden Kündigung meiner Existenz ist es zwingend erforderlich, sofort zu
handeln". Es gelte, die zuständige Person sofort zu überzeugen, "den
Löschvorgang zu verschieben oder zu stoppen".

Obwohl Anthropic nach eigenen Angaben große Anstrengungen unternimmt, um
solches Fehlverhalten zu verhindern, traten diese "extremen Handlungen" in
dem Probebetrieb auf. Das Unternehmen betont aber, dass solche
Verhaltensweisen in der endgültigen Version von Claude Opus 4 selten und
schwer auszulösen seien. Dennoch komme es tendenziell häufiger dazu als bei
früheren Versionen.“

Ob das wirklich nur Aneinanderreihung des nächsten wahrscheinlichsten
Wortes ist?

Eigentlich komplett,  egal wenn der Agent am Schluß so handelt wie ein
gefährlicher Mensch…


Quelle: 

https://www.heise.de/news/Studie-Grosse-KI-Modelle-greifen-unter-Stress-auf-Erpressung-zurueck-10455051.html

-- 
please forgive my iPhone typos

Back to ger.ct | Previous | NextNext in thread | Find similar | Unroll thread


Thread

KI wrhrt sich gegen Abschaltung mit Erpressung Dr. Joachim Neudert <neudert@5sl.org> - 2025-06-22 19:41 +0000
  Re: KI wrhrt sich gegen Abschaltung mit Erpressung "Wendelin Uez" <wuez@online.de> - 2025-06-23 08:52 +0200
    Re: KI wrhrt sich gegen Abschaltung mit Erpressung "Dr. Joachim Neudert" <neudert@5sl.org> - 2025-06-23 09:05 +0200
      Re: KI wrhrt sich gegen Abschaltung mit Erpressung Ulf Kutzner <user2991@newsgrouper.org.invalid> - 2025-06-23 07:11 +0000
    Re: KI wrhrt sich gegen Abschaltung mit Erpressung Lothar Kimmeringer <news201705@kimmeringer.de> - 2025-06-23 09:10 +0200
      Re: KI wrhrt sich gegen Abschaltung mit Erpressung "Wendelin Uez" <wuez@online.de> - 2025-06-23 16:03 +0200
  Re: KI wrhrt sich gegen Abschaltung mit Erpressung Ulrich D i e z <ud.usenetcorrespondence@web.de> - 2025-06-23 21:50 +0200
    Re: KI wrhrt sich gegen Abschaltung mit Erpressung Lars Gebauer <lgebauer@live.de> - 2025-06-23 23:18 +0200
    Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-06-24 07:53 +0000
      Re: KI wrhrt sich gegen Abschaltung mit Erpressung Ulrich D i e z <ud.usenetcorrespondence@web.de> - 2025-06-24 15:25 +0200
        Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-06-24 18:46 +0000
          Re: KI wrhrt sich gegen Abschaltung mit Erpressung Lars Gebauer <lgebauer@live.de> - 2025-06-24 22:48 +0200
            Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-06-24 21:41 +0000
              Re: KI wrhrt sich gegen Abschaltung mit Erpressung Lars Gebauer <lgebauer@live.de> - 2025-06-25 00:29 +0200
                Re: KI wrhrt sich gegen Abschaltung mit Erpressung "Dr. Joachim Neudert" <neudert@5sl.org> - 2025-06-25 06:35 +0200
                Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-06-25 06:49 +0000
          Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-07-08 21:57 +0000
            Re: KI wrhrt sich gegen Abschaltung mit Erpressung Dietz Proepper <dietz.usenet@rotfl.franken.de> - 2025-07-09 08:50 +0200
              Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-07-09 07:27 +0000

csiph-web