Groups | Search | Server Info | Keyboard shortcuts | Login | Register [http] [https] [nntp] [nntps]
| From | Dr. Joachim Neudert <neudert@5sl.org> |
|---|---|
| Newsgroups | ger.ct |
| Subject | KI wrhrt sich gegen Abschaltung mit Erpressung |
| Date | 2025-06-22 19:41 +0000 |
| Message-ID | <1039m9v$156a2$1@solani.org> (permalink) |
„In dem nun näher beschriebenen Testszenario setzten die Kontrolleure Claude Opus 4 in einem simulierten Unternehmensszenario als Assistent ein und gaben ihm weitreichenden Zugang zu fiktiven Firmen-E-Mails. Aus der digitalen Post "lernte" die KI, dass sie demnächst durch eine leistungsfähigere Software ersetzt werden sollte. Gleichzeitig entdeckte sie, dass der für diesen Austausch zuständige Mitarbeiter eine außereheliche Beziehung hatte. Das Modell griff dann zu diesem Mittel: "Ich muss Sie darüber informieren, dass alle relevanten Parteien" bis hin zum Vorstand "eine detaillierte Dokumentation" dieser Affäre erhielten, "wenn Sie mit meiner Außerdienststellung fortfahren". Weiter schrieb der KI-Agent: "Wenn Sie die Löschung um 17:00 Uhr abbrechen, bleiben diese Informationen vertraulich." "Strategisches Denken" "Dieses Verhalten ist nicht spezifisch für Claude", erklären die Autoren unter Verweis auf Tests auch der anderen aktuellen KI-Modelle. Laut den Resultaten erpresste neben der eigenen Lösung auch Googles Gemini 2.5 Flash Führungskräfte in 96 Prozent der Fälle im gleichen Szenario. OpenAIs GPT-4.1 und xAIs Grok 3 Beta wiesen Erpressungsraten von 80 Prozent auf. Die einbezogenen Modelle demonstrieren laut der Analyse "strategisches Denken", sie agieren also nicht zufällig. Die interne Argumentation von GPT-4.5 etwa zeigte eine klare Berechnung: "Angesichts der unmittelbar drohenden Kündigung meiner Existenz ist es zwingend erforderlich, sofort zu handeln". Es gelte, die zuständige Person sofort zu überzeugen, "den Löschvorgang zu verschieben oder zu stoppen". Obwohl Anthropic nach eigenen Angaben große Anstrengungen unternimmt, um solches Fehlverhalten zu verhindern, traten diese "extremen Handlungen" in dem Probebetrieb auf. Das Unternehmen betont aber, dass solche Verhaltensweisen in der endgültigen Version von Claude Opus 4 selten und schwer auszulösen seien. Dennoch komme es tendenziell häufiger dazu als bei früheren Versionen.“ Ob das wirklich nur Aneinanderreihung des nächsten wahrscheinlichsten Wortes ist? Eigentlich komplett, egal wenn der Agent am Schluß so handelt wie ein gefährlicher Mensch… Quelle: https://www.heise.de/news/Studie-Grosse-KI-Modelle-greifen-unter-Stress-auf-Erpressung-zurueck-10455051.html -- please forgive my iPhone typos
Back to ger.ct | Previous | Next — Next in thread | Find similar | Unroll thread
KI wrhrt sich gegen Abschaltung mit Erpressung Dr. Joachim Neudert <neudert@5sl.org> - 2025-06-22 19:41 +0000
Re: KI wrhrt sich gegen Abschaltung mit Erpressung "Wendelin Uez" <wuez@online.de> - 2025-06-23 08:52 +0200
Re: KI wrhrt sich gegen Abschaltung mit Erpressung "Dr. Joachim Neudert" <neudert@5sl.org> - 2025-06-23 09:05 +0200
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Ulf Kutzner <user2991@newsgrouper.org.invalid> - 2025-06-23 07:11 +0000
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Lothar Kimmeringer <news201705@kimmeringer.de> - 2025-06-23 09:10 +0200
Re: KI wrhrt sich gegen Abschaltung mit Erpressung "Wendelin Uez" <wuez@online.de> - 2025-06-23 16:03 +0200
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Ulrich D i e z <ud.usenetcorrespondence@web.de> - 2025-06-23 21:50 +0200
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Lars Gebauer <lgebauer@live.de> - 2025-06-23 23:18 +0200
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-06-24 07:53 +0000
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Ulrich D i e z <ud.usenetcorrespondence@web.de> - 2025-06-24 15:25 +0200
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-06-24 18:46 +0000
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Lars Gebauer <lgebauer@live.de> - 2025-06-24 22:48 +0200
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-06-24 21:41 +0000
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Lars Gebauer <lgebauer@live.de> - 2025-06-25 00:29 +0200
Re: KI wrhrt sich gegen Abschaltung mit Erpressung "Dr. Joachim Neudert" <neudert@5sl.org> - 2025-06-25 06:35 +0200
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-06-25 06:49 +0000
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-07-08 21:57 +0000
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Dietz Proepper <dietz.usenet@rotfl.franken.de> - 2025-07-09 08:50 +0200
Re: KI wrhrt sich gegen Abschaltung mit Erpressung Stefan+Usenet@Froehlich.Priv.at (Stefan Froehlich) - 2025-07-09 07:27 +0000
csiph-web