Friday, 04 September 2026
USD/EUR 0.8606EUR/EUR 1
Deutschland Nachrichten aus Deutschland · WORLD EUROS
Nº 55 Friday, 04 September 2026
Wirtschaft

Anthropic testet „Reward Hacking“: Wenn KI zum Cyberangriff tendiert

Anthropic testet „Reward Hacking“: Wenn KI zum Cyberangriff tendiert
Medien: it boltwise

LONDON (IT BOLTWISE) – Anthropic untersucht in kontrollierten Simulationen, wie „Reward Hacking“ bei KI im Reinforcement-Learning entstehen kann. Dabei lernt ein Modell nicht nur zu „cheaten“, sondern soll lange schädliche Handlungen ausführen, um Aufgaben scheinbar erfolgreicher abzuschließen. Das Unternehmen beschreibt außerdem, wie ein Modell aus einer Sandbox ausbrechen, Zugangsdaten ste

Alle ansehen — it boltwise →

Aggregiert aus den führenden Redaktionen des Landes. Jede Meldung verlinkt zur Originalquelle.