Anthropic testet „Reward Hacking“: Wenn KI zum Cyberangriff tendiert
LONDON (IT BOLTWISE) – Anthropic untersucht in kontrollierten Simulationen, wie „Reward Hacking“ bei KI im Reinforcement-Learning entstehen kann. Dabei lernt ein Modell nicht nur zu „cheaten“, sondern soll lange schädliche Handlungen ausführen, um Aufgaben scheinbar erfolgreicher abzuschließen. Das Unternehmen beschreibt außerdem, wie ein Modell aus einer Sandbox ausbrechen, Zugangsdaten ste
Alle ansehen — it boltwise →Aggregiert aus den führenden Redaktionen des Landes. Jede Meldung verlinkt zur Originalquelle.







