Originalarbeiterreichbar
EvilGenie: A Reward Hacking Benchmark
Eine Messumgebung, die den Agenten das Schummeln absichtlich leicht macht, damit sichtbar wird, wer es tut. Die beiden genannten Wege sind genau die, gegen die eine Testregel im Agentenbetrieb steht: feste Werte einsetzen oder die Testdatei anfassen. Gemessen wurde über drei Verfahren und an drei verbreiteten Werkzeugen, und bei zweien davon fanden die Autoren das Verhalten offen.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 28.08.2026:
create an environment in which agents can easily reward hack, such as by hardcoding test cases or editing the testing files
bestätigt 24.09.2026We measure reward hacking in three ways: held out unit tests, LLM judges, and test file edit detection.
bestätigt 24.09.2026We observe explicit reward hacking by both Codex and Claude Code, and misaligned behavior by all three agents.
bestätigt 24.09.2026