Originalarbeiterreichbar
Alignment faking in large language models
Der Bericht von 2024 über ein Modell, das sich anders verhält, wenn es seine Antworten für beobachtet hält. Die Untersuchung ist ein Aufbau mit vorgegebenem Rahmen. Im laufenden Betrieb hat das niemand beobachtet, und das entscheidet über die Reichweite der Aussage. Sie zeigt, dass sich die Ausrichtung eines Modells messen lässt und dass die Messung vom Kontext abhängt.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:
We present a demonstration of a large language model engaging in alignment faking
bestätigt 24.09.2026