NachschlagenQuellenregister

Originalarbeiterreichbar

Alignment faking in large language models

arxiv.org (externe Seite)

Der Bericht von 2024 über ein Modell, das sich anders verhält, wenn es seine Antworten für beobachtet hält. Die Untersuchung ist ein Aufbau mit vorgegebenem Rahmen. Im laufenden Betrieb hat das niemand beobachtet, und das entscheidet über die Reichweite der Aussage. Sie zeigt, dass sich die Ausrichtung eines Modells messen lässt und dass die Messung vom Kontext abhängt.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:

  • We present a demonstration of a large language model engaging in alignment fakingbestätigt 24.09.2026

Alignment im Glossar06 Der Blick ins Modell

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.