NachschlagenQuellenregister

Originalarbeiterreichbar

Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels

arxiv.org (externe Seite)

Die Gegenprobe zu der Annahme, mehrere Modelle als Prüfer ergäben mehrere Meinungen. Neun starke Modelle aus sieben Familien urteilen über dieselben Aufgaben, und ihre Fehler fallen so oft zusammen, dass von der rechnerischen Unabhängigkeit etwa ein Viertel übrig bleibt. Gemessen wurde an Aufgaben zum Sprachverstehen. Für die Frage, ob zwei Sitzungen desselben Modells einander prüfen können, bleibt das eine Überlegung.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 28.08.2026:

  • Roughly three-quarters of the panel's nominal independence is lostbestätigt 24.09.2026
  • scaling up panels cannot substitute for genuinely independent evaluationbestätigt 24.09.2026

derzeit nirgends verwendet

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.