NachschlagenQuellenregister

Originalarbeiterreichbar

Measuring short-form factuality in large language models

arxiv.org (externe Seite)

Jason Wei und weitere, OpenAI, 07.11.2024. Die Arbeit hinter dem Prüfsatz SimpleQA, 4.326 Fragen mit kurzer, eindeutiger Antwort. Wichtig ist hier weniger der Prüfsatz als seine Bewertung: Sie kennt drei Ausgänge statt zwei, richtig, falsch und nicht versucht. Damit wird Enthaltung überhaupt erst ein eigenes Ergebnis und verschwindet nicht in der Fehlerspalte.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 30.07.2026:

  • SimpleQA is a simple, targeted evaluation for whether modelsbestätigt 24.09.2026

Enthaltung im Glossar07 Halluzinationen erkennen

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.