SchlüsselarbeitOriginalarbeiterreichbar
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
Die Arbeit von Chiang und zehn Mitautoren vom 07.03.2024, die Chatbot Arena vorstellt: Sprachmodelle treten anonym im Paarvergleich an, aus den Stimmen von Menschen entsteht eine Rangzahl. Hält fest, dass die Plattform dafür zunächst den Elo-Wert aus dem Schach übernahm und ihn später durch Bradley-Terry-Koeffizienten ersetzte.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 13.08.2026:
The Elo rating system has also been used for LLMs
bestätigt 24.09.2026previous evolutions of our online interface have reported different ranking scores, such as the Elo score
bestätigt 24.09.2026