SchlüsselarbeitOriginalarbeiterreichbar
Evaluating Large Language Models Trained on Code
Die Arbeit von 2021, die HumanEval einführt und damit den anderen Zuschnitt der Code-Messung: eine Funktion mit Beschreibung, entschieden über die Frage, ob sie das Richtige tut. Zwei Zahlen daraus sind bis heute nützlich als Ausgangswert, nämlich 28,8 Prozent im ersten Anlauf und 70,2 Prozent bei hundert Versuchen je Aufgabe. Die zweite Zahl sagt zugleich, was ein einzelner Anlauf wert ist.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:
a new evaluation set we release to measure functional correctness for synthesizing programs from docstrings
bestätigt 24.09.2026our model solves 28.8% of the problems, while GPT-3 solves 0% and GPT-J solves 11.4%.
bestätigt 24.09.2026we find that repeated sampling from the model is a surprisingly effective strategy for producing working solutions to difficult prompts.
bestätigt 24.09.2026