SchlüsselarbeitOriginalarbeiterreichbar
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
Der Aufgabensatz, der die Messung des Programmierens vom Schnipsel auf das Projekt umgestellt hat: 2.294 Fehlerberichte aus zwölf echten Python-Projekten, und die Aufgabe lautet, den Bestand so zu ändern, dass der Bericht erledigt ist. Entschieden wird über den Testlauf des Projekts. Für ein Kapitel über Aufgabenformen zählt vor allem der Zuschnitt: Er verlangt, Änderungen über mehrere Dateien hinweg abzustimmen, und misst damit etwas anderes als eine einzelne Funktion.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 05.09.2026:
SWE-bench, an evaluation framework consisting of 2,294 software engineering problems drawn from real GitHub issues and corresponding pull requests
bestätigt 24.09.2026Given a codebase along with a description of an issue to be resolved, a language model is tasked with editing the codebase to address the issue.
bestätigt 24.09.2026