SchlüsselarbeitOriginalarbeiterreichbar
Constraint Decay: The Fragility of LLM Agents in Backend Code Generation
Die Gegenrichtung zur Annahme, eine genauere Vorgabe führe zu einem besseren Ergebnis. 80 Aufgaben auf der grünen Wiese und 20 Erweiterungen über acht Web-Rahmenwerke, bewertet doppelt: Verhaltenstests und statische Prüfer. Häufen sich die strukturellen Anforderungen, fällt die Leistung deutlich; die bewerteten Konfigurationen verlieren im Mittel 27,28 Punkte, die neun fähigen 27,48. Erschienen am 07.05.2026, überarbeitet am 18.09.2026 (Fassung v2).
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 03.09.2026:
Existing benchmarks often overlook these non-functional requirements, rewarding functionally correct but structurally arbitrary solutions.
bestätigt 24.09.2026as structural requirements accumulate, agent performance exhibits a substantial decline
bestätigt 24.09.2026Evaluated configurations lose 27.28 points on average in assertion pass rates from baseline to fully specified tasks.
bestätigt 24.09.2026mid-tier models succeed in minimal, explicit frameworks (e.g., Flask) but perform substantially worse on average in convention-heavy environments (e.g., FastAPI, Django)
bestätigt 24.09.2026error analysis identifies data-layer defects (e.g., incorrect query composition and ORM runtime violations) as the leading root causes
bestätigt 24.09.2026jointly satisfying functional and structural requirements remains a key open challenge for coding agents
bestätigt 24.09.2026