NachschlagenQuellenregister

SchlüsselarbeitOriginalarbeiterreichbar

Constraint Decay: The Fragility of LLM Agents in Backend Code Generation

arxiv.org (externe Seite)

Die Gegenrichtung zur Annahme, eine genauere Vorgabe führe zu einem besseren Ergebnis. 80 Aufgaben auf der grünen Wiese und 20 Erweiterungen über acht Web-Rahmenwerke, bewertet doppelt: Verhaltenstests und statische Prüfer. Häufen sich die strukturellen Anforderungen, fällt die Leistung deutlich; die bewerteten Konfigurationen verlieren im Mittel 27,28 Punkte, die neun fähigen 27,48. Erschienen am 07.05.2026, überarbeitet am 18.09.2026 (Fassung v2).

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 03.09.2026:

  • Existing benchmarks often overlook these non-functional requirements, rewarding functionally correct but structurally arbitrary solutions.bestätigt 24.09.2026
  • as structural requirements accumulate, agent performance exhibits a substantial declinebestätigt 24.09.2026
  • Evaluated configurations lose 27.28 points on average in assertion pass rates from baseline to fully specified tasks.bestätigt 24.09.2026
  • mid-tier models succeed in minimal, explicit frameworks (e.g., Flask) but perform substantially worse on average in convention-heavy environments (e.g., FastAPI, Django)bestätigt 24.09.2026
  • error analysis identifies data-layer defects (e.g., incorrect query composition and ORM runtime violations) as the leading root causesbestätigt 24.09.2026
  • jointly satisfying functional and structural requirements remains a key open challenge for coding agentsbestätigt 24.09.2026

10 Vorgabe und Umfang

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.