Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenVibe-Coding / Agentic EngineeringKapitel 07von 13 im Pfad

Prüfen statt glauben

Tiefe 1: Überblick · Lesezeit 9 Min. · Stand

Die sechs Kapitel davor haben eingerichtet, was ein Agent vorfindet: eine Projektanweisung, eine Historie, ein Gedächtnis, eine Wissensbasis. Alles davon verbessert die Ausgangslage. Nichts davon beantwortet die Frage, ob das Ergebnis stimmt.

Fertig aussehen ist das einzige Signal

Ein Agent arbeitet, bis er meint, fertig zu sein. Woran er das erkennt, ist die entscheidende Stelle: Ohne eine Prüfung, die er selbst laufen lassen kann, bleibt ihm allein der Anschein. Der Hersteller schreibt es in den ersten Abschnitt seiner Empfehlungen:

you become the verification loop: every mistake waits for you to notice it (externe Seite, code.claude.com)

Das ist die Sorte Fehler, die man erst spät bemerkt. Der Code liest sich plausibel, die Erklärung klingt schlüssig, und dass etwas fehlt, zeigt sich Tage später an einer Stelle, die niemand mit dieser Sitzung in Verbindung bringt.

Was als Prüfung zählt

Eine Prüfung ist in diesem Zusammenhang etwas sehr Schlichtes: ein Vorgang, der ein Ergebnis liefert, das der Agent lesen kann, und der zwei Ausgänge hat.

The check is anything that returns a signal Claude can read in the conversation: a test suite, a build exit code, a linter, a script that diffs output against a fixture, or a browser screenshot compared against a design. (externe Seite, code.claude.com)

Fünf Formen, und keine davon ist aufwendig. Ein Bau, der abbricht, ist bereits eine Prüfung. Ein Vergleich der Ausgabe gegen eine hinterlegte Erwartung ist zwanzig Zeilen. Der Wert steckt darin, dass am Ende zwei Zustände stehen und der Agent den Unterschied lesen kann, und ganz und gar nicht in der Ausgefeiltheit.

Eine Prüfung hat zwei Ausgänge. Ohne sie gibt es nur einen, und der heißt fertig. Die Weiche nach der Arbeit: Ohne Prüfung ist schlicht kein zweiter Ausgang vorhanden. MIT PRUEFUNG arbeiten prüfen fertig wieder ran DURCH OHNE PRUEFUNG arbeiten sieht fertig aus ein Ausgang, keine Frage

seitlich verschiebbar

Mit einem Signal, das der Agent lesen kann, schließt sich die Schleife von selbst. Ohne eines schließt sie ein Mensch, und zwar irgendwann.

eigene Darstellung, Stand 04.08.2026

Wer die Schleife schließt

Der Unterschied liegt bei der Anwesenheit. Gründlicher wird dadurch niemand. Mit einer Prüfung arbeitet der Agent, führt sie aus, liest das Ergebnis und macht weiter, bis sie durchgeht. Ohne eine Prüfung übernimmt diese Rolle ein Mensch, der dafür hinsehen muss.

Der Hersteller formuliert es als Unterschied zwischen zwei Arbeitsweisen:

Give Claude a check it can run: tests, a build, a screenshot to compare. (externe Seite, code.claude.com)

Praktisch heißt das für den Auftrag: Wer eine Funktion bestellt, nennt am besten gleich zwei oder drei Beispiele, bei denen klar ist, was herauskommen muss, und bittet darum, die Prüfung nach dem Bauen auch auszuführen. Das kostet einen Satz und ändert den Charakter der Sitzung.

Beweis statt Behauptung

Die zweite Gewohnheit ist noch billiger. Ein Agent kann berichten, dass etwas funktioniert, und er kann zeigen, woran er das sieht.

Have Claude show evidence rather than asserting success (externe Seite, code.claude.com)

Die Ausgabe des Testlaufs, der Befehl mit seiner Antwort, das Bild des Ergebnisses. Das durchzusehen geht schneller, als es selbst noch einmal nachzustellen, und es funktioniert auch dann, wenn man beim Arbeiten nicht zugesehen hat.

Wo es trotzdem hakt

Zwei Dinge, die dieses Kapitel in den folgenden Ebenen ausführt.

Erstens läuft eine Prüfung nur, wenn sie tatsächlich läuft. Ein Agent, der sie überspringen kann, überspringt sie irgendwann, und eine übersprungene Prüfung sieht von außen genauso aus wie eine bestandene.

Zweitens misst eine Prüfung nur das, was sie misst. Beides sind eigene Fehlerklassen, und die zweite ist die unangenehmere: Sie erzeugt ein grünes Ergebnis, das nichts bedeutet.

Quellen

3 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Dokumentationerreichbar

    Anthropic, Best practices for Claude Code (externe Seite, code.claude.com)

    code.claude.comgeprüft 24.09.2026

    Die Sammlung der Muster, die sich bei Anthropic intern und bei Anwendern bewährt haben. Der erste Abschnitt der Seite ist zugleich ihre stärkste Aussage: Ein Agent braucht eine Prüfung, die er selbst fahren kann, sonst ist der Mensch die Prüfschleife und jeder Fehler wartet darauf, bemerkt zu werden. Die Seite nennt vier Stufen, wie hart die Prüfung das Ende einer Runde blockiert, vom Satz im Auftrag über eine Zielbedingung und einen Stop-Hook bis zum zweiten Modell, das den eigenen Befund zu widerlegen versucht. Sie ist außerdem die Quelle für den Unterschied zwischen einer Projektanweisung und einem Hook: Die eine ist beratend, der andere läuft.

  • Originalarbeiterreichbar

    OpenAI, Harness engineering: leveraging Codex in an agent-first world (externe Seite, openai.com)

    openai.comgeprüft 24.09.2026

    Ryan Lopopolo berichtet am 11. Februar 2026 über ein Team, das fünf Monate lang ein Produkt gebaut hat, ohne eine Zeile von Hand zu schreiben. Der Wert des Berichts liegt in den Nebenwirkungen, die er offenlegt: Der Agent wiederholt vorhandene Muster einschließlich der schlechten, das Team verbrachte einen Tag der Woche mit Aufräumen, bis es die Regeln maschinell verankerte. Auch das Datum zählt, denn der Begriff Harness stand sechs Tage vorher zum ersten Mal geschrieben.

  • Dokumentationerreichbar

    Anthropic, Hooks reference (externe Seite, code.claude.com)

    code.claude.comgeprüft 24.09.2026

    Die Herstellerdokumentation zu den Ereignissen, an denen sich eigene Programme einhängen lassen. Für das Gedächtnis sind zwei Zeilen ihrer Übersichtstabelle entscheidend, und sie sagen das Gegenteil dessen, was man erwartet. Zu PreCompact und PostCompact steht dort "No decision control. Used for side effects like logging or cleanup": Ein Hook vor dem Verdichten kann also Dateien schreiben, seine Ausgabe wird aber nicht in den Kontext übernommen. Einspeisen kann nur SessionStart, dort steht "hookSpecificOutput.additionalContext adds context for Claude", und dieses Ereignis kennt vier Auslöser, darunter ausdrücklich "compact". Der Rückweg nach dem Verdichten führt damit über den Sitzungsstart statt über das Verdichten selbst. Abgerufen am 03.08.2026.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.