Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenConversational AIKapitel 07von 12 im Pfad

Guardrails

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Ein Gesprächssystem soll bestimmte Dinge nicht tun. Nicht über das Wetter reden, wenn es für Terminverschiebungen gebaut ist. Keine Auskunft geben, für die niemand geradesteht. Die Vorkehrungen dafür heißen Guardrails, auf Deutsch Leitplanken, und sie liegen um das Modell herum.

Drei Stellen, an denen geprüft wird

Der Werkzeugkasten von OpenAI für Agenten beschreibt die ersten beiden in einem Satz:

Guardrails enable you to do checks and validations of user input and agent output. (externe Seite, openai.github.io)

Am Eingang wird geprüft, was hereinkommt, bevor das Modell es sieht. Am Ausgang wird geprüft, was hinausgeht, bevor jemand es hört. Die dritte Stelle ist der Tool Call, also der Moment, in dem das System etwas tut statt etwas zu sagen. Sie hängt eng an Kapitel 06 und wird in der dritten Tiefe dieses Kapitels auseinandergenommen.

Manche Anbieter zählen feiner. NVIDIA nennt fünf Stationen, und zwar in einem einzigen Satz:

Input, retrieval, dialog, execution, and output rails run at different stages of an LLM interaction. (externe Seite, docs.nvidia.com)

Dazwischen liegen der Abruf von Unterlagen und die Gesprächsführung selbst. Wer mit den drei groben Stellen anfängt, hat die Sache verstanden; die feinere Einteilung wird interessant, sobald eine Anwendung wirklich gebaut wird.

Sperren, ändern, prüfen

Was ein Guardrail mit einem Befund anstellt, steht bei demselben Anbieter:

Use it to block, alter, or validate unsafe, off-topic, malicious, or policy-violating user inputs and model responses. (externe Seite, docs.nvidia.com)

Drei Verben, und das mittlere ist das überraschende. Ein Guardrail hat also drei Möglichkeiten, und der Abbruch ist eine davon. Er kann eine Eingabe entschärfen oder eine Antwort umschreiben, und der Anrufer merkt davon nichts. Das ist bequem und hat einen Preis: Wer nur protokolliert, was gesperrt wurde, sieht die geänderten Fälle nie.

Bemerkenswert ist auch, was in der Aufzählung neben „unsafe“ steht. Off-topic, also am Thema vorbei, hat mit Sicherheit wenig zu tun. In einer Sprachanwendung ist es trotzdem der häufigere Fall: Die meisten Gespräche, die schieflaufen, laufen einfach woandershin.

Warum das im Gespräch später kommt

Eine Prüfung der Ausgabe hat ein Zeitproblem, das im Chatfenster niemandem auffällt. Die Dokumentation der Moderations-Schnittstelle sagt es geradeheraus:

If you stream a generated response, moderation scores arrive after the full generated output is available. (externe Seite, developers.openai.com)

Am Bildschirm ist das verschmerzbar. Der Text läuft ein, und wenn die Prüfung danach anschlägt, lässt er sich ausblenden oder ersetzen, bevor jemand ihn zu Ende gelesen hat.

Im Gespräch gibt es dieses Zeitfenster nicht. Die Antwort wird gesprochen, während sie entsteht, das ist die Bedingung, unter der Kapitel 03 überhaupt funktioniert. Was das Modell erzeugt hat, ist gehört, bevor die Prüfung ihr Urteil hat.

Daraus folgt eine Bauentscheidung, die es am Bildschirm so nicht braucht: Entweder wird auf die vollständige Antwort gewartet, dann kostet die Prüfung Wartezeit. Oder es wird während des Sprechens geprüft, dann greift die Prüfung erst beim nächsten Stück. Beides ist vertretbar, und ein drittes gibt es nicht.

Weshalb dasselbe Modell sich verschieden verhält

Guardrails gehören zur Anwendung. Sie stehen in deren Programm, sie werden von deren Betreiber eingestellt, und sie lassen sich ändern, ohne die Gewichte anzufassen. Das Modell selbst weiß von ihnen nichts.

Deshalb sagt die Auskunft „wir benutzen Modell X“ wenig darüber, was ein System tut. Zwei Anwendungen auf derselben Grundlage können sich sehr verschieden verhalten, und der Unterschied liegt in dem, was drumherum gebaut wurde. Für die Einordnung eines Angebots ist das die nützlichere Frage.

Quellen

6 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Dokumentationerreichbar

    OpenAI Agents SDK, Guardrails (externe Seite, openai.github.io)

    openai.github.iogeprüft 24.09.2026

    Der Werkzeugkasten von OpenAI für Agenten führt Guardrails als drei Stationen: am Eingang, an der Ausgabe und am Tool Call. Die Seite sagt auch, wo sie jeweils greifen, nämlich am ersten Agenten einer Kette und an dem, der die Endausgabe erzeugt. Am Tool Call nennt sie drei Reaktionen: den Aufruf überspringen, seine Ausgabe durch eine Meldung ersetzen, oder den Lauf abbrechen.

  • Dokumentationerreichbar

    NVIDIA, NeMo Guardrails (externe Seite, docs.nvidia.com)

    docs.nvidia.comgeprüft 24.09.2026

    Die Dokumentation eines Werkzeugkastens, der Guardrails als benannte Bauteile führt. Sie zählt fünf Stationen, wo andere Anbieter drei nennen, und führt sie in einem einzigen Satz auf: Eingang, Abruf, Dialog, Ausführung, Ausgabe. Damit ist sie der einzige geprüfte Beleg, der die vollständige Reihenfolge in einem Satz hat.

  • Dokumentationerreichbar

    OpenAI, Moderation (externe Seite, developers.openai.com)

    developers.openai.comgeprüft 24.09.2026

    Die Prüfung von Inhalten vor und hinter dem Modell, als eigene Schnittstelle. Zwei Angaben reichen dabei weiter als die Sache selbst. Bei einem Tool Call erfasst die Prüfung die übergebenen Argumente und die Ausgabe des Tools, während Tool-Namen, Beschreibungen und Schemata ausdrücklich außerhalb bleiben. Und bei einer stückweise gelieferten Antwort liegen die Prüfwerte erst vor, wenn der Text vollständig erzeugt ist.

  • Dokumentationerreichbar

    Meta, Llama Guard, Modellkarte (externe Seite, huggingface.co)

    huggingface.cogeprüft 24.09.2026

    Die Modellkarte zu einem Sprachmodell, dessen einzige Aufgabe die Einstufung von Eingaben und Antworten ist. Sie legt die Mechanik offen: Das Modell liefert eine Wahrscheinlichkeit, und wer es einsetzt, wählt selbst die Schwelle, ab der etwas als unsicher gilt. Die Gewichte stehen hinter einer Anmeldung. Der Kartentext selbst wird frei ausgeliefert.

  • Dokumentationerreichbar

    Anthropic, Mitigate jailbreaks and prompt injections (externe Seite, platform.claude.com)

    platform.claude.comgeprüft 24.09.2026

    Anthropics Anleitung gegen den Versuch, ein Modell von seinen Vorgaben abzubringen. Der Text behandelt zwei Angreiferbilder in einem Aufwasch: den Menschen davor, der die Regeln umgehen will, und den fremden Text, der über ein Tool hereinkommt. Empfohlen werden ein kleines vorgeschaltetes Modell als Prüfstelle und die ausdrückliche Ansage an das Modell, dass Tool-Ausgaben und abgerufene Dokumente unvertrauenswürdig sind.

  • Dokumentationerreichbar

    GPT-5 System Card (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    OpenAIs Begleitdokument zum Modell, Dokumentdatum 13.08.2025. Der Abschnitt zu Halluzinationen nennt die eigene Messung, nach der das denkende Modell 65 Prozent seltener falsche Tatsachenbehauptungen aufstellt als der Vorgänger, und führt daneben einen Prüfsatz, der ausdrücklich das Enthalten bei unbeantwortbaren Fragen bewertet. Abschnitt 2, Model Data and Training, fasst die Herkunft der Trainingsdaten in einem einzigen Satz zusammen und nennt drei Quellen, wo Googles Modellkarte sieben einzeln aufführt.

    Archivfassung (externe Seite, web.archive.org)

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.