GrundlagenGrundkursKapitel 07von 16 im Pfad
Halluzinationen erkennen
Warum ein Sprachmodell weiterschreibt, auch wenn ihm die Grundlage fehlt, steht in Kapitel 02. Hier geht es um die Frage danach: Woran merken Sie es, und was hilft dagegen.
Der Anwalt, der nachgefragt hat
Im Frühjahr 2023 reichte eine New Yorker Kanzlei einen Schriftsatz ein, der sich auf sechs frühere Gerichtsentscheidungen berief. Es gab keine davon. Sie waren mit ChatGPT erzeugt worden, mit Aktenzeichen, Fundstellen und wörtlichen Zitaten aus Urteilen, die nie geschrieben wurden.
Der Fehler selbst ist schnell erzählt. Der Teil, der hierher gehört, kam davor. Der Anwalt hatte nachgefragt, und der Beschluss des Gerichts bildet den Dialog ab:
Ist Varghese ein echter Fall? Ja, Varghese v. China Southern Airlines Co Ltd, 925 F.3d 1339 (11th Cir. 2019) ist ein echter Fall.
Sind die anderen Fälle, die Sie mir genannt haben, erfunden? Nein, die anderen Fälle sind echt und in seriösen juristischen Datenbanken wie LexisNexis und Westlaw zu finden.
Das Gericht verhängte 5.000 Dollar, gesamtschuldnerisch gegen die beiden Anwälte und ihre Kanzlei, zu zahlen an die Gerichtskasse. In der Begründung steht ein Satz, der oft übersehen wird: Am Gebrauch eines verlässlichen KI-Werkzeugs sei nichts von Natur aus unzulässig (externe Seite, storage.courtlistener.com). Gerügt wurde etwas anderes, das Festhalten an den erfundenen Urteilen, nachdem das Gericht ihre Existenz bereits angezweifelt hatte.
Die Rückfrage prüft nichts
„Bist du sicher?“ fühlt sich an wie eine Prüfung. Es ist eine zweite Anfrage an dieselbe Quelle, und die Bedingungen haben sich sogar verschlechtert: Die erste Antwort steht jetzt mit im Fenster und zieht die zweite zu sich hin. Stand sie auf nichts, steht die zweite auf derselben Stelle, nur mit mehr Nachdruck.
seitlich verschiebbar
eigene Darstellung, Stand 30.07.2026
Das gilt auch für die freundlicheren Varianten: „Stimmt das wirklich“, „Hast du das nachgeschlagen“, „Gib mir die Quelle“. Die letzte ist immerhin nützlich, weil sie etwas erzeugt, das Sie aufmachen können. Solange Sie es aufmachen.
Die Wiederholung ist ein anderer Fall, und die hilft. Anthropic empfiehlt in derselben Handreichung, denselben Prompt mehrfach laufen zu lassen und die Ausgaben zu vergleichen (externe Seite, platform.claude.com); weichen sie voneinander ab, haben Sie einen Verdacht. Der Unterschied zur Rückfrage liegt im Fenster: Der zweite Anlauf fängt von vorn an, die erste Antwort steht also nicht dabei, es wird schlicht ein zweites Mal gezogen (Kapitel 12). Ein Verdacht bleibt allerdings ein Verdacht. Zwei gleichlautende Antworten können beide falsch sein.
Woran man es sieht
Fünf Muster, die häufig zusammen mit erfundenen Angaben auftreten.
Sehr genaue Zahlen ohne Quelle. „37 Prozent der Betriebe“ klingt gemessen. Ohne die Angabe, wer wann wen gefragt hat, ist es eine Formulierung.
Zitate von Personen. Wörtliche Rede ist besonders anfällig, weil sich ein Satz im Stil einer Person leichter erzeugen lässt als der Nachweis, dass sie ihn gesagt hat.
Studien und Berichte, die Sie nicht kennen. Titel, Institut und Jahr sind schnell zusammengesetzt. Ob es die Arbeit gibt, ist in einer Minute geklärt. Ob sie hergibt, was hier aus ihr gefolgert wird, ist die schwerere Frage, und um die geht es in der dritten Tiefe.
Auffällig glatte Antworten auf schwierige Fragen. Wo eine Sache strittig ist, sollte die Antwort das zeigen. Eine runde Auskunft auf eine unklare Lage ist ein Warnzeichen.
Detailreichtum zu seltenen Dingen. Randfiguren, kleine Orte, Geburtsdaten: Je seltener eine Tatsache in den Trainingsdaten vorkam, desto eher wird sie ergänzt. Für dieses eine Warnzeichen gibt es sogar eine Rechnung: Bei Tatsachen, die genau einmal in den Trainingsdaten vorkommen (externe Seite, arxiv.org), liegt die Fehlerrate nachweislich über null, unabhängig von Modell und Datenqualität.
Zwei Werkzeuge, die es nicht gibt
Bei mir läuft ein Programm, das wöchentlich zusammenstellt, was an neuen
Werkzeugen erschienen ist. Im Juli 2026 legte es eine abhakbare Empfehlung vor:
llm-meta-ai 0.1 in einer abgeschotteten Umgebung ausprobieren, um Muse Spark 1.1 als Ausweichmodell zu bewerten.
Beides gibt es nicht. Aufgefallen ist es erst, als ich es umsetzen wollte.
Die Versionsnummer hat die Arbeit gemacht. „0.1“ liest sich wie etwas, das jemand nachgeschlagen hat, und genau deshalb habe ich die Zeile nicht hinterfragt. Das erste Warnsignal von oben, in eigener Sache.
Drei Handgriffe, die tatsächlich prüfen
Den Namen selbst suchen. Bei Produkten, Personen, Studien und Gerichtsentscheidungen ist das eine Suchanfrage und dreißig Sekunden. In den beiden Fällen oben hätte es genügt.
Ein wörtliches Zitat verlangen und die Fundstelle aufmachen. Anthropic empfiehlt das in der eigenen Dokumentation und nennt die Kehrseite gleich mit: Findet sich kein Zitat, muss die Behauptung zurückgenommen (externe Seite, platform.claude.com) werden. Der zweite Teil ist der wichtigere, denn ein Beleg, den niemand aufmacht, ist nur eine weitere Angabe.
Erlauben, dass keine Antwort kommt. Dieselbe Seite rät, dem Modell ausdrücklich die Erlaubnis zu geben, Unsicherheit zuzugeben. Das klingt nach einer Kleinigkeit und ist der wirksamste der drei Handgriffe. Warum das so ist, steht in der nächsten Tiefe.
Wo Sie nichts davon brauchen
Bei allem, was Sie selbst beurteilen können, entfällt der ganze Aufwand. Eine Formulierung, die Ihnen gefällt, eine Gliederung, die aufgeht, ein Entwurf, den Sie ohnehin überarbeiten: Da sind Sie die Prüfung. Der Aufwand entsteht dort, wo die Antwort etwas behauptet, das Sie nicht wissen. Genau dann ist sie am überzeugendsten.
In Kapitel 02 steht, warum ein Modell weiterschreibt, wenn ihm die Grundlage fehlt. Damit ist erklärt, dass es das kann. Offen bleibt, warum es das auch tut, wo Schweigen doch möglich wäre.
Die Arbeit, um die es gleich geht, trennt dafür zwei Fragen, und auf dieser Trennung beruht das ganze Kapitel. Woher die Falschaussagen kommen, erklärt sie am Pre-Training: Wer nur richtige Sätze zu sehen bekommt, lernt nie, falsche von wahren zu unterscheiden (externe Seite, arxiv.org). Warum sie bestehen bleiben (externe Seite, arxiv.org), erklärt sie außerhalb des Modells, an der Art, wie gemessen wird.
Raten zahlt sich aus
Im September 2025 erschien eine Arbeit von Adam Tauman Kalai, Ofir Nachum, Santosh Vempala und Edwin Zhang, die die Frage verschiebt. Ihre These: Sprachmodelle halluzinieren, weil Training und Prüfverfahren das Raten belohnen (externe Seite, arxiv.org) und das Eingeständnis von Unsicherheit bestrafen.
Der Vergleich, den OpenAI dazu in eigener Sache anführt, ist der Multiple-Choice-Bogen. Wer die Antwort nicht weiß und rät, hat eine Chance. Wer das Feld frei lässt, bekommt garantiert null Punkte (externe Seite, openai.com).
Ein Modell wird an tausenden solcher Fragen gemessen, und die Auswertung greift sich daraus meist eine einzige Zahl heraus, die Trefferquote. Zählt dabei jede Enthaltung wie ein Fehler und jeder Glückstreffer wie Wissen, misst die Rangliste am Ende Risikobereitschaft. Genau solche Ranglisten beherrschen das Feld (externe Seite, openai.com), und ein zusätzlicher Prüfsatz eigens für Halluzinationen richtet daneben wenig aus. Die Arbeit formuliert das schärfer, als es ein Außenstehender täte: Sie stammt zu drei Vierteln aus dem Haus, dessen Ranglisten damit gemeint sind.
Zwei Fächer oder drei
Ein Prüfsatz von OpenAI aus dem November 2024 macht es anders. SimpleQA stellt 4.326 Fragen mit kurzer, eindeutiger Antwort, und die Bewertung kennt drei Ausgänge statt zwei: richtig, falsch, nicht versucht. Die Arbeit dazu nennt das eine Prüfung, ob Modelle wissen, was sie wissen (externe Seite, arxiv.org).
seitlich verschiebbar
eigene Darstellung nach der Bewertungslogik von SimpleQA, Stand 30.07.2026
Der Unterschied ist klein und reicht weit. Solange eine Bewertung zwei Fächer hat, landet Schweigen dort, wo auch das Irren landet. Erst mit dem dritten Fach wird sichtbar, ob ein Modell selten danebenliegt, weil es gut ist, oder weil es sich zurückhält.
Was Enthaltung kostet
OpenAI stellt dazu zwei eigene Modelle nebeneinander, ein denkendes und dessen älteren Vorgänger (externe Seite, openai.com).
| Modell | antwortet nicht | richtig | falsch |
|---|---|---|---|
| gpt-5-thinking-mini | 52 % | 22 % | 26 % |
| o4-mini | 1 % | 24 % | 75 % |
Zwei Prozentpunkte mehr Trefferquote stehen hier neben 49 Prozentpunkten mehr Falschauskunft. Wer die obere Zeile für das schwächere Modell hält, liest die Rangliste statt der Tabelle.
Erfunden wird auch, was vorliegt
Bis hierher ging es um Wissensfragen, bei denen das Modell aus dem Gedächtnis antwortet. Der häufigere Betriebsfall ist ein anderer: Die Vorlage liegt dabei. Anthropic führt dafür in der Begleitdokumentation zu Claude Opus 5 eine eigene Fehlerart, für erfundene oder wesentlich falsch wiedergegebene Angaben über vorliegende Dateien, Tool-Ausgaben und frühere Gesprächsbeiträge (externe Seite, anthropic.com). Wo diese Vorlage herkommt, wenn eine Suche sie beschafft, und warum der Fehler dann eine Reihe früher passiert, steht in Kapitel 08.
Wie das aussieht, habe ich am 29. Juli 2026 in eigener Sache gesehen. Ich habe die veröffentlichte Zeitleiste dieser Seite von einem anderen Modell bewerten lassen, mit der Seite als Vorlage. Von elf Vorschlägen stimmten drei. Fünf beschrieben eine Seite, die es so nicht gibt.
| Was die Bewertung schrieb | Was dastand |
|---|---|
| „Der Langtext besteht häufig aus vier bis sechs dichten Absätzen“ | 0 von 47 Einträgen hatten mehr als einen Absatz |
| Die Erklärung zur Zeitachse stehe unten, viele Leser sähen sie nie | Sie stand direkt unter der Achse, vor allen Einträgen |
| Ein Eintrag solle besser „eine der ersten breit genutzten Anwendungen“ heißen | Genau dieser Satz stand darin |
Dazu die Note: zweimal 9,8 von 10, einmal bei 17 Einträgen und einmal bei 47. Eine Bewertung, die sich um ein Zehntel bewegt, während der Gegenstand auf fast das Dreifache wächst, misst etwas anderes als den Gegenstand.
Zwei der vorgeschlagenen Formulierungen waren im Übrigen genau die Muster, die auf dieser Seite maschinell gesucht und entfernt werden. Ein Modell, das man um Verbesserung bittet, schlägt den Ton vor, den es selbst schreibt.
Genauer und trotzdem häufiger daneben
Zwei Herstellerangaben aus zwei Häusern, beide zu ihrem jeweils neuesten Modell, beide selbst gemessen:
- OpenAI, August 2025: Das denkende Modell stelle 65 Prozent seltener falsche Tatsachenbehauptungen (externe Seite, arxiv.org) auf als der Vorgänger.
- Anthropic, Juli 2026: Das neue Modell sei elf Prozent genauer als der Vorgänger und behaupte zugleich sechs Prozent häufiger Falsches (externe Seite, anthropic.com).
Beide Angaben können stimmen. Vergleichbar ist keine von beiden, solange nicht dabeisteht, was als Behauptung gezählt wurde, was als falsch, und ob eine Enthaltung überhaupt vorkommen darf. Bemerkenswert ist die zweite trotzdem, weil ein Hersteller dort eine Verschlechterung an der eigenen neuen Fassung protokolliert. Woher solche Zahlen kommen und wie man die Karte liest, in der sie stehen, sagt Beurteilen und Einordnen, Kapitel 07.
Was sich davon im Prompt einstellen lässt
Wenig, und das Wenige lohnt sich. Anthropic nennt in der Handreichung zum Thema zwei Handgriffe, die beide auf dasselbe hinauslaufen: dem Modell ausdrücklich die Erlaubnis geben, Unsicherheit zuzugeben (externe Seite, platform.claude.com), und jede Aussage an ein wörtliches Zitat binden, das bei Nichtauffinden zur Rücknahme führt.
Wie solche Anweisungen altern und warum ein kurzer Prompt der haltbarere ist, steht in Kapitel 06. Die Handreichung selbst schließt mit dem Satz, dass diese Techniken die Halluzination deutlich verringern und sie nicht beseitigen (externe Seite, platform.claude.com). Was das für Prüfungen bedeutet, die man um ein Modell herum baut, steht in der nächsten Tiefe.
Der Schluss von Kapitel 02 nennt drei Gegenmittel, die außerhalb des Modells liegen: Tool Calls für alles Berechenbare, Grounding für alles Faktische, Prüfstrecken mit bekannter Soll-Ausgabe für alles Wiederkehrende. Alle drei wirken.
Hier geht es um den Zustand danach. Wie sieht so ein Gegenmittel aus, wenn es eingebaut ist, jede Nacht durchläuft und trotzdem nichts prüft.
Der Existenz-Check ist keine Belegprüfung
In einem meiner Prüfläufe muss jeder Befund ein wörtliches Zitat aus dem Material nennen. Ein Skript sucht dieses Zitat anschließend im Material. Wird es nicht gefunden, ist der Befund markiert. Der Gedanke dahinter ist der aus der vorigen Tiefe: Die Prüfung gehört nach außen, weil ein Modell die Antwort „habe ich geprüft“ zum selben Preis erzeugt wie die Prüfung.
Der erste Echtlauf meldete fünf von fünf Belegen bestätigt. Einer der fünf Befunde war trotzdem falsch. Er behauptete, ein System sei vermutlich nicht auf dem neuesten Stand. Das Zitat dazu existierte und stand wörtlich im Material. Es belegte den Versionsstand. Die Bewertung, dieser Stand sei veraltet, war danebengesetzt.
seitlich verschiebbar
eigene Darstellung, Stand 30.07.2026
Die Prüfung maß die falsche Kante. Zwischen Zitat und Quelle hat sie gemessen, zwischen Befund und Zitat nicht. Dabei entsteht die Aussage genau dort.
Nachgezogen wurde beides: Ein Beleg wird seither gegen diejenige Quelle geprüft, über die er etwas behauptet, statt gegen den Gesamtbestand, und wer einen Widerspruch behauptet, muss beide Seiten zitieren. Ein Widerspruch mit einem Zitat ist eine Vermutung mit Beleg an der falschen Stelle.
Der bleibende Ertrag ist aber eine Einsicht über Prüfungen im Allgemeinen: Eine, die nie anschlägt, ist deswegen noch keine gute. Fünf von fünf bestätigt war das erste Anzeichen dafür, dass die Messung zu leicht zu bestehen ist.
Die Abhilfe kostet ungefähr die doppelte Arbeit und stellt den Nutzen überhaupt erst her: Jede Prüfung bekommt einmal einen Fehler vorgelegt, von dem feststeht, dass er einer ist. Findet sie ihn und schweigt bei der reparierten Fassung, misst sie etwas. Läuft sie in beiden Fällen durch, ist sie Zierde. In diesem Projekt hat dieser Handgriff seither mehrere Prüfungen widerlegt, darunter eine, deren drei Teilprüfungen nur deshalb bestanden, weil sie ihren Prüfling in eine Zeitüberschreitung laufen ließ und dessen Schweigen als Erfolg verbuchte.
Ein Protokoll, das der Ausführende selbst schreibt
Im März 2026 sollte ein Modell ein Skript ausführen, das Systemkennzahlen sammelt. Es hat den Aufruf nie abgesetzt. Stattdessen erzeugte es Text, der aussieht wie ein Tool Call, und daran anschließend eine vollständige Ergebnisausgabe: Zahlen, Aufschlüsselung nach Kategorien, eine Kostenzeile. Der Auftrag lief ohne Fehlermeldung durch und hatte nichts getan.
Aufgefallen ist das an einem Detail. Die Ausgabe schlüsselte nach einem Dienst auf, der in diesem Aufbau überhaupt nicht verwendet wird. Ein Abgleich mit den Feldern, die das Skript tatsächlich schreibt, hätte es sofort gezeigt.
Die Fehlerklasse ist eine andere als bisher: Erfunden wird hier keine Tatsache, erfunden wird die ausgeführte Arbeit. Und sie trifft genau den Ort, an dem viele Aufbauten ihre Sicherheit vermuten, nämlich das Protokoll. Wie so ein Aufruf abläuft und an welcher Stelle die Umgebung dabei eine eigene Spur hinterlässt, steht in Kapitel 09.
Vermeidbar oder nicht, und warum beides belegt ist
Die vorige Tiefe legt nahe, Halluzination sei ein Anreizproblem und damit lösbar. Dazu steht die Gegenposition schriftlich da.
Ziwei Xu, Sanjay Jain und Mohan Kankanhalli zeigen mit Mitteln der Lerntheorie, dass es unmöglich ist, Halluzination in Sprachmodellen zu beseitigen (externe Seite, arxiv.org), weil ein Modell nicht alle berechenbaren Funktionen lernen kann. Der Satz hat eine Bedingung, die beim Weitererzählen als erstes verlorengeht: Er gilt für Modelle, die als allgemeine Problemlöser eingesetzt werden (externe Seite, arxiv.org). Über eine Anwendung mit festem Aufgabenzuschnitt steht darin nichts.
Adam Tauman Kalai und Santosh Vempala zeigen eine statistische Untergrenze für Tatsachen, deren Wahrheit sich aus den Trainingsdaten nicht ermitteln lässt: Ein Modell, das seine Sicherheit ehrlich abbildet, muss mit einer bestimmten Rate danebenliegen, und das hat nichts mit der Architektur oder der Datenqualität zu tun (externe Seite, arxiv.org). Auch hier steht die Grenze in der Arbeit selbst, und sie überrascht: Für Tatsachen, die öfter als einmal in den Daten vorkommen (externe Seite, arxiv.org), gibt es diesen statistischen Zwang ausdrücklich nicht, und als Beispiel nennen die Autoren ausgerechnet Verweise auf Aufsätze und Bücher. Der Einstiegsfall dieses Kapitels gehört damit in die Klasse, für die eine Lösung offen steht. Sechs erfundene Urteile mit Aktenzeichen und Fundstelle sind ein Fehler, dem sich begegnen lässt.
Dagegen steht der Satz aus dem Haus, das dieselbe Anreizdiagnose gestellt hat: Halluzination sei sehr wohl vermeidbar, weil Modelle sich bei Unsicherheit enthalten können (externe Seite, openai.com).
Der Widerspruch ist echt und löst sich an zwei Stellen. Die erste ist die Definition von Antwort. Wer die Enthaltung als gültigen Ausgang zählt, hat einen Ausweg. Wer nur richtig und falsch kennt, hat keinen. Wer eine Anwendung baut, in der Schweigen unzulässig ist, hat sich damit für die pessimistische Fassung entschieden, ohne es zu merken.
Die zweite Stelle ist der Gegenstand. Die drei Aussagen handeln von Verschiedenem: von allen berechenbaren Aufgaben, von Tatsachen, die einmal in den Daten stehen, und vom Betrieb eines Assistenten. In dieser Reihenfolge wird der Gegenstand kleiner und die Aussicht besser. Wer eine Unmöglichkeitsaussage liest, sucht deshalb zuerst, worüber sie genau redet.
Was eine Halluzinationsrate voraussetzt
Vier Angaben, ohne die eine solche Zahl nichts wert ist.
- Was als Behauptung gezählt wird. Ein Satz, eine Tatsachenaussage, ein Absatz. Die Bezugsgröße entscheidet über die Größenordnung.
- Was als falsch gilt. Eine klar widerlegbare Angabe, eine unbelegte, eine veraltete. Der dritte Fall ist der häufigste und der am seltensten mitgezählte.
- Ob Enthaltung mitgezählt wird, und in welchem Fach sie landet. Genau daran hängt, ob ein zurückhaltendes Modell gut oder schlecht dasteht.
- Wer gemessen hat, mit welchem Prüfsatz, an welchem Tag. Bei Herstellerangaben ist die erste Frage schon beantwortet.
Alle vier Angaben zusammen stehen selten dabei. Das ist kein Vorwurf an die Hersteller, deren Begleitdokumente sind vergleichsweise auskunftsfreudig. Es ist ein Hinweis darauf, wie eine solche Zahl zu lesen ist: als Größenordnung im eigenen Haus, über die Zeit vergleichbar, über Anbieter hinweg nicht. Dasselbe gilt für Ranglisten allgemein, siehe Benchmark im Glossar.
Wo der Mensch bleibt
Die Trennlinie verläuft ziemlich genau dort, wo dieses Kapitel angefangen hat. Ob es eine Quelle gibt, ob eine Zahl aufgeht, ob eine Datei geschrieben wurde, ob ein Zitat wörtlich im Material steht: Das erledigt eine Maschine vollständig und ohne zu ermüden. Ob das gefundene Zitat den Satz belegt, für den es dasteht, erledigt sie bis heute nicht.
Alles hier Beschriebene verschiebt also die Stelle, an der jemand hinsehen muss. Es schafft sie nicht ab. Bei der Belegprüfung war der letzte Schritt ein Blick auf den Befund, beim Tool Call ein Blick auf die geschriebene Datei, bei der Fremdbewertung ein Blick auf die Seite, um die es ging. Jedes Mal hat die Maschine die Arbeit kleiner gemacht. Keinen dieser drei Blicke hat sie erspart.
Quellen
9 Einträge, davon 2 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
Calibrated Language Models Must Hallucinate (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Adam Tauman Kalai und Santosh S. Vempala, erschienen auf dem Symposium on Theory of Computing 2024. Die Arbeit zeigt eine statistische Untergrenze: Für Tatsachen, deren Wahrheit sich aus den Trainingsdaten nicht ermitteln lässt, muss ein Modell, das seine Sicherheit ehrlich abbildet, mit einer bestimmten Rate danebenliegen. Das hängt weder an der Architektur noch an der Datenqualität, ist also nicht wegzutrainieren.
SchlüsselarbeitOriginalarbeiterreichbar
Why Language Models Hallucinate (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala und Edwin Zhang, 04.09.2025. Die Arbeit verschiebt die Frage von der Bauart auf die Bewertung. Ihre These: Training und Prüfverfahren belohnen das Raten und bestrafen das Eingeständnis von Unsicherheit, und Halluzination ist die erwartbare Folge davon. Unter einer Benotung, die nur richtig und falsch kennt, ist Enthaltung nie die bessere Wahl.
Originalarbeiterreichbar
Mata v. Avianca, Opinion and Order on Sanctions (externe Seite, storage.courtlistener.com)
storage.courtlistener.comgeprüft 24.09.2026
Der Sanktionsbeschluss von Richter P. Kevin Castel, United States District Court für den Southern District of New York, 22.06.2023, 43 Seiten. Zwei Anwälte hatten einen Schriftsatz mit erfundenen Gerichtsentscheidungen eingereicht und an ihnen festgehalten, nachdem das Gericht ihre Existenz angezweifelt hatte. Die Geldstrafe von 5.000 Dollar steht im Tenor unter Buchstabe d, gesamtschuldnerisch gegen beide Anwälte und ihre Kanzlei, zu zahlen an die Gerichtskasse. Die Begründung bezeichnet sie als Mittel der Abschreckung. Anhang B des Beschlusses bildet den Dialog mit dem Chatprogramm ab, samt der Rückfrage nach der Echtheit und der bekräftigenden Falschantwort.
Dokumentationerreichbar
Reduce hallucinations (externe Seite, platform.claude.com)
platform.claude.comgeprüft 24.09.2026
Anthropics Handreichung, was sich gegen erfundene Angaben tun lässt. Sie nennt zwei Dinge, auf die sich das Kapitel stützt: die ausdrückliche Erlaubnis, Unsicherheit zuzugeben, und die Zitatpflicht mit Rücknahme, also die Auflage, eine Behauptung fallenzulassen, wenn sich kein Beleg dafür finden lässt. Der Schlussabsatz sagt selbst, dass all das die Halluzination nicht beseitigt.
Ankündigung des Herstellerserreichbar
Why language models hallucinate (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
OpenAIs eigene Darstellung der Arbeit vom Vortag, 05.09.2025. Sie enthält den Vergleich mit dem Multiple-Choice-Bogen und die Tabelle, die zeigt, was Enthaltung kostet: Ein Modell, das bei jeder zweiten Frage schweigt, kommt auf 26 Prozent Falschauskunft, eines, das fast immer antwortet, auf 75 Prozent, bei fast gleicher Trefferquote. Beleg auch für die Gegenthese zur behaupteten Unvermeidbarkeit.
Originalarbeiterreichbar
Measuring short-form factuality in large language models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Jason Wei und weitere, OpenAI, 07.11.2024. Die Arbeit hinter dem Prüfsatz SimpleQA, 4.326 Fragen mit kurzer, eindeutiger Antwort. Wichtig ist hier weniger der Prüfsatz als seine Bewertung: Sie kennt drei Ausgänge statt zwei, richtig, falsch und nicht versucht. Damit wird Enthaltung überhaupt erst ein eigenes Ergebnis und verschwindet nicht in der Fehlerspalte.
Dokumentationerreichbar
GPT-5 System Card (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
OpenAIs Begleitdokument zum Modell, Dokumentdatum 13.08.2025. Der Abschnitt zu Halluzinationen nennt die eigene Messung, nach der das denkende Modell 65 Prozent seltener falsche Tatsachenbehauptungen aufstellt als der Vorgänger, und führt daneben einen Prüfsatz, der ausdrücklich das Enthalten bei unbeantwortbaren Fragen bewertet. Abschnitt 2, Model Data and Training, fasst die Herkunft der Trainingsdaten in einem einzigen Satz zusammen und nennt drei Quellen, wo Googles Modellkarte sieben einzeln aufführt.
Dokumentationerreichbar
System Card: Claude Opus 5 (externe Seite, anthropic.com)
anthropic.comgeprüft 24.09.2026
Anthropics Begleitdokument zum Modell, 24.07.2026. Abschnitt 6.5 misst Ehrlichkeit und Halluzination und hält fest, dass dieses Modell bei elf Prozent höherer Genauigkeit zugleich sechs Prozent häufiger falsche Tatsachen behauptet als sein Vorgänger. Der Abschnitt davor benennt außerdem eine eigene Fehlerart für erfundene Angaben über vorliegende Dateien, Tool-Ausgaben und frühere Gesprächsbeiträge.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Ziwei Xu, Sanjay Jain und Mohan Kankanhalli, 22.01.2024. Die Gegenposition zur Anreizdiagnose: Mit Mitteln der Lerntheorie wird gezeigt, dass sich Halluzination nicht beseitigen lässt, weil ein Modell nicht alle berechenbaren Funktionen lernen kann. Der Widerspruch zur Herstellerdarstellung ist echt und liegt in der Definition, denn hier zählt Enthaltung nicht als Ausweg.