Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenKI-WissenKapitel 06von 14 im Pfad

NLP vor den Sprachmodellen

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Grundkurs, Kapitel 03 sagt, dass die heutige Zerlegung eines Textes Grenzen zieht, die quer zu allem liegen, was ein Linguist ziehen würde. Wie ein Linguist zerlegt hat, sagt es nicht. Grundkurs, Kapitel 04 beginnt damit, dass jedes Token eine Reihe von Zahlen bekommt, und sagt nicht, wie Text davor zu Zahlen wurde.

Dazwischen liegen dreißig Jahre. Dieses Kapitel handelt von ihnen.

Vom Gesprächssystem als Produkt handelt es dabei nicht. Wie ein Chatbot vor den Sprachmodellen aufgebaut war, mit Absichtsliste und vorformulierten Antworten, steht in Conversational AI, Kapitel 01. Hier geht es um die Verfahren darunter.

Ein Programm, das Verständnis vortäuschte

Am Anfang steht ein Programm, das bis heute erklärt, warum Menschen Maschinen Verstehen zuschreiben. Eine Arbeit von 2025, die den Originalausdruck im Nachlass wiederfand, ordnet es so ein:

ELIZA, created by Joseph Weizenbaum at MIT in the early 1960s, is usually considered the world’s first chatbot. (externe Seite, arxiv.org)

Das Programm arbeitete mit Wortmustern. Es suchte in der Eingabe nach Schlüsselwörtern, wählte dazu eine vorbereitete Satzschablone und setzte Teile der Eingabe hinein. Aus „Ich habe Angst vor meinem Vater“ wurde damit „Erzählen Sie mir mehr über Ihren Vater“. Eine Darstellung von Bedeutung gab es nirgends im Programm.

Der Fund, auf dem die Arbeit von 2025 beruht, zeigt zugleich, wie wenig davon lange gesichert war:

We discovered an original ELIZA printout in Prof. Weizenbaum’s archives at MIT, including an early version of the famous DOCTOR script, a nearly complete version of the MAD-SLIP code, and various support functions in MAD and FAP. (externe Seite, arxiv.org)

Wichtig für alles Folgende ist die Beobachtung, die Weizenbaum an seinen Benutzern machte. Sie führten Gespräche mit einem Programm, das nichts verstand, und sie schrieben ihm trotzdem Verständnis zu. Warum ein solches Programm damals als Schritt zu einer denkenden Maschine gelesen wurde, steht in Kapitel 11.

Regeln, die jemand aufgeschrieben hat

Nach ELIZA folgte die Zeit der Regelwerke. Ein Verfahren bekam eine Grammatik, ein Wörterbuch und eine Liste von Umformungen, alles von Hand geschrieben. Damit ließen sich Sätze zerlegen, Wortarten bestimmen und einfache Fragen beantworten.

Dass diese Arbeit schwerer ist, als sie klingt, sagt heute noch die Dokumentation der gebräuchlichsten Programmbibliothek für dieses Fach:

Even splitting text into useful word-like units can be difficult in many languages. (externe Seite, spacy.io)

Schon das Zerlegen also. Für jede weitere Sprache begann die Arbeit von vorn, und ein Regelwerk, das Zeitungstexte beherrschte, scheiterte an gesprochener Sprache.

Aus Wörtern werden Zahlen, durch Zählen

Ab den 1990er Jahren übernahm eine andere Herangehensweise. Statt Regeln aufzuschreiben, wurden Häufigkeiten gezählt. Der Übergang von Text zu Zahlen, der jedem heutigen Verfahren zugrunde liegt, sieht in seiner ältesten Form so aus:

We call vectorization the general process of turning a collection of text documents into numerical feature vectors. (externe Seite, scikit-learn.org)

Der einfachste Fall zählt für jedes Wort des Wortschatzes, wie oft es im Text vorkommt. Ein Dokument wird damit zu einer sehr langen Zahlenreihe, in der fast überall eine Null steht. Was dabei verlorengeht, benennt dieselbe Seite ausdrücklich:

Documents are described by word occurrences while completely ignoring the relative position information of the words in the document. (externe Seite, scikit-learn.org)

Die Reihenfolge fällt also weg. „Der Hund beißt den Mann“ und „Der Mann beißt den Hund“ ergeben dieselbe Zahlenreihe. Das ist die Grenze dieser ganzen Epoche, und sie ist an dieser einen Stelle eingebaut.

Warum das häufigste Wort das nutzloseste ist

Beim reinen Zählen gewinnen die Wörter, die überall stehen. Die Dokumentation erklärt, warum das die Rechnung verdirbt:

If we were to feed the direct count data directly to a classifier those very frequent terms would shadow the frequencies of rarer yet more interesting terms. (externe Seite, scikit-learn.org)

Die Antwort darauf ist eine Gewichtung: Ein Wort wiegt umso mehr, je seltener es über alle Dokumente hinweg ist. Ein Wort wie „und“ kommt überall vor und unterscheidet nichts, ein Fachbegriff kommt in fünf von tausend Dokumenten vor und unterscheidet viel.

Diese Gewichtung ist die Grundlage der Volltextsuche, und sie arbeitet bis heute. In der Suche über eine Wissensbasis steht sie neben dem Vergleich von Zahlenreihen, siehe Agenten und Harness, Kapitel 03.

Die Vorarbeiten am Wort

Vor dem Zählen lagen mehrere Schritte, die jede Anwendung selbst erledigen musste. Sie haben eigene Namen, und sie stecken heute in der Zerlegung eines Sprachmodells oder fallen ganz weg.

Zerlegen. Den Text in Wörter schneiden. Was daraus geworden ist, steht in Grundkurs, Kapitel 03.

Grundform bilden. „Ging“, „gegangen“ und „geht“ auf „gehen“ zurückführen, damit die Zählung sie zusammenfasst. Die Dokumentation beschreibt den zugrunde liegenden Vorgang so:

Inflectional morphology is the process by which a root form of a word is modified by adding prefixes or suffixes that specify its grammatical function but do not change its part-of-speech. (externe Seite, spacy.io)

Wortart bestimmen. Für jedes Wort festlegen, ob es Substantiv, Verb oder Adjektiv ist. In Tiefe 3 steht, warum gerade dieser Schritt der Kette gefährlich wurde.

Eigennamen finden. Personen, Orte und Firmen aus dem Fließtext ziehen. Diese Aufgabe gibt es weiterhin als eigenes Werkzeug:

spaCy features an extremely fast statistical entity recognition system, that assigns labels to contiguous spans of tokens. (externe Seite, spacy.io)

Woran Sie ein Verfahren dieser Art erkennen

Zählt es Wörter? Dann kennt es keine Reihenfolge, und Verneinungen fallen durch.

Braucht es je Aufgabe eigenes Material? Übersetzen, Zusammenfassen und Einordnen waren getrennte Verfahren mit getrennten Datensammlungen.

Nennt es die Wortart oder die Grundform? Dann läuft dahinter eine Kette von Schritten, und jeder davon kann fehlgehen.

Alle drei Merkmale beschreiben eine Welt, in der ein System aus vielen austauschbaren Teilen bestand. Was daraus wurde, steht in Tiefe 2.

Quellen

7 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Originalarbeiterreichbar

    ELIZA Reanimated: The world's first chatbot restored on the world's first time sharing system (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Lane, Hay, Schwarz, Berry und Shrager berichten 2025, wie sie einen Originalausdruck von ELIZA in Joseph Weizenbaums Nachlass am MIT fanden und das Programm auf einem nachgebauten Rechner jener Zeit wieder zum Laufen brachten. Diese Quelle steht hier auch stellvertretend für Weizenbaums Arbeit von 1966: Deren Verlagsseite weist jeden Abruf ab, ein Zitat daraus wäre also dauerhaft ungeprüft.

  • Dokumentationerreichbar

    scikit-learn, Feature extraction (externe Seite, scikit-learn.org)

    scikit-learn.orggeprüft 24.09.2026

    Die Dokumentation beschreibt im Wortlaut, wie aus einer Sammlung von Texten Zahlenreihen werden: zerlegen, zählen, gewichten. Sie benennt dabei die Eigenschaft, an der dieses Verfahren seine Grenze hat, nämlich dass die Stellung der Wörter im Text vollständig entfällt.

  • Dokumentationerreichbar

    spaCy, Linguistic Features (externe Seite, spacy.io)

    spacy.iogeprüft 24.09.2026

    Die Dokumentation der heute gebräuchlichsten Programmbibliothek für Sprachverarbeitung. Sie beschreibt die Arbeitsschritte, die vor den Sprachmodellen jede Anwendung selbst erledigen musste: zerlegen, Grundformen bilden, Wortarten bestimmen, Eigennamen finden.

  • Dokumentationerreichbar

    Natural Language Processing with Python, Kapitel 5: Categorizing and Tagging Words (externe Seite, nltk.org)

    nltk.orggeprüft 24.09.2026

    Das Lehrbuch zur Programmbibliothek NLTK, das die klassische Verarbeitungskette Schritt für Schritt vorführt. Kapitel 5 ordnet die Wortartenbestimmung als zweiten Schritt hinter der Zerlegung ein und beschreibt sie als Einordnung, deren Entscheidung an jeder Stelle vom Umfeld abhängt.

  • Originalarbeiterreichbar

    Sequence to Sequence Learning with Neural Networks (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Sutskever, Vinyals und Le zeigen 2014, dass sich eine Wortfolge ohne jede Grammatikregel in eine andere übersetzen lässt, indem ein Netz sie in einen Vektor fester Länge presst und ein zweites daraus wieder Text macht. Die Arbeit nennt den Vergleichswert des damals üblichen statistischen Verfahrens und ist damit der Beleg für beide Epochen in einem Satz.

  • Originalarbeiterreichbar

    Term Weighting Approaches in Automatic Text Retrieval (externe Seite, ecommons.cornell.edu)

    ecommons.cornell.edugeprüft 24.09.2026

    Gerard Salton und Chris Buckley fassen 1987 zwanzig Jahre Arbeit an der Frage zusammen, wie schwer ein einzelnes Wort in einem Text wiegen soll. Der Bericht ist die Herkunft der Gewichtung, die heute als TF-IDF bekannt ist. Im Abstract fehlt einmal ein Leerzeichen zwischen zwei Wörtern, der erste Satz ist deshalb nicht zitierfähig.

  • Originalarbeiterreichbar

    xLSTM: Extended Long Short-Term Memory (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Sepp Hochreiter, einer der beiden Urheber des LSTM von 1997, ordnet 2024 die eigene Bauform selbst ein: was sie leistete, wofür sie stand und woran sie den Anschluss verlor. Diese Quelle steht hier auch für die Arbeit von 1997, deren Verlagsseite jeden Abruf abweist.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.