Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenGrundkursKapitel 04von 16 im Pfad

Embedding, Bedeutung als Zahlenreihe

Tiefe 1: Überblick · Lesezeit 7 Min. · Stand

Im vorigen Kapitel wurde Text in Token zerlegt und jedes Token bekam eine Nummer aus dem Vokabular. Diese Nummer ist eine Adresse und sonst nichts. Das Token ·Katze hat vielleicht die 168947, ·Hund die 74312. Aus den beiden Zahlen folgt nichts: Sie sind nicht ähnlicher als 3 und 4, obwohl die Wörter es sind.

Damit ein Modell überhaupt etwas mit Sprache anfangen kann, braucht es eine Darstellung, in der Ähnlichkeit sichtbar wird. Diese Darstellung heißt Embedding.

Aus einer Nummer wird eine Reihe

Jedes Token bekommt eine Reihe von Zahlen zugeordnet, und zwar einige hundert bis einige tausend. Wie viele es sind, legt das jeweilige Modell fest. Eine allgemein gültige Zahl gibt es nicht. Die Beispiele hier rechnen mit 3072, weil Googles Embedding-Modell von dieser Länge ausgeht (externe Seite, blog.google).

Aus einem Token wird eine Zahlenreihe und daraus ein Punkt in einem Raum, in dem ähnlich verwendete Wörter beieinanderliegen. 1 · Ein Token ·Katze Nummer 168947 im Vokabular. 2 · Die Zahlenreihe 0,021 −0,114 0,396 … 3072 Zahlen in diesem Beispiel, je nach Modell mehr oder weniger. Gelernt, nicht gesetzt. 3 · Ein Punkt im Raum Katze Hund Hamster Auto Laster Zwei Achsen statt 3072: Die Lage ist eine Projektion. Die Nähe ist echt. Was ähnlich verwendet wird, liegt beieinander.

seitlich verschiebbar

Vom Token zum Punkt im Raum. Die Zahlen sind Beispielwerte, die Anordnung rechts ist eine Projektion auf zwei Achsen.

eigene Darstellung, Stand 28.07.2026

Eine Reihe aus 3072 Zahlen ist ein Punkt in einem Raum mit 3072 Richtungen. Das kann sich niemand vorstellen, und man muss es auch nicht. Was zählt, ist eine einzige Eigenschaft dieses Raums: Abstand bedeutet etwas.

Wörter, die in Texten ähnlich verwendet werden, landen an ähnlichen Stellen. Katze, Hund und Hamster liegen beieinander, Auto und Laster liegen woanders beieinander, und zwischen den beiden Gruppen ist es weit.

Woher die Zahlen kommen

Niemand hat sie eingetragen. Sie entstehen beim Training, dessen Ablauf in KI-Wissen, Kapitel 02 steht, und zwar aus einer einzigen, sehr einfachen Beobachtung: Wörter, die in ähnlichen Zusammenhängen vorkommen, bedeuten meistens Ähnliches. Wer Millionen Sätze sieht, in denen „Katze“ und „Hund“ an vergleichbaren Stellen stehen, kann beiden ähnliche Zahlen geben, ohne je erfahren zu haben, was ein Tier ist.

Das ist alt. Die Arbeit, die es 2013 praktisch gemacht hat, heißt Efficient Estimation of Word Representations in Vector Space (externe Seite, arxiv.org) und brauchte für ihre Zeit erstaunlich wenig Rechenleistung. Berühmt wurde die Beobachtung, dass man mit diesen Vektoren rechnen kann: König minus Mann plus Frau landet in der Nähe von Königin. Sie stammt aus einer Vorarbeit derselben Gruppe, die die Arbeit von 2013 in ihrer Einleitung zitiert (externe Seite, arxiv.org); ihr eigener Beitrag ist der Testsatz, mit dem sich solche Rechnungen erstmals systematisch messen ließen.

Dieser Rechentrick wird bis heute gern vorgeführt. Er funktioniert bei den Wortvektoren von damals ordentlich und bei heutigen Modellen nur noch eingeschränkt, weil dort die Bedeutung vom Satz abhängt. Was bleibt, ist die Grundidee: Bedeutung als Lage im Raum.

Wozu das gut ist

Drei Dinge, die ohne Embeddings nicht gingen.

Suchen nach Sinn statt nach Wörtern. Wer „Wie storniere ich meine Bestellung?“ eingibt, findet auch den Abschnitt „Widerruf und Rücksendung“, in dem keines der Wörter aus der Frage vorkommt. Gesucht wird nach nahen Punkten, nicht nach gleichen Zeichenketten.

Eigene Dokumente nutzbar machen. Genau darauf beruht das Verfahren, mit dem Sprachmodelle Fragen zu Firmenunterlagen beantworten: Die Unterlagen werden in Abschnitte zerlegt, jeder Abschnitt bekommt seine Zahlenreihe, und zur Frage werden die nächstliegenden Abschnitte herausgesucht und dem Modell vorgelegt. Es ist einer der drei Wege, auf denen Neues in ein Modell kommt, und die stehen in Kapitel 08.

Sortieren und Gruppieren. Tausend Rückmeldungen lassen sich zu Häufungen zusammenfassen, ohne dass jemand vorher Kategorien festlegt. Die Häufungen sind Punktwolken.

Die Grenze, die man kennen muss

Nähe im Raum ist Ähnlichkeit der Verwendung. Sie ist keine Wahrheit und kein Urteil. „Der Vertrag wurde gekündigt“ und „Der Vertrag wurde nicht gekündigt“ liegen sehr nah beieinander, denn sie handeln von derselben Sache und unterscheiden sich in einem Wort.

Wer eine Suche über Embeddings baut, bekommt deshalb thematisch passende Treffer, keine inhaltlich richtigen. Der Unterschied klingt spitzfindig und ist im Betrieb der häufigste Grund für falsche Antworten aus einer Wissensbasis.

Wie ein Modell diese Zahlen bekommt und warum es dafür oft ein zweites, eigenes Modell braucht, steht in der nächsten Tiefe.

Quellen

8 Einträge, davon 2 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    Efficient Estimation of Word Representations in Vector Space (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Mikolov und Kollegen zeigen am 16.01.2013, dass sich Wörter als Punkte in einem Zahlenraum darstellen lassen, in dem ähnliche Wörter beieinanderliegen, und dass sich diese Vektoren auf sehr großen Textmengen billig lernen lassen. Der Ursprung dessen, was heute Embedding heißt. Die berühmte Rechnung König minus Mann plus Frau steht in der Einleitung, dort aber als fremder Befund: eingeleitet mit „it was shown for example“ und belegt mit Referenz 20, also Mikolov, Yih und Branch, NAACL 2013. Der eigene Beitrag dieser Arbeit ist der Testsatz, mit dem sich solche Rechnungen erstmals systematisch messen ließen. Ohne hinterlegtes Zitat dazu, weil die Stelle im Volltext steht und der Prüflauf die Abstract-Seite liest.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Attention Is All You Need (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Arbeit, mit der alles anfing. Vaswani und sieben Mitautoren stellen am 12.06.2017 die Transformer-Architektur vor und zeigen, dass ein Netz allein über den Mechanismus der Aufmerksamkeit auskommt, ohne die bis dahin übliche schrittweise Verarbeitung. Erst dadurch ließen sich Modelle sinnvoll auf viele Rechenkerne verteilen. Jedes GPT, jedes Claude und jedes Gemini steht auf dieser Arbeit. Abschnitt 3.2.3 hält die Einschränkung fest, die für alle fortsetzenden Modelle gilt: „self-attention layers in the decoder allow each position in the decoder to attend to all positions in the decoder up to and including that position“, dazu die Begründung „We need to prevent leftward information flow in the decoder to preserve the auto-regressive property“. Beide Stellen stehen im Volltext und sind deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.

    Archivfassung (externe Seite, web.archive.org)

  • Ankündigung des Herstellerserreichbar

    Gemini Embedding 2: Our first natively multimodal embedding model (externe Seite, blog.google)

    blog.googlegeprüft 24.09.2026

    Die Ankündigung von Google vom 10.03.2026. Nennt die Modalitäten, den gemeinsamen Vektorraum, über 100 Sprachen und die frei wählbare Länge der Zahlenreihe ab 3072 abwärts.

  • Originalarbeiterreichbar

    Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Reimers und Gurevych zeigen am 27.08.2019, wie aus einem Sprachmodell ein Suchwerkzeug wird: Zwei Kopien desselben Netzes werden so trainiert, dass zusammengehörige Sätze im Raum nah beieinander landen, und der Vergleich läuft danach über den Kosinus. Die Zusammenfassung fängt mit dem Lob für BERT an und beziffert erst danach, warum die Arbeit nötig war: 65 Stunden gegen 5 Sekunden für dieselbe Suche. Wer den Satz über die Untauglichkeit ohne diese beiden Zeilen zitiert, macht aus einer Kostenaussage ein Unvermögen. Zur Frage, wie aus vielen Token-Vektoren einer für den ganzen Abschnitt wird, steht die Antwort in Abschnitt 3: „We experiment with three pooling strategies: Using the output of the CLS-token, computing the mean of all output vectors (MEAN-strategy), and computing a max-over-time of the output vectors (MAX-strategy). The default configuration is MEAN.“ Diese Stelle steht im Volltext und ist deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.

  • Originalarbeiterreichbar

    Matryoshka Representation Learning (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Das Verfahren hinter den kürzbaren Embeddings: Die Zahlenreihe wird so trainiert, dass schon ihr Anfang für sich brauchbar ist. Wer Speicher sparen will, schneidet hinten ab, statt ein zweites Modell zu betreiben. Grundlage der frei wählbaren Dimensionszahl heutiger Embedding-Dienste.

  • Originalarbeiterreichbar

    Learning Transferable Visual Models From Natural Language Supervision (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    CLIP, eingereicht am 26.02.2021. Der Beleg dafür, dass Bild und Text lange vor den heutigen multimodalen Modellen in einem gemeinsamen Raum lagen: Ein Bild- und ein Textnetz werden gleichzeitig darauf trainiert, dass zusammengehörige Paare denselben Platz bekommen. Abschnitt 2.3 sagt es wörtlich: „CLIP learns a multi-modal embedding space by jointly training an image encoder and text encoder to maximize the cosine similarity of the image and text embeddings“. Diese Stelle steht im Volltext und ist deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.

  • Originalarbeiterreichbar

    Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die technische Arbeit zum ersten Embedding-Modell, das Text, Bild, Ton und Video in denselben Zahlenraum legt, eingereicht am 26.05.2026. Beschreibt das kontrastive Training über mehrere Stufen und die Messungen für die Suche innerhalb und über Medienarten hinweg.

  • Originalarbeiterreichbar

    Text Embeddings Reveal (Almost) As Much As Text (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Morris und Mitautoren zeigen am 10.10.2023, dass sich aus einem Text-Embedding der Text zurückgewinnen lässt, der es erzeugt hat. Ihr Verfahren bettet einen Versuch ein, vergleicht und bessert nach, und trifft bei Eingaben von 32 Token in 92 Prozent der Fälle den Wortlaut. Aus einem Bestand klinischer Notizen holten sie Klarnamen zurück. Der Beleg gegen die verbreitete Annahme, ein Vektorindex sei eine Art Anonymisierung. Die Prozentzahl steht im Abstract als Formel und ist deshalb nicht als Zitat hinterlegt.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.