SchlüsselarbeitOriginalarbeiterreichbar
Attention Is All You Need
Die Arbeit, mit der alles anfing. Vaswani und sieben Mitautoren stellen am 12.06.2017 die Transformer-Architektur vor und zeigen, dass ein Netz allein über den Mechanismus der Aufmerksamkeit auskommt, ohne die bis dahin übliche schrittweise Verarbeitung. Erst dadurch ließen sich Modelle sinnvoll auf viele Rechenkerne verteilen. Jedes GPT, jedes Claude und jedes Gemini steht auf dieser Arbeit. Abschnitt 3.2.3 hält die Einschränkung fest, die für alle fortsetzenden Modelle gilt: „self-attention layers in the decoder allow each position in the decoder to attend to all positions in the decoder up to and including that position“, dazu die Begründung „We need to prevent leftward information flow in the decoder to preserve the auto-regressive property“. Beide Stellen stehen im Volltext und sind deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.
geprüft 24.09.2026Archivfassung (externe Seite, web.archive.org)
Worauf sich diese Seite beruft, wörtlich, abgerufen am 06.08.2026:
based solely on attention mechanisms, dispensing with recurrence and convolutions entirely
bestätigt 24.09.2026
KI-GeschichteSprachmodell im GlossarTransformer im Glossar01 Was ein Sprachmodell ist02 Was ein Sprachmodell tut03 Neuronale Netze und Deep Learning03 Token, die Bausteine der Sprache04 Embedding, Bedeutung als Zahlenreihe