GrundlagenKI-WissenKapitel 03von 14 im Pfad
Neuronale Netze und Deep Learning
Kapitel 02 sagt, dass ein Verfahren sein Verhalten aus Beispielen zieht. Dieses Kapitel sagt, worin dieses Verhalten dann steckt.
Was in einem Netz geschieht
Ein neuronales Netz ist eine Anordnung sehr einfacher Rechenschritte in Schichten. Jeder Punkt einer Schicht nimmt Zahlen von der Schicht davor entgegen, multipliziert jede mit einem eigenen Wert, zählt alles zusammen und gibt das Ergebnis weiter.
seitlich verschiebbar
eigene Darstellung, Stand 09/2026
Diese Werte an den Verbindungen heißen Gewichte, und sie sind das Ergebnis des Trainings. Am Anfang stehen sie auf Zufallszahlen, danach werden sie milliardenfach nachgestellt.
Damit ist die wichtigste Eigenschaft benannt: Was ein Netz kann, steht nirgends als Regel geschrieben. Es steckt in diesen Zahlen. Man kann sie auslesen und ausdrucken, und man kann ihnen nicht ansehen, wofür sie stehen. Warum das Folgen bis in den Alltag hat, steht in Grundkurs, Kapitel 07.
Warum die Anleihe bei der Biologie in die Irre führt
Der Name stammt aus der Absicht, das Gehirn nachzubauen. Das Nobelkomitee formuliert es 2024 vorsichtig:
Inspiriert, und damit hört die Ähnlichkeit weitgehend auf. Ein Punkt in einem Netz rechnet eine Multiplikation und eine Summe. Eine Nervenzelle ist eine lebende Zelle mit Stoffwechsel, chemischen Botenstoffen und einem Verhalten über die Zeit. Vom Netz auf das Gehirn zu schließen oder umgekehrt, überdehnt den Vergleich.
Das Nobelkomitee benennt an derselben Stelle, wie eng der Alltagsgebrauch des Wortes KI geworden ist:
Was daneben noch KI heißt, steht in Kapitel 01.
Was das Wort tief beziffert
Deep Learning heißt: viele Schichten hintereinander. Eine Zahl dafür hat sich nie eingebürgert, und sie hat sich mit den Jahren verschoben.
Das Netz, das 2012 den Umschwung brachte, hatte acht Schichten mit Gewichten, fünf mit Faltung und drei voll verbundene. Drei Jahre später waren es 152, und die Arbeit dazu benennt genau das als ihren Gegenstand:
Der Zuwachs an Tiefe war dabei kein Selbstläufer. Der erste Satz derselben Arbeit lautet:
Deeper neural networks are more difficult to train. (externe Seite, arxiv.org)
Warum Tiefe hilft und warum sie schwierig ist, steht in Tiefe 2.
2012, der Punkt an dem es umschlug
Neuronale Netze gab es seit Jahrzehnten, und sie galten lange als Nebenweg. Brauchbar wurden sie in dem Moment, als genug Rechenleistung und genug Beispiele zusammenkamen. Das Netz, an dem sich das zeigte, klassifizierte 1,2 Millionen Bilder in tausend Klassen (externe Seite, papers.nips.cc) und senkte die Fehlerquote im Wettbewerb von 2012 auf 15,3 Prozent, während der Zweitplatzierte bei 26,2 lag.
Interessanter für die Nachwelt sind zwei andere Angaben aus derselben Arbeit. Das Netz hatte 60 Millionen Parameter und 650.000 Neuronen. Und trainiert wurde es auf zwei Grafikkarten, mit einer Umsetzung, die eigens dafür geschrieben war.
Grafikkarten wurden damit zum Forschungswerkzeug. Alles, was danach kam, steht auf dieser Entscheidung, und wie schnell es danach ging, steht in Beurteilen und Einordnen, Kapitel 05.
Vom Netz zum Sprachmodell
Ein Sprachmodell ist ein neuronales Netz einer bestimmten Bauform. Die Bauform heißt Transformer, sie stammt von 2017, und was sie beigetragen hat, steht in Grundkurs, Kapitel 02.
Die Zahl, die überall genannt wird, ist die Zahl der Parameter, und die Gewichte sind der größte Teil davon. AlexNet hatte 60 Millionen, heutige Sprachmodelle haben Milliarden bis Billionen. Was diese Zahl sagt und was sie verschweigt, steht in Kapitel 10.
Woran Sie es festmachen
Gewichte sind Zahlen ohne Beschriftung. Wer nach einer Regel im Modell sucht, sucht etwas, das dort nicht abgelegt ist.
Tiefe ist eine Bauentscheidung. Mehr Schichten helfen, solange sich das Netz trainieren lässt, und genau dort liegt die Schwierigkeit.
Die Bauform folgt dem Gegenstand. Für Bilder, für Folgen und für Sprache haben sich verschiedene Anordnungen durchgesetzt. Welche, steht in Tiefe 2.
Die Parameterzahl beschreibt die Größe. Wie viel Speicher daraus folgt, rechnet Beurteilen und Einordnen, Kapitel 01 vor. Über das Können sagt sie wenig.
Ein Netz aus Schichten wirft eine Frage auf, an der die Brauchbarkeit des ganzen Verfahrens hängt: Wenn am Ende ein Fehler herauskommt, welcher der Millionen Werte im Inneren war daran schuld?
Der Fehler läuft rückwärts
Die Antwort heißt Backpropagation, und sie ist im Kern eine Anwendung der Kettenregel aus der Analysis.
Der Durchlauf nach vorn liefert eine Ausgabe und damit einen Fehlerwert. Danach läuft die Rechnung rückwärts durch die Schichten. Für die letzte Schicht lässt sich unmittelbar ausrechnen, wie sich jedes ihrer Gewichte auf den Fehler auswirkt. Für die vorletzte Schicht ergibt sich dasselbe aus dem Ergebnis der letzten, und so weiter bis zum Eingang. Am Ende hat jedes Gewicht im Netz eine Angabe darüber, in welche Richtung es sich bewegen müsste.
Dann bewegt sich jedes Gewicht ein kleines Stück in diese Richtung. Wie groß dieses Stück ist, heißt Lernrate und gehört zu den Einstellungen, die von Hand gewählt werden.
Zwei Eigenschaften dieses Verfahrens erklären viel am heutigen Betrieb. Es braucht den Durchlauf nach vorn und den nach hinten, also mindestens die doppelte Rechenzeit einer Benutzung. Und es braucht die Zwischenergebnisse aller Schichten im Speicher, weil der Rückweg sie einzeln aufgreift. Deshalb kostet ein Training so viel mehr Speicher als eine Anfrage. Was eine Anfrage allein braucht, rechnet Beurteilen und Einordnen, Kapitel 01 vor.
Warum Tiefe schwierig war
Mehr Schichten heißen mehr Zwischenstufen, durch die dieses Signal zurücklaufen muss. Bei jeder Stufe wird es mit einem Faktor multipliziert. Sind diese Faktoren kleiner als eins, schrumpft das Signal von Schicht zu Schicht, und in den vorderen Schichten kommt fast nichts mehr an. Sie lernen dann kaum noch.
Genau daran scheiterte Tiefe lange, und die ResNet-Arbeit fängt mit diesem Befund an:
Deeper neural networks are more difficult to train. (externe Seite, arxiv.org)
Ihr Vorschlag ändert, was eine Schicht überhaupt lernen soll:
Jede Schicht lernt also die Abweichung von ihrer eigenen Eingabe. Die Eingabe selbst wird an der Schicht vorbeigeführt und hinter ihr wieder zugeschlagen. Damit hat das rücklaufende Signal einen kurzen Weg an jeder Schicht vorbei, und die Tiefe hört auf, den Rückweg zu ersticken. Das Ergebnis waren Netze mit bis zu 152 Schichten (externe Seite, arxiv.org), und der Kniff steckt seither in fast jeder größeren Bauform, auch im Transformer.
Drei Bauformen für drei Gegenstände
Die Anordnung der Schichten folgt dem, was hineingeht. Drei Familien haben sich durchgesetzt, und die Transformer-Arbeit nennt in einem Halbsatz alle drei, indem sie zwei davon abwählt:
Faltungsnetze für Bilder. Statt jeden Bildpunkt einzeln mit jedem zu verbinden, wandert ein kleines Fenster über das Bild und sucht überall nach demselben Muster. Das spart Gewichte und passt zu der Eigenschaft, dass eine Kante überall im Bild eine Kante ist. AlexNet hatte fünf solcher Schichten (externe Seite, papers.nips.cc) und drei voll verbundene dahinter, ResNet über hundert.
Rekurrente Netze für Folgen. Sie lesen ein Element nach dem anderen und führen dabei einen Zustand mit, der alles Bisherige zusammenfasst. Damit lassen sich Sätze verarbeiten, deren Länge vorher nicht feststeht.
Der Transformer für alles, was sich als Folge von Stücken darstellen lässt. Er nimmt die Eingabe auf einmal entgegen und lässt jede Stelle selbst bestimmen, welche anderen Stellen für sie zählen. Für die Ausgabe gilt das nicht, die entsteht weiter Stück für Stück; beides steht in Grundkurs, Kapitel 02.
Woher die Aufmerksamkeit kommt
Der Mechanismus, der den Transformer ausmacht, ist drei Jahre älter als er, und er entstand als Antwort auf ein Problem der rekurrenten Netze.
Ein solches Netz musste beim Übersetzen den ganzen Ausgangssatz in einen Zwischenspeicher fester Größe pressen, bevor die Übersetzung begann. Bahdanau, Cho und Bengio hielten das für den Engpass:
Ihr Vorschlag war, den Zwischenspeicher wegzulassen und das Modell bei jedem Zielwort selbst nachsehen zu lassen:
Das ist die Aufmerksamkeit, bevor sie so hieß. 2017 zeigte sich, dass sie allein genügt und das rekurrente Gerüst darum herum entfallen kann.
Zwei Richtungen aus demselben Baustein
Aus dem Transformer sind zwei Familien entstanden, und sie unterscheiden sich darin, was beim Training verdeckt wird.
Der Schreiber sieht immer nur den Text bis zur aktuellen Stelle und errät das nächste Stück. Daraus wurde GPT, und mit ihm das Muster, erst auf sehr viel unbeschriftetem Text vorzutrainieren und dann für einzelne Aufgaben nachzujustieren (externe Seite, openai.com). Was daraus geworden ist, steht in Beurteilen und Einordnen, Kapitel 02.
Der Leser sieht den ganzen Satz und füllt Lücken darin:
Beide Richtungen stehen auf demselben Baustein und sind für verschiedene Zwecke zugeschnitten. Was der Leser ausgibt, ist eine Darstellung des ganzen Textes; ein großer Teil der Modelle für die Suche in eigenen Dokumenten ist so gebaut, und der bekannteste davon steht in Grundkurs, Kapitel 04. Die Arbeit beschreibt zugleich, wie billig der Zuschnitt danach wird:
Was die Parameterzahl zählt
Parameter ist der Sammelbegriff für alles, was das Training einstellt: die Gewichte an den Verbindungen und die Schwellwerte an den Punkten. AlexNet kam mit 60 Millionen davon (externe Seite, papers.nips.cc) aus, heutige Sprachmodelle mit Milliarden bis Billionen.
Verlässlich sagt die Zahl eine Sache: wie viel Speicher das Modell belegt. Wie viel davon gleichzeitig im Arbeitsspeicher liegen muss und wie viel je Anfrage wirklich rechnet, hängt an der Bauform, und bei modernen Modellen fallen diese Größen auseinander. Die Rechnung dazu steht in Kapitel 10.
Für die Kosten eines Trainings genügt sie ebenfalls nicht. Sie hängen an der Größe und an der Datenmenge, und dass beide zusammen gehören, steht in Beurteilen und Einordnen, Kapitel 05.
Was sie über das Können sagt, ist erstaunlich wenig.
Was daraus für die Praxis folgt
Der Rückweg erklärt die Kosten. Training braucht die doppelte Rechnung und die Zwischenergebnisse aller Schichten. Wer die Zahlen für eigenes Training schätzt, rechnet nicht mit den Zahlen einer Anfrage.
Die Bauform folgt dem Gegenstand. Für Bilder, Folgen und Text haben sich verschiedene Anordnungen bewährt, und sie mischen sich in heutigen Systemen.
Verkürzungen im Netz sind der Grund für die heutige Tiefe. Ohne den Kniff der Restfunktionen wären Netze dieser Größe unerreichbar geblieben.
Vortraining und Zuschnitt sind zwei Schritte. Das teure Stück entsteht einmal, der Zuschnitt kostet einen Bruchteil davon. Die Zahlen dazu stehen in Beurteilen und Einordnen, Kapitel 02.
Die Erzählung über 2012 verkürzt sich meistens auf zwei Wörter: mehr Daten, mehr Rechenleistung. Der Kurztext der Arbeit nennt vier Zutaten, und zwei davon werden selten mitgenannt.
Die Angaben dieses Abschnitts stammen aus der Druckfassung und stehen deshalb in indirekter Rede: Die Abstractseite der Proceedings führt einen älteren Entwurf, dessen Zahlen an vier Stellen abweichen. Welche, steht in der Notiz zur Quelle (externe Seite, papers.nips.cc).
Was an AlexNet außer der Größe neu war
Die Grafikkarte als Rechenwerk. Der Kurztext sagt, das Training sei über eine eigens geschriebene Umsetzung der Faltungsoperation auf Grafikkarten beschleunigt worden. Zwei Karten, in denen Bildpunkte parallel gerechnet werden sollten, rechneten stattdessen ein Netz. Damit war die Hardwarelinie eröffnet, an der das ganze Fach seither hängt.
Nicht sättigende Neuronen. Derselbe Halbsatz nennt sie beiläufig, und zwar ausdrücklich als Mittel für ein schnelleres Training. Ältere Netze benutzten eine Übertragungsfunktion, die für große Eingaben flach ausläuft. Genau dort verschwindet beim Rückweg das Signal, und die vorderen Schichten lernen kaum noch.
Ein Verfahren gegen das Auswendiglernen. Der Kurztext nennt es beim Namen: Dropout. Beim Training wird in jedem Durchgang ein Teil der Punkte zufällig abgeschaltet, und das Netz kann sich dadurch auf keine einzelne Verbindung verlassen. Nötig war das, weil 60 Millionen Parameter genug Kapazität haben, sich 1,2 Millionen Trainingsbilder schlicht zu merken.
Die Größe. Sie steht bei dieser Aufzählung an vierter Stelle und wird gewöhnlich als erste genannt.
Drei Jahre später lag der Engpass wieder woanders, und das Mittel dagegen waren die Verkürzungen an jeder Schicht vorbei. Sie stehen in Tiefe 2.
Warum dieselbe Bauform verschiedene Gegenstände frisst
Der technische Grund ist einfach und wird selten ausgesprochen: Der Transformer setzt an seinem Eingang nichts über Sprache voraus. Die Arbeit von 2017 baut ihn allein auf dem Mechanismus der Aufmerksamkeit (externe Seite, arxiv.org), ohne Rekurrenz und ohne Faltung. Was übrig bleibt, nimmt eine Folge von Zahlenreihen entgegen und rechnet Beziehungen zwischen deren Positionen. Woher diese Zahlenreihen kommen, ist ihm gleichgültig.
Damit reduziert sich die Übertragung auf eine neue Art von Daten auf eine einzige Frage: Wie wird daraus eine Folge von Zahlenreihen? Für Bilder sind es Kacheln, für Ton kurze Abschnitte des Signals, für ein Eiweiß die Bausteine der Kette. Wie diese Übersetzung aussieht, steht in Grundkurs, Kapitel 04.
Zwei Belege für die Reichweite. AlphaFold beschreibt sich als aufmerksamkeitsbasiertes neuronales Netz, von Ende zu Ende trainiert (externe Seite, deepmind.google), und arbeitet auf Molekülen; gebaut ist es für diese eine Aufgabe und für keine andere. CLIP setzt ein Bildmodell und ein Textmodell nebeneinander (externe Seite, arxiv.org) und bringt beide Ausgänge in denselben Raum. Übertragbar ist damit die Bauform. Das fertige Modell bleibt an seiner Aufgabe.
Was daraus für die Einordnung des Feldes folgt, steht in Kapitel 01.
Wo der Ausdruck Deep Learning unscharf wird
Der Ausdruck bezeichnete ursprünglich eine Abgrenzung: Netze mit mehreren verborgenen Schichten gegenüber flachen Verfahren. Diese Abgrenzung hat sich verbraucht, weil heute praktisch jedes ernsthafte Netz tief ist.
Drei Verwendungen laufen inzwischen nebeneinander, und sie meinen verschiedene Dinge.
Als Bauform. Ein Netz mit vielen Schichten. Die Zahl, ab der es gilt, nennt niemand, und sie hat sich von acht auf über hundert verschoben.
Als Abgrenzung zum Merkmalsentwurf. Vor 2012 wurde einem Verfahren vorgegeben, worauf es achten soll: Kanten, Ecken, Farbhistogramme. Ein tiefes Netz stellt diese Zwischenstufen selbst her, und dass es dafür Tiefe braucht, sagt die ResNet-Arbeit in einem Satz:
Diese Verwendung ist die inhaltlich stärkste, und sie ist gemeint, wenn von einem Umbruch die Rede ist. Wie weit sie in ein eigenes Fach reicht, steht in Kapitel 05.
Als Etikett für das ganze Fach. Im Marketing steht Deep Learning oft einfach für maschinelles Lernen, und im Glossar dieser Seite liegt es aus demselben Grund als Nebenbezeichnung beim neuronalen Netz. Wer es so benutzt, schließt Entscheidungsbäume und ähnliche Verfahren stillschweigend aus, die in der Praxis weiterhin viel Arbeit erledigen. Wie sie arbeiten und wo sie heute noch das bessere Verfahren sind, steht in Kapitel 04.
Was ein Netz über sich selbst hergibt
Die Gewichte lassen sich vollständig auslesen, und trotzdem lässt sich aus ihnen keine Regel ablesen. Der Grund liegt in der Verteilung: Eine einzelne Eigenschaft steckt selten in einem Gewicht und meistens in einem Muster über viele.
Das hat praktische Folgen, und drei davon kommen regelmäßig vor.
Eine Antwort lässt sich nicht auf eine Trainingsstelle zurückführen. Wer wissen will, woher eine Aussage stammt, findet im Netz keinen Verweis. Was daraus für die Belegbarkeit folgt, steht in Agenten und Harness, Kapitel 03.
Eine Korrektur an einer Stelle wirkt anderswo mit. Deshalb ist das Nachjustieren eines Modells ein Eingriff mit Streuung, siehe Beurteilen und Einordnen, Kapitel 02.
Eine Prüfung von außen bleibt der einzige verlässliche Weg. Die Bauform gibt keine Auskunft über die Richtigkeit einer einzelnen Ausgabe, dazu Grundkurs, Kapitel 07.
Und es gibt Verfahren, die trotzdem hineinsehen. Was sie zeigen, was sie kosten und wo sie aufhören, steht in Beurteilen und Einordnen, Kapitel 06.
Was daraus nicht folgt
Aus der Anleihe bei der Biologie folgt keine Aussage über Gehirne. Die Ähnlichkeit endet beim Bild. Ein Netz gibt weder eine Erklärung für Denken noch ein Modell davon.
Aus mehr Schichten folgt keine bessere Leistung. Tiefe half erst, als der Rückweg des Fehlers gesichert war, und der erste Satz der ResNet-Arbeit sagt das Gegenteil der naheliegenden Erwartung.
Aus einer Bauform folgt kein Können. Der Transformer verarbeitet Folgen von Zahlenreihen. Was daraus wird, entscheiden die Daten und die Verlustfunktion, siehe Kapitel 02.
Aus der Übertragbarkeit auf neue Gegenstände folgt keine Gleichwertigkeit der Ergebnisse. Dass eine Bauform auf Molekülen läuft, sagt nichts darüber, wie gut sie dort arbeitet. Das steht in der jeweiligen Messung und nirgends sonst.
Quellen
9 Einträge, davon 2 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
Neural Machine Translation by Jointly Learning to Align and Translate (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Bahdanau, Cho und Bengio reichen am 01.09.2014 die Arbeit ein, in der der Mechanismus der Aufmerksamkeit seine Form bekommt. Die damals übliche Bauform presste den ganzen Ausgangssatz in einen Vektor fester Länge; die Arbeit vermutet darin den Engpass und lässt das Modell bei jedem Zielwort selbst suchen, welche Stellen der Eingabe dafür zählen. Im Kurztext heißt der Mechanismus weiches Suchen, das Wort Aufmerksamkeit setzte sich erst später durch. Drei Jahre vor dem Transformer, der allein darauf aufbaut.
SchlüsselarbeitOriginalarbeiterreichbar
Attention Is All You Need (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Die Arbeit, mit der alles anfing. Vaswani und sieben Mitautoren stellen am 12.06.2017 die Transformer-Architektur vor und zeigen, dass ein Netz allein über den Mechanismus der Aufmerksamkeit auskommt, ohne die bis dahin übliche schrittweise Verarbeitung. Erst dadurch ließen sich Modelle sinnvoll auf viele Rechenkerne verteilen. Jedes GPT, jedes Claude und jedes Gemini steht auf dieser Arbeit. Abschnitt 3.2.3 hält die Einschränkung fest, die für alle fortsetzenden Modelle gilt: „self-attention layers in the decoder allow each position in the decoder to attend to all positions in the decoder up to and including that position“, dazu die Begründung „We need to prevent leftward information flow in the decoder to preserve the auto-regressive property“. Beide Stellen stehen im Volltext und sind deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.
Originalarbeiterreichbar
ImageNet Classification with Deep Convolutional Neural Networks (externe Seite, papers.nips.cc)
papers.nips.ccgeprüft 24.09.2026
Krizhevsky, Sutskever und Hinton stellen bei NeurIPS 2012 ein Faltungsnetz vor, das den ImageNet-Wettbewerb gewinnt und die Fehlerquote so deutlich senkt, dass die bis dahin übliche Bauweise aufgegeben wurde. Ab hier wird Rechenleistung zum Forschungsmittel. Die Angaben zur Bauform stehen in der Druckfassung, Abschnitt 3.5: acht Schichten mit Gewichten, davon fünf Faltungsschichten und drei voll verbundene, 60 Millionen Parameter und 650.000 Neuronen. Der Sieg beim Wettbewerb 2012 mit 15,3 Prozent Fehlerquote gegen 26,2 Prozent des Zweitplatzierten steht am Ende des Kurztextes, das Verfahren gegen das Auswendiglernen heißt dort Dropout.
Originalarbeiterreichbar
Deep Residual Learning for Image Recognition (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
He, Zhang, Ren und Sun reichen am 10.12.2015 die Arbeit ein, die Tiefe als eigenes Problem behandelt. Sie beginnt mit dem Befund, dass tiefere Netze schwerer zu trainieren sind, und stellt einen Umbau vor, bei dem jede Schicht die Abweichung von ihrer Eingabe lernt statt einer eigenständigen Funktion. Damit wurden Netze mit 152 Schichten rechenbar, achtmal so tief wie die vorher übliche Bauform. Der Beleg dafür, dass das Wort tief in Deep Learning eine Zahl hat, die sich über die Jahre verschoben hat.
Originalarbeiterreichbar
The Nobel Prize in Physics 2024, press release (externe Seite, nobelprize.org)
nobelprize.orggeprüft 24.09.2026
Die Bekanntgabe vom 08.10.2024 für John Hopfield und Geoffrey Hinton, für Arbeiten, die das maschinelle Lernen mit künstlichen neuronalen Netzen ermöglichten. Einen Tag später ging der Chemiepreis unter anderem an Demis Hassabis und John Jumper für AlphaFold.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Die Gegenrichtung zu GPT, aus demselben Baustein gebaut. BERT liest einen Satz von beiden Seiten und erzeugt daraus eine Darstellung, statt Text fortzusetzen. Ein großer Teil der Embedding-Modelle, die heute eine Suche in eigenen Dokumenten möglich machen, ist so gebaut.
Originalarbeiterreichbar
Improving Language Understanding by Generative Pre-Training (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
GPT-1, vorgestellt am 11.06.2018. Führt das Muster ein, das bis heute gilt: erst ein Modell auf sehr viel unbeschriftetem Text vortrainieren, dann für einzelne Aufgaben nachjustieren. Das G in GPT steht für generative, das P für pre-trained, das T für Transformer.
Ankündigung des Herstellerserreichbar
AlphaFold: a solution to a 50-year-old grand challenge in biology (externe Seite, deepmind.google)
deepmind.googlegeprüft 24.09.2026
Die Ankündigung zum Abschneiden bei CASP14 im November 2020, dem Wettbewerb, in dem Vorhersagen zur Faltung von Eiweißen gegen gemessene Strukturen antreten. Der Beleg dafür, dass derselbe Mechanismus der Aufmerksamkeit auch Fragen außerhalb der Sprache beantwortet. Die Ankündigung beschreibt das System als aufmerksamkeitsbasiertes neuronales Netz, gebaut für diese eine Aufgabe.
Originalarbeiterreichbar
Learning Transferable Visual Models From Natural Language Supervision (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
CLIP, eingereicht am 26.02.2021. Der Beleg dafür, dass Bild und Text lange vor den heutigen multimodalen Modellen in einem gemeinsamen Raum lagen: Ein Bild- und ein Textnetz werden gleichzeitig darauf trainiert, dass zusammengehörige Paare denselben Platz bekommen. Abschnitt 2.3 sagt es wörtlich: „CLIP learns a multi-modal embedding space by jointly training an image encoder and text encoder to maximize the cosine similarity of the image and text embeddings“. Diese Stelle steht im Volltext und ist deshalb ohne hinterlegtes Zitat, der Prüflauf liest die Abstract-Seite.