NachschlagenQuellenregister

Originalarbeiterreichbar

Textbooks Are All You Need

arxiv.org (externe Seite)

Gunasekar und Mitautoren bei Microsoft zeigen am 20.06.2023, dass sortierte Trainingsdaten einen Teil der Modellgröße ersetzen. Ihr Modell mit 1,3 Milliarden Parametern entstand in vier Tagen auf acht Rechenkarten und erreicht 50,6 Prozent auf HumanEval. Die Arbeit misst allein Code, also eine eng umrissene Aufgabe, und ein Teil ihrer Trainingsdaten stammt aus einem größeren Modell. Beides gehört zu jeder Übertragung auf andere Gebiete dazu.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 04.09.2026:

  • phi-1 is a Transformer-based model with 1.3B parameters, trained for 4 days on 8 A100sbestätigt 24.09.2026
  • Despite this small scale, phi-1 attains pass@1 accuracy 50.6% on HumanEval and 55.5% on MBPPbestätigt 24.09.2026

10 Small Language Models

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.