Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenKI-WissenKapitel 10von 14 im Pfad

Small Language Models

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Bei manchen Sprachmodellen steht die Größe im Namen. Gemma 3 gibt es in fünf Fassungen, und die Bezugsseite zählt sie auf:

Available in 270M, 1B, 4B, 12B, and 27B parameter sizes (externe Seite, ollama.com)

270 Millionen bis 27 Milliarden Parameter, dieselbe Familie, ein Faktor 100 dazwischen. Bei ChatGPT, Claude und Gemini findet sich keine solche Zahl. Deren Stufen sind Preis- und Leistungsklassen, wie Grundkurs, Kapitel 10 beschreibt, und wie viele Parameter darin stecken, veröffentlicht keiner der drei Anbieter.

Dieses Kapitel handelt von der anderen Hälfte des Feldes: von den Modellen, bei denen die Zahl dasteht, und zwar von den kleinen darunter.

Ab wann ein Modell klein ist

Eine allgemein anerkannte Grenze in Parametern gibt es nicht, und die Quellen setzen sie verschieden an. Eine reine Parameterzahl lässt außerdem offen, was ein Gerät davon wirklich ausführen kann, und genau das verschiebt sich mit der Hardware. Belcak und sieben Mitautoren bei NVIDIA haben die Frage deshalb vom Modell auf das Gerät verlegt:

A SLM is a LM that can fit onto a common consumer electronic device and perform inference with latency sufficiently low to be practical when serving the agentic requests of one user. (externe Seite, arxiv.org)

Nach dieser Arbeitsdefinition ist ein Modell klein, wenn es auf ein gewöhnliches Endgerät passt und dort einem einzelnen Nutzer schnell genug antwortet. Diese Bestimmung wandert mit der Hardware: Was 2023 einen Server verlangte, läuft heute auf einem Laptop.

Eine Hausnummer nennen die Verfasser trotzdem:

We note that as of 2025, we would be comfortable with considering most models below 10bn parameters in size to be SLMs. (externe Seite, arxiv.org)

Dazu gehören zwei Hinweise. Die Arbeit ist ein Positionspapier von NVIDIA, also aus dem Haus, das die Rechenkarten für beide Größenklassen verkauft. Und die Verfasser führen ihre Bestimmung ausdrücklich als Arbeitsdefinition, mit dem eigenen Hinweis, ihre Wortwahl habe wenig Gewicht für den Kern ihrer Position.

Warum die Parameterzahl wenig über das Können sagt

2023 zeigte Metas Llama-Arbeit, was ein Größenunterschied wert sein kann:

LLaMA-13B outperforms GPT-3 (175B) on most benchmarks (externe Seite, arxiv.org)

13 Milliarden Parameter schlugen 175 Milliarden, gemessen an den meisten der untersuchten Auswertungen. Ein halbes Jahr später wiederholte sich das eine Nummer kleiner. Mistral veröffentlichte am 27.09.2023 ein Modell mit 7,3 Milliarden Parametern und schrieb dazu:

Mistral 7B significantly outperforms Llama 2 13B on all metrics, and is on par with Llama 34B (since Llama 2 34B was not released, we report results on Llama 34B) (externe Seite, mistral.ai)

Die Klammer gehört dazu: Verglichen wird gegen Llama 1 34B, weil es die zweite Reihe in dieser Größe nie gab. Der geschlagene Gegner ist damit ein Jahr älter als der genannte.

Der Grund dafür liegt im Training und steht ausführlich in Beurteilen und Einordnen, Kapitel 05. In Kürze: Bis 2022 galt die Empfehlung, große Modelle zu bauen und das Training früh zu beenden. Die Chinchilla-Arbeit hat sie umgedreht: Bei festem Rechenbudget gehört zu doppelter Modellgröße die doppelte Datenmenge. Viele große Modelle jener Zeit hatten daran gemessen zu wenig Daten gesehen, und ein kleineres, dafür länger trainiertes Modell kann ein solches größeres schlagen.

Was die Parameterzahl weiterhin verlässlich sagt, ist etwas anderes: wie viel Speicher das Modell belegt. Wie viel davon gleichzeitig im Arbeitsspeicher liegen muss, hängt an der Bauform, dazu der Abschnitt über Apple weiter unten. Diese Rechnung führt Beurteilen und Einordnen, Kapitel 01 vor.

Zwei Wege führen zu einem kleinen Modell

Der eine leitet ab. Aus einem großen Modell entsteht ein kleineres, über Destillation oder als kleinere Fassung derselben Familie. Das ist der Regelfall, weil er bis zu vierzigmal weniger Trainingsmaterial kostet (externe Seite, arxiv.org). Auch das kleinste Gemma-Modell gehört dazu, es erbt Bauform und Vortraining der Familie (externe Seite, developers.googleblog.com).

Der andere baut von Grund auf, für ein Fachgebiet oder für die Sprachen, die gebraucht werden. Ein Modell mit 88 Millionen Parametern für das indische Rechtswesen schlägt bei seiner Aufgabe Modelle bis zum Achtzigfachen seiner Größe (externe Seite, arxiv.org). Eine Modellfamilie für das Kasachische (externe Seite, arxiv.org) entstand, weil mehrsprachige Modelle dieser Sprache wenig Kapazität einräumen und ihre Zerlegung schlecht zu deren Bau passt.

Beide haben dasselbe Bauteil eigens angefertigt, und es ist das Vokabular. Darin liegt der Hebel: Bei jenem kleinen Gemma-Modell entfallen 170 von 270 Millionen Parametern allein darauf, viele Sprachen und seltene Zeichenfolgen darstellen zu können. Wer zwei Sprachen braucht, verteilt dieselbe Zahl anders. Die Rechnung steht in Tiefe 2.

Wofür ein kleines Modell reicht

Der Abstand zur Spitze hängt an der Art der Aufgabe. Bei allem, was hauptsächlich Umformung ist, fällt er kaum ins Gewicht: zusammenfassen, umformulieren, sortieren, aus einem Text ein Feld herausziehen. Bei Aufgaben über viele Schritte, in denen ein früher Fehler alles Spätere verdirbt, wird er groß. Woran das liegt, steht in Beurteilen und Einordnen, Kapitel 01 unter der Frage, ob ein Modell läuft oder taugt.

Die Arbeit von NVIDIA setzt genau hier an. Ihre Beobachtung ist, dass die Aufgaben eines Agenten selten das breite Können verlangen, für das große Modelle gebaut sind:

The rise of agentic AI systems is, however, ushering in a mass of applications in which language models perform a small number of specialized tasks repetitively and with little variation. (externe Seite, arxiv.org)

Ein Agent, der hundertmal am Tag dieselbe Zuordnung trifft, braucht ein Modell, das diese eine Zuordnung beherrscht. Was ein solches Modell zusätzlich an Weltwissen mitbringt, bleibt in diesem Ablauf ungenutzt und wird trotzdem bezahlt.

Ein Modell im Telefon

Wie weit das inzwischen reicht, zeigt Apple. Die dritte Fassung der hauseigenen Modellreihe, vorgestellt am 08.06.2026, rechnet auf dem Gerät:

these models run exclusively on-device and on Private Cloud Compute (externe Seite, machinelearning.apple.com)

Interessant daran ist die Bauform des stärkeren der beiden Gerätemodelle:

this 20-billion-parameter model uses a sparse architecture, activating just 1 to 4 billion parameters at a time depending on the request (externe Seite, machinelearning.apple.com)

Wo diese 20 Milliarden liegen, ist der eigentliche Punkt. Apple grenzt sich im selben Absatz von der üblichen Bauform ab, bei der alle Gewichte im Arbeitsspeicher stehen müssen:

Instead of forcing the entire model into DRAM, the full model is stored in flash memory (NAND). (externe Seite, machinelearning.apple.com)

Das vollständige Modell liegt also im Flash-Speicher, und in den Arbeitsspeicher wandert je Anfrage nur, was gebraucht wird. Aus einer Zahl werden damit drei: wie viel gespeichert ist, wie viel geladen wird und wie viel je Anfrage rechnet. Wie das technisch geht, steht in Tiefe 2. Die Angaben stammen vom Hersteller, eine unabhängige Messung dazu liegt nicht vor.

Wer selbst ausprobieren will, findet die verfügbaren Größen je Modell im Katalog von Ollama (externe Seite, ollama.com). Welche davon auf ein bestimmtes Gerät passen, rechnet Beurteilen und Einordnen, Kapitel 01 aus.

Woran Sie die Wahl festmachen

Fangen Sie bei der Aufgabe an, nicht bei der Größe. Eine enge, oft wiederholte Aufgabe ist der Fall, in dem ein kleines Modell mithält. Eine offene Frage mit vielen Schritten ist es nicht.

Fragen Sie nach mehr als einer Zahl. Die Gesamtgröße sagt, wie viel gespeichert werden muss. Wie viel davon gleichzeitig im Arbeitsspeicher liegen muss, hängt an der Bauform. Die aktive Größe sagt, wie viel je Anfrage gerechnet wird.

Messen Sie am eigenen Fall. Eine Benchmarkzahl beschreibt eine fremde Aufgabe. Was das bedeutet, steht in Beurteilen und Einordnen, Kapitel 04.

Halten Sie die Kette offen. Das kleine Modell zuerst, das große für die Fälle, an denen es scheitert. Diese Stufung ist der Regelfall im Betrieb, und was sie kostet, rechnet Tiefe 3 vor.

Quellen

15 Einträgealle erreichbar

Erreichbarkeit automatisch geprüft

  • Dokumentationerreichbar

    Ollama, Modellseite Gemma 3 (externe Seite, ollama.com)

    ollama.comgeprüft 24.09.2026

    Die Bezugsseite der Dateien, und damit der Beleg dafür, wie groß ein herunterladbares Modell wirklich ist. Sie führt fünf Größen von 270 Millionen bis 27 Milliarden Parametern und nennt je Variante die Dateigröße in der voreingestellten Quantisierung: 3,3 GB für die 4B-Fassung, 8,1 GB für 12B und 17 GB für 27B, abgerufen am 05.08.2026. Die Zahlen stehen in einer Auswahltabelle und lassen sich deshalb nicht als Satz zitieren.

  • Originalarbeiterreichbar

    Small Language Models are the Future of Agentic AI (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Belcak und sieben Mitautoren bei NVIDIA legen am 02.06.2025 dar, warum kleine Sprachmodelle für Agenten die passendere Wahl sind. Wichtig daran ist die Bestimmung von klein, die ohne willkürliche Parametergrenze auskommt: Sie geht über das Gerät und über die Antwortzeit für einen einzelnen Nutzer. Als Faustzahl für 2025 nennen die Verfasser 10 Milliarden Parameter. Die Arbeit ist ausdrücklich ein Positionspapier, und ihre Wirkungsangaben stammen vom Hersteller der Rechenkarten, auf denen solche Modelle laufen.

  • Originalarbeiterreichbar

    LLaMA: Open and Efficient Foundation Language Models (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Touvron und Mitautoren stellen am 27.02.2023 eine Modellreihe vor, deren Gewichte an Forschende herausgegeben werden. Damit beginnt der offene Branch: Von hier an gibt es zu jedem geschlossenen Modell eine Alternative, die man selbst betreiben kann.

  • Ankündigung des Herstellerserreichbar

    Mistral 7B (externe Seite, mistral.ai)

    mistral.aigeprüft 24.09.2026

    Das erste Modell von Mistral AI, veröffentlicht am 27.09.2023 unter Apache 2.0 mit herunterladbaren Gewichten. Es schlug in den Auswertungen das fast doppelt so große Llama 2 13B und ist der Anfang der europäischen Reihe, die bis heute läuft.

  • Ankündigung des Herstellerserreichbar

    Apple, Introducing the Third Generation of Apple Foundation Models (externe Seite, machinelearning.apple.com)

    machinelearning.apple.comgeprüft 24.09.2026

    Apple stellt am 08.06.2026 die dritte Fassung seiner Modellreihe vor. Das stärkere der beiden Modelle auf dem Gerät hat 20 Milliarden Parameter und rechnet je Anfrage mit 1 bis 4 davon. Der Absatz dazu grenzt sich ausdrücklich von den üblichen Mixture-of-Experts-Modellen ab: Dort liegen alle Gewichte im Arbeitsspeicher, hier liegt das vollständige Modell im Flash-Speicher, und die benötigten Experten wandern je Anfrage in den Arbeitsspeicher. Damit zerfällt die Parameterzahl in vier Größen, nämlich gespeichert, geladen, aktiv und gerechnet. Die Angaben sind Herstellerangaben, eine unabhängige Messung dazu gibt es nicht.

  • Werkzeugerreichbar

    Ollama, Modellkatalog (externe Seite, ollama.com)

    ollama.comgeprüft 24.09.2026

    Die Liste der Modelle, die sich mit einem Befehl auf den eigenen Rechner holen lassen. Je Eintrag stehen die verfügbaren Parametergrößen, die Zahl der Abrufe, das Datum der letzten Fassung und Merkmale wie vision, tools oder thinking. Das Programm dazu steht unter ollama-werkzeug; diese Adresse beantwortet die andere Frage, nämlich welche Modelle es überhaupt gibt und in welchen Größen.

  • Ankündigung des Herstellerserreichbar

    Google, Introducing Gemma 3 270M (externe Seite, developers.googleblog.com)

    developers.googleblog.comgeprüft 24.09.2026

    Google stellt am 14.08.2025 ein Modell mit 270 Millionen Parametern vor, das von Anfang an auf den Zuschnitt für eine Aufgabe gebaut ist. Der Eintrag steht hier wegen einer Zahl: 170 der 270 Millionen Parameter stecken im Vokabular und nur 100 Millionen in den Rechenschichten. Damit ist zweierlei belegt, dass Parameterzahl und Gewichte verschiedene Dinge sind, und dass ein Vokabular für viele Sprachen einen erheblichen Teil eines kleinen Modells beansprucht. Die Angaben stammen vom Hersteller.

  • Originalarbeiterreichbar

    Ayn: A Tiny yet Competitive Indian Legal Language Model Pretrained from Scratch (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Niyogi, Gaussier und Bhattacharya fragen am 20.03.2024, ob ein von Grund auf trainiertes Kleinstmodell ein großes ersetzen kann, und beantworten das am indischen Rechtswesen. Ihr Modell mit 88 Millionen Parametern entstand in 185 A100-Stunden und bekam ein eigenes, auf das Fachgebiet zugeschnittenes Vokabular. Bei der Vorhersage von Urteilen schlägt es Modelle bis zum Achtzigfachen seiner Größe. Die zuletzt am 16.03.2026 überarbeitete Fassung zeigt, dass der Zuschnitt schon beim Bauen geschehen kann statt erst beim Feinjustieren.

  • Originalarbeiterreichbar

    Compact Language Models via Pruning and Knowledge Distillation (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Muralidharan und Mitautoren bei NVIDIA beziffern am 19.07.2024 den Abstand zwischen den beiden Bauwegen. Ein 8- und ein 4-Milliarden-Modell aus einem vorhandenen 15-Milliarden-Modell abzuleiten kostet bis zu vierzigmal weniger Trainingstoken, als beide von Grund auf zu trainieren. Das ist der Grund, warum Modellfamilien überwiegend so entstehen, und zugleich die Zahl, gegen die ein zugeschnittenes Modell antreten muss.

  • Originalarbeiterreichbar

    SozKZ: Training Efficient Small Language Models for Kazakh from Scratch (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Tukenov trainiert am 21.03.2026 eine Modellfamilie von 50 bis 600 Millionen Parametern von Grund auf für das Kasachische, mit einem eigenen Vokabular aus 50.000 Einträgen. Die Begründung nennt die Arbeit im ersten Satz: Mehrsprachige Modelle geben einer solchen Sprache wenig Kapazität, und ihre Zerlegung passt schlecht zu deren Bau. Das 600-Millionen-Modell erreicht bei kasachischen Aufgaben, was doppelt so große mehrsprachige Modelle erreichen, gemessen an drei Prüfsammlungen gegen fünf Vergleichsmodelle.

  • Originalarbeiterreichbar

    Textbooks Are All You Need (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Gunasekar und Mitautoren bei Microsoft zeigen am 20.06.2023, dass sortierte Trainingsdaten einen Teil der Modellgröße ersetzen. Ihr Modell mit 1,3 Milliarden Parametern entstand in vier Tagen auf acht Rechenkarten und erreicht 50,6 Prozent auf HumanEval. Die Arbeit misst allein Code, also eine eng umrissene Aufgabe, und ein Teil ihrer Trainingsdaten stammt aus einem größeren Modell. Beides gehört zu jeder Übertragung auf andere Gebiete dazu.

  • Dokumentationerreichbar

    nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 · Hugging Face (externe Seite, huggingface.co)

    huggingface.cogeprüft 24.09.2026

    Modellkarte mit Parameterzahl, Architektur, Lizenz und Veröffentlichungsdatum des Modells.

  • Originalarbeiterreichbar

    Kimi K3, Modellkarte auf Hugging Face (externe Seite, huggingface.co)

    huggingface.cogeprüft 24.09.2026

    Die Modellkarte zum offenen Modell Kimi K3 von Moonshot AI, veröffentlicht am 27.07.2026. Nennt den Aufbau (Mixture of Experts, 2,8 Billionen Parameter gesamt, 104 Milliarden je Token aktiv), Kontextfenster, Quantisierung und die vollständige Auswertungstabelle gegen die geschlossenen Spitzenmodelle. Die Gewichte liegen im selben Verzeichnis, 96 Dateien mit zusammen 1,56 Terabyte.

  • Originalarbeiterreichbar

    Domain-Specific Language Model Pretraining for Biomedical Natural Language Processing (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Gu und Mitautoren bei Microsoft prüfen am 31.07.2020 die verbreitete Annahme, ein Fachmodell fahre am besten, wenn es von einem allgemeinen Modell ausgeht. Für Gebiete mit viel unmarkiertem Text messen sie das Gegenteil: Ein von Grund auf auf Fachtexten trainiertes Modell gewinnt deutlich gegenüber der Weiterführung eines allgemeinen. Die Bedingung steht im Befund selbst, und die Arbeit stammt aus der BERT-Zeit, misst also Encoder-Modelle im biomedizinischen Bereich.

  • Originalarbeiterreichbar

    In-Place Tokenizer Expansion for Pre-trained LLMs (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Smith und Mitautoren zeigen am 16.07.2026, warum ein kleines Modell beim Vokabular sparen muss. Bei einem Modell in der Cloud fallen die Tabellen für Vokabular und Ausgabeschicht kaum ins Gewicht, bei einem kompakten Modell bestimmen sie einen erheblichen Teil der Bandbreite je Zeichenkette. Modelle für das Gerät fahren deshalb kleine Vokabulare und nehmen in Kauf, dass Sprachen außerhalb ihres Zuschnitts in viele Bruchstücke zerfallen. Nach einer Erweiterung messen die Autoren für Hindi und Vietnamesisch rund 2,4- und 2,6-fach weniger Zeichenketten.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.