GrundlagenBeurteilen und EinordnenKapitel 02von 8 im Pfad
Ein Modell auf eigene Daten abstimmen
In Grundkurs, Kapitel 08 steht, auf welchen drei Wegen Neues zu einem Modell kommt, und der Abschnitt endet mit einem Satz, der etwas offenlässt: Alle drei enden im Kontext, keiner erreicht die Gewichte. Hier geht es um die Verfahren, die genau das tun.
Bis in die Gewichte
Ein Modell ist eine Datei voller Zahlen. Was Sie ihm im Gespräch sagen, ändert daran nichts, es steht nur für die Dauer dieser einen Anfrage daneben. Es gibt allerdings einen Weg, die Datei selbst anzufassen: Man lässt das Modell weitere Beispiele durchrechnen, und danach stehen andere Zahlen darin.
Das ist keine Kleinigkeit im Betrieb, und es ist die einzige Art von Änderung, die bleibt. Ein so behandeltes Modell antwortet in jedem neuen Gespräch anders, ohne dass jemand etwas dazuschreiben muss.
seitlich verschiebbar
eigene Darstellung, Stand 06.08.2026
Drei Verfahren, ein Gedanke
Fine-Tuning. Das Modell trainiert weiter, mit Ihren Beispielen. Am Ende liegt eine zweite, vollständige Modelldatei da, die Ihnen gehört.
LoRA. Die Gewichte bleiben, wie sie sind, und daneben entsteht eine kleine Zusatzdatei. Sie wirkt beim Antworten mit, und weil sie klein ist, ist der Vorgang erheblich billiger (externe Seite, arxiv.org) als der erste. Fast alles, was heute als Abstimmung angeboten wird, arbeitet darunter so.
Distillation. Ein großes Modell erzeugt die Antworten, ein kleines lernt, sie nachzumachen. Der Gedanke ist von 2015 und stammt aus einer Arbeit, die zeigte, dass sich das Können mehrerer Modelle in ein einzelnes übertragen (externe Seite, arxiv.org) lässt. Am Ende steht ein kleineres Modell, das eine Sache gut kann.
Allen dreien gemeinsam: Am Ende liegt eine Datei da, die es vorher nicht gab, und für die jemand aufkommt.
Wofür sich das eignet
OpenAI zählt für das gebräuchlichste Verfahren vier Fälle auf: einordnen in Kategorien, übersetzen mit festem Ton, Ausgaben in einem verlangten Format, und Anweisungen, die das Modell sonst überliest. Alle vier haben dasselbe Muster. Es geht darum, wie geantwortet wird.
Der häufigste Wunsch dahinter geht damit gerade nicht in Erfüllung. Wer möchte, dass ein Modell die eigenen Unterlagen kennt, sucht etwas anderes: Das Wissen über eine Sache gehört zu den Wegen, die in Grundkurs, Kapitel 08 beschrieben sind. Eine Abstimmung bringt einem Modell den Hausstil bei, keine Hausakten.
Drei billigere Antworten stehen davor
Bevor die Frage nach der Abstimmung überhaupt sinnvoll ist, sind drei andere zu beantworten, und alle drei sind an einem Nachmittag erledigt:
Der Prompt. Steht in Grundkurs, Kapitel 06, und die dortigen Beispiele lösen einen guten Teil dessen, wofür früher trainiert wurde.
Die Unterlagen mitgeben. Was ins Fenster passt, muss nirgends gelernt werden. Grenzen und Fallstricke stehen in Grundkurs, Kapitel 05.
Nachschlagen lassen. Die Anwendung sucht die passenden Stellen heraus und legt sie dazu. Wie das funktioniert, steht in Grundkurs, Kapitel 04.
Der Unterschied liegt in der Umkehrbarkeit. Ein Prompt ist in Minuten geändert. Eine abgestimmte Fassung ist eine Anschaffung.
Die Rechnung läuft, während nichts passiert
Zwei Posten. Der erste ist das Training, und er fällt einmal an. Der zweite ist die Bereitstellung, und der überrascht die meisten: Microsoft berechnet dafür 1,70 Dollar je Stunde (externe Seite, learn.microsoft.com), Mistral verlangte zwei Dollar Ablage je Modell und Monat (externe Seite, docs.mistral.ai). Diese Beträge laufen weiter, solange das Modell bereitsteht, an Wochenenden und in der Urlaubswoche.
Bei einem gerechneten Beispiel des Anbieters selbst macht die reine Bereitschaft 86 Prozent der Monatsrechnung aus. Der Weg dorthin steht in Ebene 3, und wer die Zahl auf den eigenen Fall übertragen will, findet dort auch die Formel.
Zwei Anbieter haben aufgehört
Das Deutlichste zur Nutzenfrage kommt vom Markt. OpenAI schreibt auf die eigene Seite:
OpenAI is winding down the fine-tuning platform. (externe Seite, developers.openai.com)
In Mistrals Anleitung steht der Vermerk, dass die Funktion abgekündigt ist und nicht mehr gepflegt wird (externe Seite, docs.mistral.ai). Beides abgerufen am 06.08.2026. Bei Microsoft, Google und AWS ist das Angebot weiterhin buchbar.
Warum die beiden ausgestiegen sind, sagen sie nicht, und hier wird nicht geraten. Als Auskunft für die eigene Planung reicht die Tatsache: Ein Verfahren, bei dem zwei große Anbieter das Selbstbedienungsangebot einstellen, ist kein naheliegender erster Schritt.
Wann es sich trotzdem lohnt
Drei Anlässe, bei denen das Rechnen anfängt:
Dieselbe enge Aufgabe, sehr oft. Millionen gleichartige Vorgänge, bei denen jede eingesparte Zeile Prompt bei jedem einzelnen zählt.
Ein Prompt, der nur über seine Länge funktioniert. Wenn zwei Seiten Anweisung nötig sind, damit das Ergebnis stimmt, zahlen Sie diese zwei Seiten bei jeder Anfrage.
Eine Ausgabeform, die kein Beispiel zuverlässig erzwingt. Der Fall, den OpenAI selbst nennt, und der einzige der drei, bei dem es oft ohne Rechnung klar ist.
Anpassen umfasst drei Verfahren. Sie kosten Verschiedenes, und die Anbieter bieten sie unterschiedlich weit an. Wer die Frage „lohnt sich das?“ beantworten will, braucht zuerst diese Unterscheidung.
Vortrainieren und nachjustieren, seit 2018
Das Muster ist älter als die Chatmodelle. GPT-1 führte es 2018 ein: erst ein Modell auf sehr viel unbeschriftetem Text vortrainieren, dann für einzelne Aufgaben nachjustieren (externe Seite, openai.com). Wie dieses Lernen ohne Etiketten funktioniert, steht in KI-Wissen, Kapitel 02. Das P in GPT steht für diesen ersten Schritt.
Wie viel der zweite ausmacht, zeigte OpenAI 2022 an einer eigenen Messung: Ein deutlich kleineres, mit menschlicher Rückmeldung nachtrainiertes Modell (externe Seite, arxiv.org) antwortete hilfreicher als ein sehr viel größeres ohne diesen Schritt. Was Sie heute als Assistenten benutzen, ist ein Textfortsetzer, der genau diese Behandlung bekommen hat.
Das Verfahren ist also erprobt, und es ist Teil jedes Modells, das Sie kennen. Die Frage dieses Kapitels lautet, ob Sie es ein zweites Mal anwenden sollten, mit Ihren eigenen Daten.
Die drei Verfahren, sauber getrennt
Volles Fine-Tuning. Das Modell rechnet weitere Beispiele durch, und danach stehen andere Zahlen in der Gewichtsdatei. Am Ende liegt eine zweite, vollständige Modelldatei da. Der Rechenaufwand richtet sich nach der Größe des Modells, weil jeder Parameter angefasst wird.
LoRA und Adapter. Die Gewichte bleiben eingefroren, trainiert wird eine kleine Zusatzdatei daneben. Houlsby und Mitautoren zeigten 2019 mit Adaptern, dass das genügt: Sie kamen bis auf 0,4 Prozent an das volle Fine-Tuning heran (externe Seite, arxiv.org) und brauchten dafür 3,6 Prozent zusätzliche Parameter je Aufgabe (externe Seite, arxiv.org). LoRA verschärfte das 2021 und senkte die Zahl der trainierbaren Parameter um den Faktor 10.000 (externe Seite, arxiv.org), den Speicherbedarf um den Faktor 3 (externe Seite, arxiv.org), bei keiner zusätzlichen Wartezeit (externe Seite, arxiv.org) im Betrieb. QLoRA verband das 2023 mit der gröberen Speicherung der Gewichte, die in Kapitel 01 beschrieben ist, und passte damit die Anpassung eines Modells mit 65 Milliarden Parametern auf eine einzelne Grafikkarte mit 48 Gigabyte (externe Seite, arxiv.org).
Distillation. Ein großes Modell erzeugt die Antworten, ein kleines wird darauf abgestimmt. Der Gedanke stammt von Hinton, Vinyals und Dean, die 2015 zeigten, dass sich das Können mehrerer Modelle in ein einzelnes übertragen (externe Seite, arxiv.org) lässt. Das Ziel ist ein kleineres Modell, das eine Sache so gut kann wie das große.
Die ersten beiden ändern, wie ein Modell antwortet. Das dritte ändert, welches Modell antwortet.
Was die Anbieter davon anbieten
Vier Anbieter, geprüft am 06.08.2026:
| Anbieter | Angebot | laufende Kosten der Bereitstellung |
|---|---|---|
| OpenAI | wird abgewickelt, siehe unten | entfällt |
| Microsoft Azure | überwachtes Fine-Tuning, Präferenzen, Reinforcement Learning | 1,70 Dollar je Stunde (externe Seite, learn.microsoft.com) |
| Google Vertex | Abstimmung der Gemini-Modelle | im Preis der Anfragen enthalten |
| AWS Bedrock | Distillation | Aufrufe beim großen Modell werden berechnet |
| Mistral | abgeschaltet, siehe unten | entfällt |
Der Trainingspreis ist bei zweien öffentlich beziffert. Google verlangt für Gemini 2.0 Flash 3 Dollar je Million Trainings-Token (externe Seite, cloud.google.com), für die Lite-Variante 1 Dollar, abgerufen am 06.08.2026. Microsoft rechnet mit derselben Größenordnung und weist eigens darauf hin, dass der Trainingspreis je Token ein anderer ist als der beim Fragen.
Die Zeile, die den meisten Ärger macht, steht rechts. Bei Microsoft läuft der Stundensatz weiter, solange das Modell bereitsteht, und zwar unabhängig davon, ob jemand fragt. Ein Entwickler-Tarif kommt ohne ihn aus, dafür werden dessen Bereitstellungen nach 24 Stunden automatisch entfernt (externe Seite, learn.microsoft.com), gleichgültig wie stark sie genutzt wurden.
Zwei Anbieter haben ihr Angebot zurückgezogen
OpenAI schreibt es auf die eigene Seite zur Modelloptimierung:
OpenAI is winding down the fine-tuning platform. (externe Seite, developers.openai.com)
Und in derselben Zeile, wen es zuerst trifft:
The platform is no longer accessible to new users (externe Seite, developers.openai.com)
In der Abkündigungsliste steht der Ablauf mit Daten. Seit dem 07.05.2026 bekommt keine Organisation mehr Zugang, die vorher nichts abgestimmt hatte. Seit dem 02.07.2026 fällt heraus, wer sechzig Tage lang kein abgestimmtes Modell benutzt hat. Am 06.01.2027 endet es für alle übrigen. Was schon läuft, läuft weiter, und zwar genau so lange wie sein Grundmodell:
Mistral hat es bereits hinter sich. Die Anleitung dazu steht noch im Netz, mit dem Vermerk obenauf, dass diese Funktion abgekündigt ist und nicht mehr gepflegt wird (externe Seite, docs.mistral.ai).
Was das belegt und was nicht. Belegt ist, dass zwei Anbieter das Selbstbedienungsangebot eingestellt haben, mit Datum und im Wortlaut. Offen bleibt der Grund. Ein Rückzug kann an der Nachfrage liegen, am Aufwand des Betriebs oder daran, dass neuere Modelle mit einer guten Anweisung erreichen, wofür man vorher trainieren musste. Die Anbieter sagen es nicht, und dieses Kapitel rät nicht.
Die Bindung, die dabei entsteht
Eine abgestimmte Fassung gehört Ihnen, und sie bleibt, wo sie entstanden ist. Microsoft sagt beides in einem Satz:
AWS formuliert für die Distillation dasselbe:
Only you can access the final distilled model. (externe Seite, docs.aws.amazon.com)
Das ist eine Zusage und zugleich eine Fessel. Wer ein Modell bei einem Betreiber abstimmt, kann den Betreiber danach nicht mehr wechseln, ohne den Vorgang zu wiederholen. Bei offenen Gewichten wandert die abgestimmte Fassung mit, bei geschlossenen bleibt sie liegen. Die Wahl des Betreibers, die Kapitel 01 behandelt, wird durch eine Abstimmung also enger, als sie vorher war.
Was in eine Trainingsdatei gehört
Alle drei Verfahren brauchen Beispiele, und zwar in der Form, die im Betrieb wirklich vorkommt. Was genau, hängt vom Verfahren ab. Für das überwachte Fine-Tuning verlangt OpenAI Beispiele richtiger Antworten (externe Seite, developers.openai.com), für die Arbeit mit Präferenzen dagegen je ein richtiges und ein falsches Beispiel (externe Seite, developers.openai.com) zur selben Eingabe.
Bei der Distillation entfällt das Sammeln teilweise, weil das große Modell die Antworten selbst erzeugt. Bezahlt wird es trotzdem:
Diese Datei ist eine Datenlieferung wie jede andere. Wer sie aus dem laufenden Betrieb zusammenstellt, gibt Betriebsdaten an einen Dienstleister, und die Fragen dazu stehen in Kapitel 01.
Warum das Ergebnis mit dem Grundmodell veraltet
Eine abgestimmte Fassung ist aus einem bestimmten Modell entstanden und hängt daran. Wird dieses Modell abgekündigt, endet auch sie. OpenAI schreibt das für den eigenen Ausstieg ausdrücklich hin, und es gilt allgemein.
Damit bekommt die Abstimmung eine Halbwertszeit, die niemand kennt, wenn er anfängt. Die Modellstände wechseln zügig, und jeder Wechsel bedeutet, dass die Beispiele erneut durchlaufen müssen. Das ist derselbe Posten, der in Grundkurs, Kapitel 06 beim Prompt auftaucht, hier mit einer Rechnung dahinter.
Die Frage nach dem Verhältnis von Aufwand und Nutzen hat zwei Seiten, und sie sind unterschiedlich gut belegt. Der Aufwand steht in Preisverzeichnissen. Für den Nutzen gibt es das nicht, und der Umgang damit ist der Kern dieser Ebene.
Was öffentlich beziffert ist
Fünf Posten, alle aus Herstellerangaben, abgerufen am 06.08.2026:
| Posten | Beispielwert | Quelle |
|---|---|---|
| Training je Million Token | 3 Dollar für Gemini 2.0 Flash, 1 Dollar für die Lite-Variante | Google (externe Seite, cloud.google.com) |
| Mindestgebühr je Lauf | 4 Dollar | Mistral (externe Seite, docs.mistral.ai) |
| Bereitstellung je Stunde | 1,70 Dollar | Microsoft (externe Seite, learn.microsoft.com) |
| Ablage je Modell und Monat | 2 Dollar | Mistral (externe Seite, docs.mistral.ai) |
| Aufrufe beim großen Modell | nach dessen üblichem Tarif | AWS (externe Seite, docs.aws.amazon.com) |
Dazu die angenehme Auskunft, dass Fehlversuche nicht durchschlagen. Microsoft berechnet weder Wartezeit noch gescheiterte Läufe, abgebrochene Läufe vor Trainingsbeginn oder die Sicherheitsprüfung der Daten (externe Seite, learn.microsoft.com).
Für die Wirkungsseite steht auf denselben vier Anbieterseiten nichts Vergleichbares. Gesucht wurde am 06.08.2026 gezielt nach einer Angabe darüber, wie viel besser ein abgestimmtes Modell bei einer benannten Aufgabe abschneidet. Wer eine solche Zahl braucht, erhebt sie selbst.
Die Rechnung, an einem Beispiel des Anbieters
Microsoft rechnet einen Monat vollständig durch. Der Fall ist ein Chatbot mit 10.000 Gesprächen, 20 Millionen Token hinein und 40 Millionen hinaus, das Modell durchgehend bereitgestellt:
Bereitstellung 1,70 × 30 × 24 = 1.224,00 Dollar
Anfragen 22,00 + 176,00 = 198,00 Dollar
─────────────
1.422,00 Dollar
Der Anteil der Bereitstellung liegt damit bei 86 Prozent. Das ist der eigentliche Befund: Der größere Posten entsteht, bevor jemand eine Frage stellt. Er läuft an Wochenenden weiter, in der Urlaubswoche und an jedem Tag, an dem das Modell nichts zu tun hat.
Microsoft schreibt selbst dazu:
The numbers in this article are for example purposes only. (externe Seite, learn.microsoft.com)
Das gilt für die Beträge. Das Verhältnis hängt an der Auslastung, und die Richtung bleibt bei jeder Auslastung dieselbe: Je weniger Anfragen, desto größer der Anteil der reinen Bereitschaft. Erst bei einem Vielfachen dieser Anfragemenge kehrt sich das Bild um.
Für einen Versuchsaufbau gibt es deshalb den Entwickler-Tarif ohne Stundensatz, dessen Bereitstellungen nach 24 Stunden automatisch entfernt (externe Seite, learn.microsoft.com) werden. Er beantwortet die Frage „funktioniert es überhaupt“, ohne die Rechnung zu eröffnen.
Was die Arbeiten messen, und was daraus folgt
Die Zahlen aus der Forschung beziffern durchweg dasselbe, nämlich den Abstand zwischen zwei Verfahren auf einem festen Datensatz:
| Arbeit | Aussage |
|---|---|
| Adapter, 2019 (externe Seite, arxiv.org) | 0,4 Prozent Abstand zum vollen Fine-Tuning bei 3,6 Prozent zusätzlicher Parameter |
| LoRA, 2021 (externe Seite, arxiv.org) | Faktor 10.000 bei den trainierbaren Parametern, Faktor 3 beim Speicher |
| QLoRA, 2023 (externe Seite, arxiv.org) | 65 Milliarden Parameter auf einer Karte mit 48 Gigabyte, bei erhaltener Leistung |
| DistilBERT, 2019 (externe Seite, arxiv.org) | 40 Prozent kleiner, 60 Prozent schneller, 97 Prozent des Sprachverständnisses |
Diese Zahlen belegen, dass die sparsamen Verfahren genügen. Sie sagen nichts darüber, was eine Abstimmung bei Ihrer Aufgabe bringt, weil ihr Bezugspunkt jedes Mal das volle Fine-Tuning derselben Sache ist. Die interessante Frage steht eine Ebene darüber, nämlich ob überhaupt trainiert werden muss.
DistilBERT ist die aussagekräftigste der vier, weil dort alle drei Seiten zugleich beziffert sind und der Verlust benannt wird. Drei Prozent Sprachverständnis sind der Preis für ein Modell, das 40 Prozent kleiner ist. Ob dieser Tausch sich lohnt, entscheidet die Anwendung.
Was eine eigene Wirkungsmessung voraussetzt
Der Satz „das Fine-Tuning hat geholfen“ behauptet erst dann etwas, wenn vier Dinge geklärt sind:
Ein Prüfsatz, der im Training nicht vorkam. Sonst misst die Prüfung, wie gut das Modell auswendig gelernt hat. Er wird vor dem Training abgetrennt und danach nicht mehr angefasst.
Dasselbe am Grundmodell, mit demselben Prompt. Ohne diesen Vergleich ist offen, ob die Verbesserung vom Training kommt oder von der schärferen Aufgabenbeschreibung, die man beim Aufbereiten der Daten nebenbei geschrieben hat. Das ist der häufigste Fehlschluss in diesem Gebiet.
Ein Maß für die Sache statt für die Form. Ein abgestimmtes Modell trifft den gewünschten Ton fast immer besser, das ist der Zweck. Ob die Auskunft stimmt, ist eine andere Frage, und dafür braucht es ein eigenes Maß. Die Verfahren aus Grundkurs, Kapitel 07 gelten hier unverändert.
Eine Wiederholung nach dem nächsten Modellwechsel. Die Messung gilt für das Grundmodell, an dem sie gemacht wurde. Erscheint ein neues, wird sie wiederholt, und zwar zuerst ohne Abstimmung. Es kommt vor, dass der Nachfolger ohne jedes Training erreicht, wofür der Vorgänger eines brauchte.
Fünf Schlüsse, die nicht folgen
Aus dem Rückzug zweier Anbieter folgt kein Urteil über das Verfahren. Wer ein Angebot einstellt, sagt etwas über sein Geschäft. Was eine Abstimmung technisch leistet, steht in den Arbeiten oben und bleibt davon unberührt.
Ein sparsames Verfahren ist gegen das volle Fine-Tuning günstig. Der Faktor 10.000 aus der LoRA-Arbeit vergleicht zwei Trainingsarten miteinander. Gegen einen besseren Prompt oder eine Wissensbasis gemessen ist er ohne Aussage.
Ein kleines abgestimmtes Modell, das ein großes schlägt, schlägt es auf einer Aufgabe. Genau der, für die es abgestimmt wurde. Auf allen anderen bleibt es das kleinere Modell.
Eine niedrige Rechnung im ersten Monat sagt wenig. Der Trainingspreis fällt einmal an, die Bereitstellung dauerhaft, und der Modellwechsel bringt den Trainingspreis zurück. Gerechnet wird über die erwartete Lebensdauer des Grundmodells.
Aus einer erfolgreichen Abstimmung folgt nicht, dass sie nötig war. Solange der Vergleich am Grundmodell fehlt, ist die Verbesserung ein Beobachtungswert ohne Kontrollgruppe. Diese Prüfung kostet einen Nachmittag und entscheidet über einen Posten, der monatlich wiederkehrt.
Quellen
14 Einträge, davon 4 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitDokumentationerreichbar
Microsoft, Fine-tuning cost management (externe Seite, learn.microsoft.com)
learn.microsoft.comgeprüft 24.09.2026
Die ergiebigste Quelle zur Kostenseite des Fine-Tunings, weil ein Anbieter hier seine eigene Rechnung offenlegt. Sie trennt den einmaligen Trainingspreis von den laufenden Kosten, nennt den Stundensatz für die Bereitstellung und rechnet einen Monat vollständig durch: 1.224 Dollar Bereitstellung und 198 Dollar Nutzung ergeben 1.422 Dollar, abgerufen am 06.08.2026. Microsoft schreibt selbst dazu, dass diese Beträge Beispielwerte sind.
SchlüsselarbeitOriginalarbeiterreichbar
Distilling the Knowledge in a Neural Network (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Hinton, Vinyals und Dean beschreiben am 09.03.2015 den Gedanken, das Können mehrerer großer Modelle in ein einzelnes kleines zu übertragen. Der Begriff Distillation stammt von hier. Was Anbieter heute als Verfahren verkaufen, ist die Anwendung dieser Arbeit auf Sprachmodelle.
SchlüsselarbeitOriginalarbeiterreichbar
LoRA: Low-Rank Adaptation of Large Language Models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Hu und sieben Mitautoren stellen am 17.06.2021 das Verfahren vor, mit dem sich ein Modell anpassen lässt, ohne seine Gewichte anzufassen. Trainiert werden kleine Zusatzmatrizen, das Modell selbst bleibt eingefroren. Das ist der Grund, warum die Anpassung großer Modelle heute auf gewöhnlicher Hardware stattfindet, und die Grundlage aller sparsamen Verfahren, die seither dazugekommen sind.
SchlüsselarbeitOriginalarbeiterreichbar
Training language models to follow instructions with human feedback (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Ouyang und Mitautoren zeigen am 04.03.2022, dass ein deutlich kleineres, mit menschlicher Rückmeldung nachtrainiertes Modell hilfreicher antwortet als ein sehr viel größeres ohne. Das ist der Schritt, der aus einem Textfortsetzer einen Assistenten macht, und die Voraussetzung für ChatGPT acht Monate später.
Dokumentationerreichbar
OpenAI, Model optimization (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
OpenAIs Übersicht der Anpassungsverfahren. Sie beschreibt vier davon mit ihren Anwendungsfällen und bringt zugleich die Ankündigung, dass die Plattform dafür abgewickelt wird. Beides steht auf derselben Seite, und die Anwendungsfälle sind deshalb weiterhin die Auskunft des Anbieters darüber, wofür sich das Verfahren eignet.
Dokumentationerreichbar
Mistral, Fine-tuning (Deprecated) (externe Seite, docs.mistral.ai)
docs.mistral.aigeprüft 24.09.2026
Mistrals Anleitung zum Fine-Tuning, mit dem Hinweis auf ihre eigene Abschaltung obenauf. Sie ist damit der zweite belegte Rückzug eines Anbieters und nennt zugleich die kleinsten Beträge des ganzen Themas: vier Dollar Mindestgebühr je Trainingslauf und zwei Dollar Ablage je Modell und Monat.
Originalarbeiterreichbar
Improving Language Understanding by Generative Pre-Training (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
GPT-1, vorgestellt am 11.06.2018. Führt das Muster ein, das bis heute gilt: erst ein Modell auf sehr viel unbeschriftetem Text vortrainieren, dann für einzelne Aufgaben nachjustieren. Das G in GPT steht für generative, das P für pre-trained, das T für Transformer.
Originalarbeiterreichbar
Parameter-Efficient Transfer Learning for NLP (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Houlsby und Mitautoren zeigen am 02.02.2019, dass sich ein Modell über kleine eingeschobene Bausteine an eine Aufgabe anpassen lässt, während der Rest unverändert bleibt. Die Arbeit steht zwei Jahre vor LoRA und liefert den Begriff Adapter. Ihr gemessener Abstand zum vollen Fine-Tuning ist die erste Zahl, die belegt, dass ein sparsames Verfahren genügt.
Originalarbeiterreichbar
QLoRA: Efficient Finetuning of Quantized LLMs (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Dettmers und Mitautoren verbinden am 23.05.2023 die grobe Speicherung der Gewichte mit dem Verfahren von LoRA. Damit passt die Anpassung eines sehr großen Modells auf eine einzelne Grafikkarte. Die Arbeit liefert die einzige Größenordnung des Themas, die sich auf eigene Hardware beziehen lässt.
Dokumentationerreichbar
OpenAI, Deprecations (externe Seite, developers.openai.com)
developers.openai.comgeprüft 24.09.2026
Die Liste, in der OpenAI seine Abkündigungen datiert. Der Eintrag vom 07.05.2026 wickelt das Fine-Tuning in drei Schritten ab und nennt für jeden das Datum. Er regelt außerdem, was mit bereits abgestimmten Modellen geschieht, und knüpft deren Ende an das Ende ihres Grundmodells.
Dokumentationerreichbar
Google, Vertex AI, Preise für generative KI (externe Seite, cloud.google.com)
cloud.google.comgeprüft 24.09.2026
Googles Preisverzeichnis, und der zweite Anbieter, der den Trainingspreis öffentlich beziffert. Für Gemini 2.0 Flash stehen dort 3 Dollar je Million Trainings-Token, für die Lite-Variante 1 Dollar, abgerufen am 06.08.2026. Die Angaben stehen in Preistabellen und lassen sich deshalb nicht als Satz zitieren. Zum Betrieb eines abgestimmten Modells führt die Seite an zwei Stellen einander widersprechende Angaben, weshalb hier nur der Trainingspreis belegt wird.
Dokumentationerreichbar
AWS, Customize a model with distillation in Amazon Bedrock (externe Seite, docs.aws.amazon.com)
docs.aws.amazon.comgeprüft 24.09.2026
Die Dokumentation, in der ein großer Anbieter Distillation als buchbares Verfahren beschreibt und dabei den Ablauf ausschreibt: Ein großes Modell erzeugt die Antworten, ein kleines wird darauf abgestimmt. Sie nennt die Zusage, dass allein der Kunde an das Ergebnis kommt, und den Posten, den man dabei leicht übersieht, nämlich die Abrechnung der Aufrufe beim großen Modell.
Dokumentationerreichbar
learn.microsoft.comgeprüft 24.09.2026
Die Seite, die den Unterschied zwischen Modell und Betreiber greifbar macht: Dieselben Modelle laufen bei Microsoft, und der Hersteller sieht dabei nichts. Sie nennt außerdem die Angabe, an der die Regionswahl praktisch scheitert, nämlich den Bereitstellungstyp, und die Auskunft darüber, wer die Eingaben bei der Missbrauchserkennung zu sehen bekommt.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Sanh und Mitautoren führen am 02.10.2019 vor, was Distillation an einem echten Sprachmodell leistet, und beziffern alle drei Seiten: Größe, erhaltenes Können und Tempo. Es ist die einzige Wirkungsangabe des Themas, die aus einer offengelegten Messung stammt. Die Anbieter beziffern allein ihre Preise.