NachschlagenQuellenregister

Artikelerreichbar

LoRA Without Regret

thinkingmachines.ai (externe Seite)

Schulman und Mitautoren bei Thinking Machines messen im September 2025, wann ein LoRA-Adapter dem vollen Fine-Tuning gleichkommt. Für Reinforcement Learning mit Policy-Gradient-Verfahren gilt das nach ihrer Messung schon bei Rang 1, begründet damit, dass die Bewertung je Episode nur wenige Bit Information liefert. Der Text stammt von einem Anbieter, der Fine-Tuning als Dienst verkauft.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 15.09.2026:

  • LoRA fully matches the learning performance of FullFT when running policy gradient algorithms for reinforcement learning, even with ranks as low as 1bestätigt 24.09.2026
  • in policy gradient methods, learning is driven by the advantage function which provides only O(1) bits per episodebestätigt 24.09.2026

TRL schickt beim asynchronen Training nur noch den LoRA-Adapter an vLLM, Trainer und Inferenz brauchen keine gemeinsame Maschine mehrLow-Rank Adaptation im Glossar

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.