Originalarbeiterreichbar
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
DeepSeek beschreibt am 22.01.2025 ein Modell mit offenen Gewichten, das Zwischenschritte über Reinforcement Learning erwirbt. Damit ist der zweite Skalierungspfad, mehr Rechenzeit zur Antwortzeit, nicht mehr auf geschlossene Anbieter beschränkt.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 04.09.2026:
Here we show that the reasoning abilities of LLMs can be incentivized through pure reinforcement learning (RL), obviating the need for human-labeled reasoning trajectories.
bestätigt 24.09.2026surpassing its counterparts trained via conventional supervised learning on human demonstrations
bestätigt 24.09.2026
KI-GeschichteWas offene Gewichte wert sind, wenn sie 1,56 Terabyte wiegenGroup Relative Policy Optimization im GlossarReasoning-Modell im GlossarReinforcement Learning im Glossar02 Maschinelles Lernen