NachschlagenQuellenregister

Originalarbeiterreichbar

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

arxiv.org (externe Seite)

DeepSeek beschreibt am 22.01.2025 ein Modell mit offenen Gewichten, das Zwischenschritte über Reinforcement Learning erwirbt. Damit ist der zweite Skalierungspfad, mehr Rechenzeit zur Antwortzeit, nicht mehr auf geschlossene Anbieter beschränkt.

geprüft 24.09.2026

Worauf sich diese Seite beruft, wörtlich, abgerufen am 04.09.2026:

  • Here we show that the reasoning abilities of LLMs can be incentivized through pure reinforcement learning (RL), obviating the need for human-labeled reasoning trajectories.bestätigt 24.09.2026
  • surpassing its counterparts trained via conventional supervised learning on human demonstrationsbestätigt 24.09.2026

KI-GeschichteWas offene Gewichte wert sind, wenn sie 1,56 Terabyte wiegenGroup Relative Policy Optimization im GlossarReasoning-Modell im GlossarReinforcement Learning im Glossar02 Maschinelles Lernen

Alle Quellen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.