Originalarbeiterreichbar
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Shao und Mitautoren stellen am 05.02.2024 mit DeepSeekMath das Verfahren GRPO vor, eine Variante von PPO, die je Aufgabe eine Gruppe von Antworten zieht und sie gegeneinander wertet, ohne ein eigenes Wertmodell zu trainieren. Dasselbe Verfahren steht hinter DeepSeek R1 und hinter dem GRPO-Trainer von TRL.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 15.09.2026:
we introduce Group Relative Policy Optimization (GRPO), a variant of Proximal Policy Optimization (PPO), that enhances mathematical reasoning abilities while concurrently optimizing the memory usage of PPO
bestätigt 24.09.2026
TRL schickt beim asynchronen Training nur noch den LoRA-Adapter an vLLM, Trainer und Inferenz brauchen keine gemeinsame Maschine mehrGroup Relative Policy Optimization im Glossar