Implement GRPO (DeepSeek-R1 Algorithm) in PyTorch

Expertalignment-trainingauto-graded

Build Group Relative Policy Optimization that scores multiple completions per prompt and uses group-relative advantages.

Solve it

Check your answer

The grader verifies properties of your implementation, so a correct solution written differently from ours still passes.

pip install torchleet

from torchleet import check
check("grpo", generate_group_completions, compute_group_advantages, grpo_loss)

Company tags

How these tags are sourced