CoRT: token-level credit assignment for rubric-guided RL
English summary
CoRT introduces a token-level credit assignment method for rubric-guided reinforcement learning. It addresses the limitation in GRPO where rubric feedback is collapsed into a single scalar reward, instead providing fine-grained credit to individual tokens. This allows models to learn from detailed rubric evaluations on a per-token basis.
Chinese summary
CoRT 提出一种面向评分准则引导的强化学习的标记级信用分配方法。它解决了GRPO中评分反馈被压缩为单一标量奖励的局限,改为对每个标记进行细粒度的信用分配。这使得模型能够在标记级别上从详细的评分准则评估中学习。
Key points
CoRT proposes token-level credit assignment for rubric-guided RL.
CoRT提出了面向评分准则引导的强化学习的标记级信用分配。
It overcomes GRPO’s collapse of rubric feedback into a single scalar reward.
它克服了GRPO将评分准则反馈压缩为单一标量奖励的问题。
Enables per-token learning from rubric-based evaluators.
使得能够基于评分准则的评估器进行逐标记学习。