ZooWork
ZooWork Market · Skill

grpo-rl-training

Expert guidance for GRPO/RL fine-tuning with TRL for reasoning and task-specific model training

davila7
davila7-claude-code-templates-post-training-grpo-rl-training · v1.0.0
分类ai-llms
安装次数23
更新时间2026-08-13T09:52:51.625Z
校验状态待验证
Post-TrainingReinforcement LearningGRPOTRLRLHFReward ModelingReasoningDPOPPOStructured Output