ZooWork Market · Skillgrpo-rl-trainingExpert guidance for GRPO/RL fine-tuning with TRL for reasoning and task-specific model training◇davila7davila7-claude-code-templates-post-training-grpo-rl-training · v1.0.0分类ai-llms安装次数23更新时间2026-08-13T09:52:51.625Z校验状态待验证Post-TrainingReinforcement LearningGRPOTRLRLHFReward ModelingReasoningDPOPPOStructured Output在 ZooWork 中使用返回目录