ZooWork
ZooWork Market · Skill

fine-tuning-with-trl

Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and reward model training. Use when need RLHF, align model with preferences, or train from human feedback. Works with HuggingFace Transformers.

davila7
davila7-claude-code-templates-post-training-trl-fine-tuning · v1.0.0
分类ai-llms
安装次数30
更新时间2026-08-13T09:51:27.957Z
校验状态待验证
Post-TrainingTRLReinforcement LearningFine-TuningSFTDPOPPOGRPORLHFPreference AlignmentHuggingFace