ZooWork
ZooWork Market · Skill

miles-rl-training

Provides guidance for enterprise-grade RL training using miles, a production-ready fork of slime. Use when training large MoE models with FP8/INT4, needing train-inference alignment, or requiring speculative RL for maximum throughput.

◇
Orchestra-Research
orchestra-research-ai-research-skills-miles · v1.0.0
分类ai-llms
安装次数11
更新时间2026-09-13T07:33:03.045Z
校验状态待验证
Reinforcement LearningMoEFP8INT4EnterpriseSGLangMegatron-LM