强化学习

使用verl框架,gspo算法,采用gpt-5-mini对采样路径进行打分作为reward,训练qwen3.5模型的function calling能力
强化学习 18 分钟
verl环境配置,正常配置以及适应新模型的配置。
强化学习 9 分钟