zo0043
归档
首页
分类
标签
周刊
搜索
关于
强化学习
DeepSeek 论文课(八):模型怎么会"想"了:GRPO 与 R1
模型怎么会"想"了:GRPO 与 R1 先给结论: 上一篇讲"结构省钱",这一篇转向训练方法。模型的"...