研究计划

GRPO 爆火之后

80 篇 2025–2026 论文:GRPO 实际优化什么、信号在哪里失效、如何保留多样性与降低 rollout 成本,以及何时更简单的方法更好 · 80 篇 · English ↗
筛选规则。本轮只保留把解释或修改 GRPO 作为核心贡献、发现此前缺失的故障,或给出领域反例的论文;仅仅使用原始 GRPO 的应用不收入。页面按实际研究顺序组织:先确定目标与故障,再修正梯度或信用,验证奖励,维持探索,分配并复用 rollout,最后检查这些假设在智能体、生成模型和推荐中是否仍成立。
0 / 80 已读
怎样判断一个新变体。先固定基础模型、提示模板、奖励和验证器,再明确故障究竟是目标偏差、无信号组、token 信用错误、奖励噪声、熵坍塌、rollout 浪费、策略滞后,还是领域结构错配。只修改与该故障直接相关的组件,并同时比较生成 token、验证器调用、更新计算、墙钟时间、Pass@1、Pass@K 和域外质量。如果过滤式 REINFORCE、全局归一化、奖励加权 SFT 或带 critic 的 PPO 在同预算下更好,就采用更简单的方法。