#GRPO
共 98 条 · 7 天 6 条 · 30 天 30 条
6月10日
6月9日
Structured Ignorance Certificates:让推理模型学会承认“不知道”
这项研究直接戳中了LLM的“幻觉”痛点——用结构化输出让模型承认无知,做AI安全或可靠性研究的团队值得关注,尤其适合需要高可信度输出的应用场景。
6月3日
QUBRIC:联合设计查询与评分标准,突破RLVR限制
QUBRIC解决了RL在非可验证任务中的核心瓶颈——查询与评分标准不匹配,做RL训练或AI对齐的团队可以直接参考其方法,提升模型在开放推理任务上的表现。
6月2日
多模态大模型评测偏见:Perceptual Perturbation 与 Reward Modeling 缓解方案
做多模态模型评测的团队终于有了对抗感知偏见的方法——Perceptual Perturbation 框架能直接提升评估者的视觉可靠性,建议做 MLLM 评测基准的开发者点开看看实验细节。
5月28日
英伟达开源 Polar 框架,Codex 跑分暴涨 594.74%
做代码智能体训练的团队终于有了一个不用重写框架就能接入强化学习的方案——Polar 让 Codex 跑分暴涨近 6 倍,建议搞 AI 编程的开发者直接看论文和代码。
NVIDIA 发布 Polar:跨 Codex、Claude Code 和 Qwen Code 的 GRPO 训练框架
Polar 解决了 RL 训练智能体时需修改框架的痛点,做代码智能体或 RL 训练的开发者可以直接集成,无需改动现有工具链,值得一试。
5月26日
Open-MM-RL 教程:构建多模态 RLVR 管线,含视觉语言提示与 GRPO 导出
多模态 RLVR 是当前强化学习与视觉语言结合的热点方向,这篇教程从数据集到奖励函数再到导出一步到位,做多模态推理或 RL 研究的团队可以直接照着搭,省去自己踩坑的时间。
5月22日
5月21日
5月19日
5月18日
5月16日
5月13日
5月11日
Rubric-Grounded RL:结构化评判奖励实现泛化推理
该研究通过分解奖励为多标准评判规则,实现了更细粒度的优化信号,在多个推理基准上验证了迁移效果,对大模型推理能力的训练方法有重要参考价值。
arXiv cs.AI原文