流策略微调太慢的问题有解了,这篇 SQAM 砍掉了每步的反向传播计算,OGBench 难题成功率提升最多 35 个点,还验证到了真实双臂机器人上。
#论文解读
共 13 条 · 7 天 5 条 · 30 天 11 条
信息流里打上「论文解读」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
论文10:59
SQAM:用标量伴随匹配做 Q-Learning,加速流策略 RL 微调10月6日
Meta AI 发布 MIRA:拆分架构解决长程研究智能体的决策难题
Meta AI 出的论文,把研究智能体拆成元推理器加执行器,专门解决跑长任务时不知道下一步研究啥的问题,做 agent 的可以看看。
10月5日
10月4日
Meta 等机构新论文:分支化自我改进的 Agent Harness 优化
Meta 和 Duke 的论文把 agent harness 自动调优拆成专精分支再加路由,Olympiad 数学准确率从 46% 拉到 62%,做 agent 自动调优的可以看看。
9月26日
9月25日
9月24日
Google 研究:Harness-Zero 在训练后移除专用 harness,任务成功率反升
Google 这篇论文把 agent harness 蒸馏进模型,移除专用 harness 后成功率反而从 23.3% 涨到 44.3%,比带 harness 还高,做 agent 的都该看看。
Apple 提出 probe guidance:用扩散模型内部状态引导 flow matching
Apple 发的新方法 probe guidance,不用多跑一次 forward pass 就能给 flow matching 模型加引导,搞生成模型的可以看看。
Google 论文提出 RRSI:防止智能体 harness 自动进化过拟合基准
Google 这篇论文值得做 Agent 的人细读:自动优化 harness 会让你 eval 分数涨但真实任务变差,RRSI 用双向正则化解决了这个问题。
6月23日
论文08:23
提示注入新研究:角色混淆让LLM更信文本风格而非内容这篇论文揭示了一个反直觉的发现:LLM会被文本的风格欺骗,而不是内容。研究者用简单的'去风格化'就能把攻击成功率从61%打到10%,对理解AI安全很有启发。
5月16日
产品22:42
Knowly 解读视频和论文效果惊艳,不输 NotebookLM想快速吃透 YouTube 视频或学术论文的读者,Knowly 是 NotebookLM 之外的好选择,Chrome 插件已被谷歌精选,值得一试。