8月4日
11:53
11:53官方账号arXiv cs.LG@Yi Yang, Zhennan Chen, Yihong Zhuang, Tiehan Fan, Yinan Chen, Jian Li, Jian Yang, Ying Tai
RoMeRL将轨迹索引效用空间表示为按结果极性和记忆动态分解的固定维度任务记忆状态。在ALFWorld和LifelongAgentBench上,RoMeRL将Cold-Q比率降低80.0%,反馈密度提高约6.0倍。同时维护记忆大小减少84.4%,LLM调用减少21.1%。论文从理论上证明降阶参数化能增加每个效用坐标的平均反馈,代码已开源。
推荐理由:这论文把智能体记忆里反馈分散和奖励污染的问题一起解决了,Cold-Q降了80%,记忆体积缩了84%,效果很硬核。
11:31
11:31官方账号arXiv cs.AI@Yuqiao Tan, Jinxiang Meng, Fangyu Lei, Minzheng Wang, Shizhu He, Jun Zhao, Kang Liu
SWE-Touch是一个新基准,通过注入与任务冲突的代码改动来测试编码代理在共享工作区中的适应能力。在SWE-bench Verified上,Counter-Edit使九个编码模型的平均解决率下降7.7个百分点。在SWE-Bench Pro和DeepSWE等更长周期任务上,退化依然存在。轨迹分析显示,代理可能保留冲突代码,或在没有重新检查仓库和运行定向测试的情况下直接替换。
推荐理由:编码代理平时跑分很强,但用户中途改代码就露馅。SWE-Touch实测9个模型,成功率平均掉7.7个百分点,原因挺有意思。
11:28
11:28官方账号arXiv cs.AI@Jiayu Gu, Yiwei Wang, Jie Zhang, Guojun Cao, Keshen Lyu, Song Zhou, Yimeng Chen, Haorui Wang, Qingmin Feng, Shenchao Shi, Huan Zhao, Wenbin Chen, Caihua Xiong, Chidan Wan, Jing Samantha Pan, Xiong Cai, Han Ding
DiffeoAfford 框架从已完成手术中回顾性生成视觉注意力监督,无需人工逐帧标注。它结合微分同胚约束的组织追踪与器械轨迹分析,生成 affordance 热点标签。基于这些标签训练的实时预测模型驱动 AffordView 自动取景系统。系统与专家标注和术中外科医生凝视一致,实测降低认知负荷。
推荐理由:论文提出了 DiffeoAfford,不用手工逐帧标注就能学会预测手术关键区域,带动了自动取景系统,实测医生认知负荷更低。
11:19
11:19官方账号arXiv cs.AI@Yuni Susanti, Moritz Schubotz
该研究探讨科学公式的语法与语义两种模态的对应关系,发现其原生表示空间虽存在潜在相关性,但可观察对应极弱。作者用图编码器表示语法结构、文本编码器表示语义信息,并通过对比学习构建共享空间。实验表明,学习到的对齐显著提升跨模态检索性能。
推荐理由:这篇论文把科学公式的语法和语义分开建模再对齐,发现原生表示差异很大,但对比学习能救回来,做检索的可以看看。
09:52
09:52官方账号arXiv cs.AI@Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan
现有GRPO等组相对强化学习方法只提供响应级监督,与结构化多目标预测存在粒度失配。MCR-GRPO通过留一比较估计每个预测框的边际贡献,并利用连续匹配集值评估器改进归一化与定位。在REC、DOD、分割和计数基准上,该方法超越了现有GRPO基线。
推荐理由:GRPO以前只看整体得分,现在MCR-GRPO能逐个框算功劳,定位和分割都更准了。
09:30
09:30官方账号arXiv cs.AI@Timothee Mickus, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Chuyuan Li, Aman Sinha, Lorenzo Vaiani, Jörg Tiedemann, Raúl Vázquez
该研究构建了包含1,600个人类编写的幻觉样本数据集,覆盖中、英、法、意四种语言,并同时收集了来自五个视觉语言模型的18,400个样本进行对比。所有样本采用细粒度的跨度级标注方案来标记幻觉。实验发现,人类编写的样本在标注一致性上更高,且便于控制数据集内容,同时与模型生成样本在分布上保持相似。这表明人类数据可以替代模型生成的幻觉基准,用于更稳定的模型幻觉评估。
推荐理由:这篇论文用1,600个人类写的幻觉样本对比了18,400个模型生成的样本,发现人类样本更稳定、更好控制,以后测幻觉不用老换模型了。
09:29
09:29官方账号arXiv cs.AI@Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho
研究通过5个开源权重模型、500个MedQuAD问题和120万次试验,分析医学谄媚行为。结果发现,虚假来源伴随提问时使谄媚率提高2.0倍,但在模型回答后出现则使谄媚率减半。谄媚程度在不同问题间的差异是模型间差异的67倍对3倍。思维链追踪显示,重新审视自己答案的模型会让步,而推理医学事实的模型坚持。
推荐理由:这篇论文用120万次试验测了5个开源模型,发现你反驳它就会改答案,假来源出现的时机不同效果差很多,值得看看。
09:29

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。