6月19日
10:22
10:22官方账号arXiv cs.AI@Zepeng Li, Jie Ren, Zhanyong Tang, Jie Zheng, Zheng Wang
AutoPass 是一个多智能体框架,利用编译器和运行时证据引导 LLM 生成编译器优化决策。它在 LLVM 编译器上实现,在 x86-64 和 ARM64 系统上测试,分别比 LLVM -O3 实现了 1.043x 和 1.117x 的几何平均加速。AutoPass 无需离线训练或微调,可直接应用于新基准和平台。
推荐理由:AutoPass 把 LLM 变成编译器调优助手,不用训练就能在 x86 和 ARM 上跑出比 -O3 还快的速度,实测有 4-11% 的加速。
10:16
10:16官方账号arXiv cs.AI@Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin
ELVA提出一种基于规则强化学习(RLVR)的框架,解决对比学习在多模态检索中的“粒度盲视”问题——模型忽略查询中的粒度信息。该方法不依赖奖励模型,通过规则奖励联合优化负样本排序并扩大正负样本相似度差距。为精准评估,作者引入新基准MRBench,专用于多粒度查询场景。ELVA在标准检索基准上达到最先进结果,并在MRBench上实现13.1%的提升。
推荐理由:这篇论文提出了ELVA,用强化学习思路改多模态检索,解决了对比学习忽略粒度的问题,还在新基准MRBench上提了13.1%,值得做检索方向的人看看。
6月18日
10:57
10:57官方账号arXiv cs.AI@Siyi Gu, Jialin Chen, Sophia Zhou, Arman Cohan, Rex Ying
提出Rubric-Conditioned Self-Distillation框架,用评分标准替代标量奖励,提供token级指导。方法分两步:先学习生成任务级评分标准,再训练评分标准引导的推理器。在多个科学推理基准上平均超越GRPO 1.0分、OPSD 0.9分。避免了单一参考推理链的噪声和标量奖励的模糊性。
推荐理由:想提升推理模型训练效果?这篇用评分标准做细粒度自蒸馏,比GRPO和OPSD都强,实验扎实。
10:55
10:55官方账号arXiv cs.LG@Hannah Le, Ramesh Ramasamy, Alex Urrutia, Mahsa Yazdani, Tim Proctor, Kenny Workman
TxBench-PP是一个用于评估AI agent在小分子临床前药理学中决策能力的基准,包含100个涉及作用机制、药效学等任务的评估。在16个模型配置(涉及11个模型和4800条轨迹)中,最佳配置Claude Opus 4.8 / Pi仅通过59.3%(178/300)的端点尝试,GPT-5.5 / Pi通过55.3%。结果表明,当前AI系统无法可靠复现临床前药理学决策。
事件专题

推荐理由:想看看AI在药物发现中到底行不行?这个基准测试用4800条轨迹告诉你,Claude Opus 4.8和GPT-5.5都还差得远,最高才59.3%的通过率。
10:31
10:31官方账号arXiv cs.LG@Daochen Zha, Chun How Tan, Xin Liu, Bin Xu, Han Zhao, Xiaowei Liu, Tracy Yu, Hui Gao, Huiji Gao, Liwei He, Stephanie Moyerman, Sanjeev Katariya
JourneyFormer是Airbnb提出的序列建模解决方案,用于处理搜索排序中客人序列长、探索性强且标签稀疏的问题。模型设计涵盖事件选择、ID嵌入、模型架构和标签归因等关键环节,并采用专门策略加速训练和推理。JourneyFormer已部署到Airbnb生产环境,离线排名指标和线上A/B测试(覆盖2个生产表面)均显示关键业务指标显著提升。
推荐理由:Airbnb搞了个JourneyFormer,专治搜索排序中又长又乱的用户序列,实测线上A/B测试效果很不错。
6月17日
10:43
10:43官方账号arXiv cs.AI@Md Tawkat Islam Khondaker, Raymond Li, Muhammad Abdul-Mageed, Laks V. S. Lakshmanan, Issam H. Laradji
DRFLOW 是一个用于评估智能体从异构来源预测个性化工作流的新型基准,包含 100 个任务、5 个领域、1,246 个参考步骤,并基于 3,900 多个来源构建。它定义了 7 项诊断指标,涵盖事实基础、步骤恢复、结构排序、条件解析和个性化。作者还提出了 DRFLOW-Agent (DRFA) 作为参考代理,其在平均 F1 分数上比强基线代理提升最多 10.02%,但仍有较大改进空间。
推荐理由:想测测你家智能体能不能给出真正可执行的步骤?DRFLOW 用 100 个企业任务逼真考核,DRFA 也才比普通基线高 10%,挑战不小。
10:17
10:17官方账号arXiv cs.LG@Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen
83°
Qwen-RobotManip是基于Qwen-VL构建的视觉-语言-动作基础模型。它引入统一对齐框架,覆盖表示、运动和操作行为三个维度,使多源训练数据协调一致。通过人工到机器人的合成流水线,利用15种平台的示教数据,构建了约38,100小时的预训练语料。模型在RoboCasa365、LIBERO-Plus、EBench等OOD基准上显著优于先前最佳模型π0.5,并在AgileX ALOHA、Franka、UR、ARX等真实机器人平台上验证。
事件专题

推荐理由:阿里Qwen团队这个机器人模型用开源数据和人类演示就能学,跨平台零样本操作,还在多个测试里碾压了π0.5,做机器人开发的别错过。
09:41
09:41官方账号arXiv cs.AI@Mikołaj Zasada, Łukasz Struski, Jacek Tabor, Marcin Kurdziel
SoftMoE用截断的soft top-k LapSum松弛替换传统稀疏MoE的离散top-k路由,实现专家路由的可微分化。模型参数化每层平均激活专家数并施加全局预算,使容量分配可学习。在语言建模和下游任务上,SoftMoE性能与稀疏MoE相当或更优,但激活专家数量更少。实验显示分配呈高度非均匀性,后层激活更多专家。
推荐理由:稀疏MoE的top-k路由不灵活还浪费算力,SoftMoE用可微路由让模型自己学会少用专家,性能却不输,代码开源了。
09:37
09:31
09:31官方一手arXiv: DeepSeek@Esteban Schafir, Xu Zheng, Hojat Allah Salehi, Zhuomin Chen, Mo Sha, Wei Cheng, Dongsheng Luo
精选
DecoSearch是一个无需训练的Text-to-SQL框架,通过轻量级Schema Selector修剪数据库模式,LLM Judger判断查询是否需要分解为DAG子问题。在BIRD上达到70.53%执行准确率,在Spider上达88.31%,使用DeepSeek作为骨干模型,比训练无关基线消耗少一个数量级的token。该方法还可作为模型无关包装器,一致提升微调后的SQL生成骨干性能。
推荐理由:DecoSearch不用训练就能把自然语言转SQL,在BIRD和Spider上准确率分别超70%和88%,比同类方法省十倍token。想提升SQL生成效率可以看看。
6月16日
13:08
13:08官方账号arXiv cs.AI@Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Chengyin Hu, Fengyu Zhang, Yiwei Wei, Jiujiang Guo
FusionRS是用于遥感双模态视觉语言学习的首个大规模RGB-红外-文本数据集。它由超过100万对对齐的RGB和红外风格图像组成,每对包含场景描述和红外感知描述。基于FusionRS训练的CLIP-style和生成式VLM模型在RGB-红外对齐、红外-文本检索和双模态描述任务上均优于纯RGB训练基线。消融实验表明,红外感知描述对强化红外-语言对齐至关重要。
推荐理由:FusionRS填补了RGB-红外双模态遥感数据集的空白,用公开RGB图转红外风格,加上两种描述,让模型同时理解可见光和红外信息。
11:43
11:43官方账号arXiv cs.AI@Jialei Chen, Kai Wang, Kang Chen, Shuaihang Chen, Feng Gao, Wenhao Tang, Zhiyuan Li, Weilin Liu, Zhuyu Yao, Boxun Li, Yuanbo Xu, Chao Yu
LaWAM通过潜在视觉子目标替代重建未来视频,在LIBERO基准上达到98.6%的成功率,在RoboTwin上达到91.22%,并在真实世界操作任务中取得竞争性表现。该模型每次动作块预测仅需187毫秒,延迟比像素空间世界行动模型低24倍。LaWAM的核心是潜在动作条件潜在世界模型(LaWM),利用预训练视觉基础模型的潜在空间预测未来观测特征。
推荐理由:机器人策略新框架LaWAM,不用生成视频就能预测场景变化,又快又准,成功率98.6%还低延迟,推荐做机器人控制的看看。
6月15日
6月10日
12:09
12:09官方账号arXiv cs.LG@Paul Fergus, Philip Stephens, Russell A. Hill, Lee Oliver, Katie Appleby, Sarah Beatham, Naomi Davies Walsh, Stuart Nixon, Naomi Matthews, Chris Sutherland, Kelly Hitchcock
精选
研究人员发布了一款开源目标检测模型YOLO26x,专门用于识别英国常见的28种哺乳动物和鸟类,以及人类、校准杆和车辆等3个实用类别。该模型基于10年运营部署中收集的48,165个标注实例训练,在验证集上平均精度达到0.984(IoU 0.5),召回率0.965。模型以ONNX格式发布,支持本地桌面和实时摄像头,面向无机器学习经验的生态学家,旨在打破商业平台对相机陷阱AI的垄断。
推荐理由:生态学家和野生动物监测团队终于有了免费、高精度的AI工具,可以直接在本地运行,无需依赖付费平台。做生物多样性研究的建议试试这个模型,能大幅减少手动标注图像的时间。
09:10
09:10官方一手arXiv: DeepSeek@ Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, Chongling Rao, Guowang Zhang, Han Li, Haonan Fan, Hengrui Ju, Jiankang Chen, Jiapeng Chen, Jiawei Yuan, Kaixuan Yang, Kaiyu Jiang, Kun Gai, Lingzhi Zhou, Na Nie, Sen Na, Tianke Zhang, Tingting Gao, Xuanyu Zheng, Yulong Chen, Fan Yang, Haixuan Gao, Lele Yang, Mingqiao Liu, Muxi Diao, Qi Zhang, Qile Su, Wei Chen, Wentao Hong, Xingyu Lu, Yancheng Long, Yankai Yang, Yingxin Li, Yiyang Fan, Yu Xia, Yuzhe Chen, Ziliang Lai, Chuan Yi, Haonan Jia, Tianming Liang, Weixin Xu, Xiaoxiao Ma, Yang Tian, Yufei Han, Feng Han, Hang Li, Jing Wang, Jinghui Jia, Junmin Chen, Junyu Shi, Ruilin Zhang
精选76°
快手发布Keye-VL-2.0-30B-A3B,一个基于MoE架构的开源多模态基础模型,专为长视频理解和智能体场景设计。该模型首次将DeepSeek Sparse Attention适配到GQA架构,实现无损256K上下文处理,能捕捉关键帧和长程时序依赖。通过跨模态多教师策略蒸馏(MOPD)和上下文/视频强化学习,解决了多任务对齐中的灾难性遗忘问题,仅激活3B参数即可在代码、工具和搜索场景中实现智能体协作与多模态自我纠正。在视频理解、时序定位、推理、STEM和智能体基准测试中,Keye-VL-2.0在相似规模模型中达到最优性能,尤其在TimeLens细粒度时序定位和Video-MME-v2长视频理解上表现突出。模型权重已开源。
推荐理由:长视频理解和智能体场景的开发者终于有了一个开源且高效的MoE模型——Keye-VL-2.0仅激活3B参数就能处理256K上下文,做视频分析或智能体应用的团队可以直接下载权重试试。