13:08
13:08 官方账号 arXiv cs.AI @Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu ObjectStream 是面向流式视频理解的无训练框架,把潜在目标作为记忆锚点。它直接从冻结的 Video-LLM 表征中提取空间连贯的潜在目标,跨帧链接为持久锚点,无需外部检测器或分割模型。在 OVO-Bench Real-Time Visual Perception 上,ObjectStream 使 Qwen2.5-VL-7B 提升 10.0 分,峰值 GPU 内存和 TTFT 均降低约 50%。在离线长视频基准上,它超越全 token 基线,同时丢弃 82.5% 的视觉 token。 推荐理由: 论文提出 ObjectStream,用目标当锚点压缩视频记忆,免训练提升理解,显存延迟减半,性能还涨 10 分。
稍后读 已读 值得跟进 有用 关注 ObjectStream
12:59
12:59 官方账号 arXiv cs.AI @Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei AISPA是一个面向用户的系统提示审计框架,从八个维度逐条检查系统提示。研究团队用该框架审计了88款商业AI产品中的3249条指令,发现各产品设计差异悬殊:有的产品平均包含超过60条保护性指令,有的不足5条。尽管98.9%的产品至少有一条保护性指令,但只有24%覆盖全部八个维度;约40%的产品存在至少一条损害用户利益的指令,且保护性与问题指令经常共存。 推荐理由: 论文用AISPA框架审计了88款商业AI产品,发现约四成产品里有损害用户利益的指令,做AI应用的朋友可以看看。
稍后读 已读 值得跟进 有用 关注 AISPA
12:58
12:58 官方账号 arXiv cs.AI @Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong OSReward 是一个用于评估视觉语言模型(VLM)判断计算机使用智能体轨迹能力的基准。研究者在多平台、多智能体框架上收集人工验证的指令轨迹,并通过多阶段标注得到真实标签。评测发现,即使是当前最强的 VLM 判断器也存在系统性宽松偏差,常把失败操作标记为成功。为此,团队构建了包含 10 万条推理标注轨迹的 OS-Shepherd-100K 语料,并训练出 9B 和 35B 的 OS-Shepherd 奖励模型。这两个开源模型能以比商业判断器低 30-60% 的成本提供同等质量的奖励信号。 推荐理由: OS 团队开源了 OSReward 基准和 9B/35B 奖励模型,专测 AI 判断电脑操作任务是否成功,成本比商业方案低 30-60%。
稍后读 已读 值得跟进 有用 关注 OSReward
12:44
12:44 官方账号 arXiv cs.LG @Haomin Qi, Xingliang Wang, Xuanqi Gao, Baihui Sang, Xin Zhang, Minghua Ma, Pengfei Gao, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi Zhang Change2Task是一个基于仓库历史将合并的拉取请求转换为已验证编码代理任务的系统。它通过补丁反转、代码映射或代理重建来重构任务状态,并验证从健康基线到任务状态再恢复的完整生命周期。从1,130个符合条件的源变更中,该系统在五类常见编码代理任务族上实现了79.6%的验证任务构建成功率。相比基于拉取请求的构造基线,在匹配候选集上多恢复了29.2%的验证任务。历史与重建案例在代理评估下达到98.0%的匹配结果一致性,复用现代基础使整体管道测量支出降低10.8%。 推荐理由: 想给编码代理搞训练数据?Change2Task用仓库历史自动生成可执行任务,成功率近八成,还能省下环境搭建开销。
稍后读 已读 值得跟进 有用 关注 Change2Task
12:17
12:17 官方账号 arXiv cs.LG @Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan, Laura Vasilie, Alexandru Apostu, Chase Helwig, Mihaela Gaman, Michael Brautbar, Edward Raff, Chase Midler, Sven Krasser 安全运营中心(SOC)面临告警疲劳,检测量超过人工处理能力。研究团队通过自动提示优化、自训练和可验证奖励强化学习,在真实人工标注的Windows端点检测上训练出链式推理(CoT)分类器。CoT会降低标签token概率,因此另训练校准器读取完整推理轨迹并估计判定正确概率。系统达到82.6%测试准确率,在高置信度操作点下,良性召回率比直接标注的LLM分类器提升43.0%,恶意召回率提升18.3%。未训练的置信度评判会使高置信召回归零,而微调的30B模型显著优于前沿通用模型。 推荐理由: 这篇论文把推理模型用在安全告警分类上,82.6%准确率,比直接LLM打标签的恶意/良性召回提升明显,还解决了置信度问题。
稍后读 已读 值得跟进 有用 关注 LLM
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档 (侧边栏 → AI 日报 → 顶部「往期日报」)。