8月3日
09:16
09:16官方账号arXiv cs.AI@Xiang Chen, Yingying Zhao, Chao Li, Jiaju Han, Ben Zhang, Ang Li, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu
论文提出QR-STT,一种无需训练的黑盒攻击框架,用于定向操控红外视觉语言模型的语义输出。该方法将QR码划分为冷、中、热三种温度模块,并通过无梯度优化搜索模块布局和渲染参数。实验在多个CLIP风格编码器上验证,QR-STT能稳定将图像-文本对齐导向攻击者选定的概念。针对分类任务优化的扰动还能迁移到图像描述和视觉问答,使生成文本出现目标一致的语义偏移。
推荐理由:红外视觉模型能被QR码图案定向误导?论文提出QR-STT,黑盒无需训练,改分类还影响问答,AI安全党可以看看。
09:14
09:14官方账号arXiv cs.AI@Zhoujin Tian, Yao Tian, Hao Zhang, Cheng Chen, Yakun Li, Lei Zhang, Xiaofang Zhou
AdaMM是一个面向多模态智能体的分析记忆框架。AdaMM从对话、图像和元数据中提取带溯源信息的属性-值观察,并发现重复字段结构。在MemEye等基准中,现有系统侧重检索记忆,而AdaMM同时支持检索与分析。推理时,AdaMM的记忆感知规划器将查询分解为检索和分析操作。实验显示,在MemEye和MemGallery上AdaMM分别比基线提升11.3%和7.3%。
推荐理由:AdaMM让智能体能对历史多模态观测做筛选、聚合和排序,不止检索。MemEye、MemGallery上比现有高11.3%和7.3%,适合多模态记忆研究者。
7月31日
13:08
13:08官方账号arXiv cs.AI@Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu
ObjectStream 是面向流式视频理解的无训练框架,把潜在目标作为记忆锚点。它直接从冻结的 Video-LLM 表征中提取空间连贯的潜在目标,跨帧链接为持久锚点,无需外部检测器或分割模型。在 OVO-Bench Real-Time Visual Perception 上,ObjectStream 使 Qwen2.5-VL-7B 提升 10.0 分,峰值 GPU 内存和 TTFT 均降低约 50%。在离线长视频基准上,它超越全 token 基线,同时丢弃 82.5% 的视觉 token。
推荐理由:论文提出 ObjectStream,用目标当锚点压缩视频记忆,免训练提升理解,显存延迟减半,性能还涨 10 分。
12:59
12:59官方账号arXiv cs.AI@Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei
AISPA是一个面向用户的系统提示审计框架,从八个维度逐条检查系统提示。研究团队用该框架审计了88款商业AI产品中的3249条指令,发现各产品设计差异悬殊:有的产品平均包含超过60条保护性指令,有的不足5条。尽管98.9%的产品至少有一条保护性指令,但只有24%覆盖全部八个维度;约40%的产品存在至少一条损害用户利益的指令,且保护性与问题指令经常共存。
推荐理由:论文用AISPA框架审计了88款商业AI产品,发现约四成产品里有损害用户利益的指令,做AI应用的朋友可以看看。
12:58
12:58官方账号arXiv cs.AI@Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong
OSReward 是一个用于评估视觉语言模型(VLM)判断计算机使用智能体轨迹能力的基准。研究者在多平台、多智能体框架上收集人工验证的指令轨迹,并通过多阶段标注得到真实标签。评测发现,即使是当前最强的 VLM 判断器也存在系统性宽松偏差,常把失败操作标记为成功。为此,团队构建了包含 10 万条推理标注轨迹的 OS-Shepherd-100K 语料,并训练出 9B 和 35B 的 OS-Shepherd 奖励模型。这两个开源模型能以比商业判断器低 30-60% 的成本提供同等质量的奖励信号。
推荐理由:OS 团队开源了 OSReward 基准和 9B/35B 奖励模型,专测 AI 判断电脑操作任务是否成功,成本比商业方案低 30-60%。
12:56
12:56官方账号arXiv cs.AI@Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li
DualG-MRAG 提出将宏观推理图与微观匹配图解耦,分别负责全局拓扑路由和局部证据验证。该框架通过 GNN 检索器实现查询驱动的消息传递,并利用动态规划解码从前向传播中提取推理路径。在证据召回和复杂问答准确率上,DualG-MRAG 超过现有基线。
推荐理由:多模态RAG老是丢细节?DualG-MRAG用双图分工解决,召回更准、复杂QA更强。
12:51
12:51官方账号arXiv cs.AI@Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi
ORCA-bench用一套运行六天的OpenTelemetry微服务系统,通过Prometheus、Jaeger和OpenSearch/Grafana接口暴露指标、日志和链路,共构造1079个值班根因分析任务。五个前沿智能体在Medium难度任务上最佳RCA准确率仅25.3%,Hard难度为10.0%。最弱模型在40%的故障报告中给出不合理根因;去掉源代码访问后所有指标下降。专家SRE对真值症状做了复核,LLM评判与人类评分加权kappa为0.90。
推荐理由:想看看编程Agent在真实值班场景有多靠谱?ORCA-bench给了1079个线上故障任务,最强模型也只答对四分之一。
12:50
12:50官方账号arXiv cs.AI@Mao-xun Huang, Jerry Wang, Yi-Cheng Lai, Zhengxin Zhang, Claire Cardie, Hen-Hsen Huang
MANTA 是一个多智能体网络拓扑自适应框架,让通信结构在推理时自我进化。MANTA 在执行前初始化任务条件拓扑,运行中监测协作轨迹并应用有界结构更新。在信息检索、工具使用、规划、工作流执行和数学推理五个基准上,MANTA 平均分达 74.0,超过最强基线 5.8 个百分点。它在 PlanCraft 任务上也取得最优成绩。
推荐理由:多智能体协作结构不用手动调了,MANTA 在推理时自动改拓扑,五个基准平均分 74.0,超基线 5.8 个点。
12:37
12:37官方账号arXiv cs.LG@Jonathan J. Heckman, Shani Meynet, Alessandro Mininno, Gary Shiu
该论文用机器学习判定超对称quiver规范理论中的Seiberg对偶,数学上等价于判断quiver的突变。在约10个节点的quiver上,Transformer和多层感知机架构的表现优于确定性算法。加入pathfinder算法(作者称之为“quiver版Google Maps”)后,搜索效率和准确率进一步提升。论文认为这类问题可作为前沿AI模型用于理论物理的基准测试。
推荐理由:这篇论文用AI判断两个物理系统是否对偶,在约10节点quiver上比传统算法快,还配了“quiver版谷歌地图”提高准度。
12:36
12:36官方账号arXiv cs.LG@Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem
ReToken训练一个可学习嵌入作为检索目标,从预填充的视觉KV缓存中选取与查询相关的稀疏视觉token。它在小型图像问答数据集上训练,在Visual Haystacks基准上让Qwen3VL-8B提升13.4分,InternVL3.5提升12.4分。在LVBench上,模型零样本迁移到长视频任务,Qwen3VL-8B取得8.0分增益。由于设计轻量,训练与长视频推理可在一块H100上完成。
事件专题

推荐理由:ReToken用一个小token当检索目标,从KV缓存里挑关键视觉token,Qwen3VL-8B在Visual Haystacks涨13.4分,单卡H100就能跑。
12:35
12:35官方账号arXiv cs.LG@Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho
AskChem 将论文拆解为带来源 DOI 和原文引用的原子声明。目前已索引来自 14.7 万篇论文的 240 万条声明,提供网页、REST、SDK 和 MCP 接口。在 AskChem-Bench 基准上,接入 GPT-5.5 阅读器后 DOI 可解析率达到 100%,未检索时为 88.3%。系统还提供证据图和分类检索,支持跨论文验证信息。
推荐理由:化学论文里找结论太费劲?AskChem 把 14.7 万篇论文拆成带引用的声明,直接搜观点还能看来源,AI 也能通过接口调。
12:32
12:32官方账号arXiv cs.LG@Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar Faruk
MixFrag提出一种面向视觉Transformer的脆弱性引导混合精度训练后量化框架。它通过计算全精度与量化输出分布的KL散度来估计各组件量化脆弱性,并将位宽分配建模为多选择背包问题。在ImageNet-1K上,MixFrag在多种ViT架构下取得有竞争力的分类精度。在COCO目标检测与实例分割任务中,MixFrag在MP3/MP3设置下比此前最优方法提升高达9.6 AP。
推荐理由:MixFrag用KL散度定位模型里对量化最敏感的部分,再把位宽分配变成背包问题。在COCO上比之前最好的混合精度PTQ方法涨了9.6 AP,跑ViT的可以看看。
12:31
12:17
12:17官方账号arXiv cs.LG@Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan, Laura Vasilie, Alexandru Apostu, Chase Helwig, Mihaela Gaman, Michael Brautbar, Edward Raff, Chase Midler, Sven Krasser
安全运营中心(SOC)面临告警疲劳,检测量超过人工处理能力。研究团队通过自动提示优化、自训练和可验证奖励强化学习,在真实人工标注的Windows端点检测上训练出链式推理(CoT)分类器。CoT会降低标签token概率,因此另训练校准器读取完整推理轨迹并估计判定正确概率。系统达到82.6%测试准确率,在高置信度操作点下,良性召回率比直接标注的LLM分类器提升43.0%,恶意召回率提升18.3%。未训练的置信度评判会使高置信召回归零,而微调的30B模型显著优于前沿通用模型。
推荐理由:这篇论文把推理模型用在安全告警分类上,82.6%准确率,比直接LLM打标签的恶意/良性召回提升明显,还解决了置信度问题。
12:16
12:16官方账号arXiv cs.LG@Zechen Zhang, Rui Peng Li, Yousef Saad
该论文提出图神经网络多层级预条件器(GMP),将代数多重网格(AMG)层级结构作为先验,统一学习平滑、限制与插值算子。在超800个稀疏矩阵基准上,对比经典AMG、单层ILUT及现有GNN预条件器,分析了多层级图神经预条件在收敛性和计算开销上的优劣。结果表明GMP可作为标准Krylov求解器的即插即用预条件器,但在某些场景下不及强单层基线。
推荐理由:想给稀疏矩阵求解提速的话,这篇论文把AMG层级和图神经网络结合了,在800多个矩阵上实测,可以看到它什么时候比AMG好、什么时候反而更慢。
12:06
12:06官方账号arXiv cs.AI@Cencen Liu, Wen Yin, Dongyang Zhang, Dongmin Li, Shan Zhao, Bing Su, Tao He, Jielei Wang, Guoming Lu
DAR-Net 在统一框架中处理去雨、去雾、去模糊等退化,提出退化原型表示模块构造结构化退化状态。语义歧义校正模块生成退化感知提示,空间歧义校正模块将特征约束到正交响应子空间。在三个退化和五个退化设置下,平均 PSNR 比最强对手分别提高 0.14 dB 和 0.34 dB,在 CDD-11 和 WeatherBench 上也表现更好。
推荐理由:这篇论文做了个 DAR-Net,把不同图像退化分开处理,三个和五个退化任务上 PSNR 都超过现有方法,做图像恢复的可以看看。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。