7月9日
09:08
09:08官方一手arXiv: OpenAI@Xin Li, Jiaju Han, Ma Yaqi, Chengyin Hu, Yingying Zhao, Jiahuan Long, Fengyu Zhang, Yahui Chai
精选
InfraQR 是一种针对红外视觉语言模型的攻击方法,将紧凑结构化补丁沿图像边界放置,通过代理 CLIP 编码器优化可学习网格单元。在 300 张红外图像基准上,InfraQR 将 OpenAI CLIP 的分类准确率从 98.67% 降至 0.70%。攻击还迁移到黑盒字幕和 VQA 模型,导致字幕语义退化,并在 GPT-5.4 评估下产生更易错的答案。结果表明红外视觉语言模型易受边缘结构化扰动影响,需进一步研究跨任务鲁棒性。
事件专题

推荐理由:这篇研究告诉你,红外视觉语言模型有多脆弱——一个 QR 风格的边角补丁就能让 OpenAI CLIP 准确率从 98.67% 跌到 0.70%,还能黑盒攻击其它模型。搞安全或对抗训练的值得一看。
7月8日
12:19
12:19官方账号arXiv cs.AI@Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus Olivera
DepthWeave-KV是一种跨层键值缓存压缩方法,通过共享低秩通道基分解相邻层状态,保留令牌特定残差。它使用令牌条件深度路由器为指令型和检索关键令牌分配更高重构秩,并通过注意力输出探头在线追踪误差自适应压缩。在LongBench等基准上,DepthWeave-KV实现近满缓存任务质量,压缩比达8.3倍,64K上下文速度72.8 tokens/s。
推荐理由:长上下文推理内存瓶颈有救了!DepthWeave-KV用跨层分解加自适应压缩,8.3倍KV缓存缩减,速度72.8 tokens/s,比其他方法效果更好。
12:15
12:15官方账号arXiv cs.AI@Chase McDonald, Nathan Tsang, Wesley N. Kerr
FootsiesGym 是基于 HiFight 的极简 2D 格斗游戏 Footsies 构建的开源环境,用于研究双人零和不完美信息游戏中的循环非传递策略互动。该环境提供向量化模拟器,可在标准硬件上实现高吞吐量训练。论文对多种强化学习算法进行了基准测试,并讨论了开放研究方向。代码已开源在 GitHub。
推荐理由:想研究格斗游戏AI?这个新基准FootsiesGym基于极简游戏Footsies,自带高效模拟器,适合强化学习训练和对比。
12:13
12:13官方账号arXiv cs.AI@Qian Sun, Yong-Ming Tian, Jia-Wei Huang, Cheng Feng, Shao-Qun Zhang
RMISC语料库包含约200个数据集、1420亿个时间点,覆盖多领域真实世界多变量时间序列。研究者用RMISC预训练四种先进时间序列基础模型(TSFMs),并与合成数据预训练模型对比。实验表明,真实世界多变量数据显著提升TSFMs的零样本泛化能力,在分布内和分布外基准上均表现更优。
推荐理由:如果你的时间序列模型总是泛化不好,试试用RMISC这个真实世界大数据集预训练,1420亿个时间点,效果比合成数据强很多。
12:12
12:12官方账号arXiv cs.AI@Kai Ruan, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun
该论文利用LLM Agent每轮隐藏状态的探针(probe),在任务早期预测最终失败。在TextCraft基准上,Recall-Controlled Probe Cascade以90%召回率目标为Qwen-2.5-7B节省47.1%推理计算,为Llama-3.2-3B节省37.2%。相比仅基于行为的方法,节省量高出1.6-1.7倍。论文还推导了保证高召回率所需的样本复杂度。
推荐理由:这篇论文告诉你如何从模型内部状态提前看出agent会失败,比看外部行为省算力多了,实测省三到四成。
12:02
12:02官方账号arXiv cs.LG@Tianjiao Yu, Xinzhuo Li, Yifan Shen, Onkar Susladkar, Yuanzhe Liu, Xiaona Zhou, Ismini Lourentzou
ELSA3D是一种统一3D模型,通过弹性语义锚定将文本和几何推理在匹配的抽象尺度上联合结构化。它使用尺度感知的八叉树分词器表示几何,并引入锚点令牌(Anchor Tokens)实现稀疏但精确的跨模态交互。在图像到3D生成、文本到3D生成和3D描述三项任务上,ELSA3D均取得最先进性能,同时相比其非弹性版本将FLOPs和推理延迟降低约一半。
推荐理由:ELSA3D用一个弹性锚定机制把3D理解和生成统一了,三个任务都刷了SOTA,还省了一半算力,想做3D的可以看看这篇
11:51
11:51官方账号arXiv cs.LG@Marwan Lazrag, Badis Hammi, Lorena Gonzalez-Manzano, Joaquin Garcia-Alfaro
该论文研究了投毒攻击对增强3D点云公共数据集在网联自动驾驶汽车中的操作影响。实验使用GAN进行数据增强,发现增强过程无法完全消除投毒样本,后门攻击仍能绕过防护。投毒数据会传播到增强后的数据集,导致点云分类器(例如PointNet)出现误分类。所有工具、数据集和分类器均已公开以支持复现。
推荐理由:这篇论文用具体实验证明,GAN数据增强挡不住针对自动驾驶3D点云的投毒攻击,后门照样能影响分类器,值得搞AI安全的人看看。
10:17
10:17官方账号arXiv cs.AI@Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Zhang, Bin Dong
Danus是一个基于事实图记忆的协调系统,旨在提升研究级数学推理能力。系统包含一个主智能体进行规划和协调,多个工作智能体并行执行证明搜索,以及一个无状态验证器检查数学主张。每个验证的事实连同证明和逻辑依赖存储在事实图中,构建递增的长期论证。在代数几何、奇点理论和组合学的六个研究级案例中,Danus成功生成长而详细的数学证明。
推荐理由:看看Danus怎么用事实图记忆帮多个推理智能体协作解数学难题,还能和数学家互动。
10:17
10:17官方账号arXiv cs.AI@Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik
本文研究VLM在扩散图像编辑管线中作为条件编码器时的定位能力下降问题。作者提出Analysis-by-Proxy框架,训练轻量级代理模型在VLM中间表示上执行辅助定位任务。实验发现,在单次前向传递约束下,定位信号未可靠传播到预设条件层配置,而是隐藏在随输入提示变化的中间表示中。该框架揭示了现有编辑管线条件提取策略的根本失败,为设计更合理的条件架构提供了方向。
推荐理由:这篇论文把VLM做图像编辑时定位不准的老问题挖到底了——原来不是模型不行,是提取信号的方式错了。他们用了个'代理分析'的巧招,把隐藏的定位信号给揪了出来,搞编辑管线的值得一看。
10:17
10:17官方账号arXiv cs.AI@Yufan Wang, Anit Kumar Sahu, Yan Fei Ng, Daniel Kang, Shayan Vassef, Soorya Ram Shimgekar, Koustuv Saha, Piyum Zonooz, Navin Kumar, Chee Leong Cheng, Li Yan Khor
新加坡数据显示约31%人口有幽门螺杆菌感染证据。研究者使用Nimblemind多智能体系统(nMAS)处理54份去标识化胃活检病理报告,评估4个临床二元字段(胃活检、活检状态、H. pylori阳性、H. pylori相关胃炎)。在216个特征-案例决策中,nMAS正确分类213个(98.61%准确率),与UMA-style MiniMax M2.5对比表现相似,但nMAS提供统一报告级输出与支持源句。假设人工审查每份5分钟,nMAS每份5秒,1000份报告处理时间可从83.3小时降至1.4小时,节省约6100美元。
推荐理由:这篇论文展示了一个能精准从病理文本中抓取H. pylori证据的多智能体系统,准确率98.61%,比人工快几十倍,适合医疗信息提取场景。
10:16
10:16官方账号arXiv cs.AI@Marcelo Arenas, Pablo Barceló, Diego Bustamante, Jose Caraball, María Alejandra Schild, Bernardo Subercaseaux
论文提出ExplAIner查询语言,可统一表达溯因、对比、特征和距离等多种解释查询。它基于FOIL语言扩展,解决了FOIL无法表达最优性解释查询且决策树评估复杂的问题。ExplAIner的查询评估属于布尔层次结构,对确定性可分解布尔电路可在多项式时间内完成。引入优化片段Opt-FOIL,可通过固定次数SAT求解器调用计算最小解释。
推荐理由:这篇论文提出了一种新查询语言ExplAIner,能统一处理各种模型解释查询,还证明计算效率高,对做形式化XAI的人很有用。
10:16
10:16官方账号arXiv cs.AI@Xinyuan Chen, Haoyu Guo, Shi Guo, Bingqi Jiang, Chunhua Shen, Xing Shen, Tianfan Xue, Yufei Xue, Mulin Yu, Weinan Zhang, Bin Zhao, Bowen Zhou, Ming Zhou
一篇视角文章提出了世界模型的科学定义和分阶段路线图,涵盖从基于模型的强化学习、视频生成到具身机器人和物理AI等子领域。文章指出当前对世界模型缺乏共识,并讨论了关键技术方面,包括预测内容与构建方法。它为不同研究方向的世界模型开发提供了系统性框架。
推荐理由:这篇给了世界模型的具体定义和路线图,适合想了解它在强化学习、视频生成、机器人等领域不同玩法的人。
10:16
10:16官方账号arXiv cs.AI@Antonio Andriella, Jauwairia Nasir, Andrea Rezzani, Alyssa Kubota, Dimitri Lacroix, Tamlin Love, Aniol Civit, Vicky Charisi, Elisabeth Andre, Wing-Yue Geoffrey Louie
该论文提出了基于生命周期和上下文敏感的个性化人机交互框架,结合短期/长期与开放域/封闭域交互特征。对自主性侵蚀、有偏用户建模、操纵、非人化和隐私侵犯5类伦理风险进行整合分析。将风险洞察转化为具体设计建议,并列出开放研究挑战。
推荐理由:这篇论文把人机交互个性化的伦理风险讲得很透,框架和风险分析都很系统,做机器人交互设计的人值得参考。
10:16
10:16官方账号arXiv cs.LG@Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji
TILDE 提出一种新的概念遗忘框架,将遗忘问题形式化为分布对齐任务。该方法通过能量倾斜条件分布,在抑制目标概念图像生成的同时保持提示的良性相对质量。实验在对象、艺术风格和角色等场景下,TILDE 实现强力遗忘,并在保留质量和分布保真度上超越现有基线。
推荐理由:这篇论文提出了 TILDE,通过分布对齐让概念遗忘模型既能精准擦除目标,又不会牺牲常规生成质量。
10:16
10:16官方账号arXiv cs.LG@Ryuji Oi, Hikari Otsuka, Kosuke Matsushima, Yuki Ichikawa, Masato Motomura, Tatsuya Kaneko, Daichi Fujiki
论文提出ActionCache,一种即插即用的外部缓存,用于加速基于流匹配的视觉-语言-动作(VLA)模型推理。ActionCache通过存储紧凑多模态键的中期动作,从相似过往上下文(跨不同回合甚至任务)中检索来预热生成,减少迭代去噪步骤。在仿真和真实环境实验中,ActionCache在低延迟下保持高任务成功率,对π₀.₅和GR00T-N1.6分别实现高达11.75倍和34.43倍的推理加速。
推荐理由:这篇论文用缓存中间动作的思路让VLA模型推理快11到34倍,而且不用重新训练,机器人实时控制场景很实用。
10:13
10:13官方账号arXiv cs.LG@Raul Jimenez, Svitlana Mayboroda, Pavlos Protopapas, Leonid Sarieddine, David N. Spergel, Pedro Tarancón-Álvarez
该论文提出一种基于多头物理信息神经网络(multihead PINN)的框架,通过共享体学习潜在流形、线性头重建不同初始条件的解,并引入头正交化惩罚消除退化。在潜在维度n_b=20时,对一维粘性Burgers方程,2-4个主成分捕获约95%的潜在空间方差,4-7个捕获约99%。方法同样在热方程和波动方程上验证了压缩效果。频率谱分析显示主成分的波数分布在不同训练运行间可重现,成为解流形几何的稳健观测值。
推荐理由:这篇论文用PINN把复杂偏微分方程的解空间压缩到几个主成分,95%的信息只需头4个维度,做科学计算或模型简化的人值得一看。
10:11
10:11官方账号arXiv cs.LG@Andrea Agazzi, Eloy Mosig García, Dario Trevisan
该论文通过张量程序框架,研究了随机神经网络的无限宽度高斯过程极限。主要结果给出了有限网络与高斯过程极限之间的Wasserstein距离定量误差界,阶为宽度平方根倒数。该框架与架构无关,适用于前馈网络、递归网络和Transformer型架构。
推荐理由:这篇论文用张量程序证明了随机神经网络的高斯过程极限误差随宽度平方根倒数衰减,还覆盖了Transformer,想细看理论可以读。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。