7月21日
12:33
12:33官方账号arXiv cs.AI@Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tran Dinh Tien, Ahmed Elhagry, Salwa K. Al Khatib, Tianjun Yao, Yonina C. Eldar, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen
本研究针对ChatGPT、Gemini、Qwen-Image等现代VLM的像素级图像篡改检测,提出简单域泛化训练框架,包含平衡小批量采样和后期注入策略。在OOD VLM(GPT-Images-2.0、Gemini-3.1、FLUX.2、Seedream 4.5)上,该方法相比先前最优PIXAR,平均gIoU和cIoU分别相对提升26.1%和26.8%。代码已开源于GitHub。
推荐理由:他们用两个简单技巧,让检测AI改图的模型在GPT、Gemini等新模型上比之前最好的PIXAR强了26%多,代码也开源了,搞图像安全的可以试试。
12:23
12:23官方账号arXiv cs.AI@Alex Mathai, Shobini Iyer, Aleksandr Nogikh, Petros Maniatis, Franjo Ivancic, Junfeng Yang, Baishakhi Ray
论文定义了CodeSlop现象,即AI编码代理在搜索过程中残留的冗余编辑。提出TRIM算法,通过最小化代理轨迹来间接减少CodeSlop。实验在多种代理框架上测试,CodeSlop降低17.9%-32.9%,性能几乎无损失。验证成本仅为Delta Debugging算法的约一半。
推荐理由:这篇论文发现AI助手写代码越来越啰嗦,还给出了一个叫TRIM的清理方法,能减少17%到33%的冗余,实测效率高,推荐给写代码的朋友。
12:20
12:20官方账号arXiv cs.AI@Daniela Rojas, Abdulwahab Albassam, Aidan G. Leung, Jett Ngo, Ryan Luo, Peter R. Quawas, Junpyung Kim, Kangkai Liang, Mansi Nanavati, Jonathan Mai, Meng-Chi Tsai, Yun-Tong Tsai, Yize Chen, Yuanyuan Shi
本论文提出了一种基于求解器的设计原则,确保数值结果来自可信工具并通过明确验证。在四个案例研究中,EVAgent在EV充电调度中复现了CVXPY最优解,并将LLM-only的未满足能量减少了7.5-9.5倍;GridDebugAgent修复了17/39个应急案例,总违规减少52.3%。论文提出了一个四组评估框架,涵盖任务效用、求解器正确性、忠实性与安全失败、成本与延迟。核心结论是智能体系统负责编排、检索与解释,可信工具负责计算,验证门控决定报告内容。
推荐理由:这篇论文把LLM智能体怎么用在智能电网上讲得很清楚,给出了具体的数字对比,比如EVAgent减少了7.5倍未满足能量,适合做电网AI系统的实践参考。
12:09
12:09官方账号arXiv cs.LG@Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman, Alexei A. Efros, Richard Zhang
本文提出TPIPS,一种基于文本提示的图像感知相似度度量,能根据文本条件区分形状、颜色等不同视觉相似性维度。研究基于大规模三元组数据集,包含多种自由形式语义相似性标注。在多个前沿视觉语言模型(VLM)基准测试中,模型与人类一致性差距显著。通过微调VLM,TPIPS在文本引导检索、组合搜索和生成模型细粒度评估中表现更优,且泛化良好。
推荐理由:这篇论文搞了个新度量TPIPS,能按文字指令判断两张图在哪个方面像,比现有单标量打分更细。数据集和模型都开源了。
12:08
12:08官方账号arXiv cs.LG@Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto
Patch Policy是一种轻量级架构扩展,让基于Transformer的机器人策略直接使用预训练的ViT密集补丁特征,避免全量视觉语言模型(VLM)的计算开销。该方法引入块因果注意力掩码,在保持时间因果性的同时处理多个补丁令牌。在4个仿真和3个真实环境套件中,Patch Policy相比使用全局池化表示的策略实现了40%的相对提升。此外,它仅用OpenVLA-OFT约0.7%的参数,就超越了微调后的OpenVLA-OFT 18%的性能。
推荐理由:机器人控制不用再扛百亿参数VLM了,用ViT密集补丁特征直接训练,速度更快、参数量少99.3%,性能还涨18%。想轻量高效做具身策略的可以看这篇。
12:00
12:00官方账号arXiv cs.LG@Peng Sun, Zhenglin Cheng, Deyuan Liu, Jun Xie, Xinyi Shang, Tao Lin
论文提出三体散射建模 (TBSM),将能量距离转化为每个抛射体与一个真实源和一个生成源之间的相互作用,避免全对场计算。在 ImageNet-256 上,使用像素空间 PixelDiT-XL 得到 FID 2.23,使用潜空间 DiT-XL 得到 FID 1.63(NFE=1)。该方法通过在线追踪条件期望降低场噪声,为单步生成提供直接回归监督。
推荐理由:这篇论文用物理中的三体散射思路做生成模型,仅需一步就达到 DiT-XL 的 FID 1.63,比传统扩散模型少很多步。
11:50
11:50官方账号arXiv cs.LG@Thomas MacDougall, Maksim Kuznetsov, Roman Schutski, Rim Shayakhmetov, Maxim Malkov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov
结构药物设计(SBDD)利用蛋白质靶标3D结构生成候选分子,扩散模型是主流方法。本工作引入3D-Fit基准测试,评估LLM在多约束空间分子生成中的表现,包括蛋白口袋、锚定片段、药效团点及口袋-配体相互作用。结果显示,LLMs虽落后于专用扩散模型,但能同时处理多种空间约束,展现出可扩展的潜力。
推荐理由:这篇论文系统测了GPT等LLM在3D分子生成上的表现,发现它们虽不如专用扩散模型,但能同时处理多种约束,值得关注。
11:49
11:49官方账号arXiv cs.LG@Valentijn Oldenburg, Floris de Kam, Bente Zuijdam, Lieve Eberson, Nicky van Zutphen, Stef de Wildt, Ivo Verhoeven
该论文提出流形约束超连接(mHC),将残差连接泛化作为新型PEFT方法,在冻结的OLMo-2骨干上学习残差路由模块。实验发现微调时将残差混合矩阵固定为单位阵通常能提升性能。作为独立PEFT方法时mHC未持续优于LoRA,但在匹配可训练参数预算下,mHC+LoRA组合在1B和7B规模上改善了语言建模损失并带来任务相关性基准增益。
推荐理由:这篇论文把残差连接本身做成了PEFT方法,跟LoRA搭配效果更好,如果你在做模型微调可以看看这个新思路。
11:47
11:47官方账号arXiv cs.LG@Kyungseon Lee, Hankyo Jeong, Kunwoong Kim, Kwanho Lee, Yongdai Kim
论文定义了子组公平性差距,并推导出协方差代理精确匹配该差距。提出COVA-FC算法,通过连续松弛实现梯度优化,解决多敏感属性下子组数量指数增长和少数实例问题。实验在基准数据集上显示COVA-FC在成本和公平性之间取得竞争性权衡,并在子组和更高阶边际设置中提升计算效率。
推荐理由:这篇论文用协方差方法解决了子组公平聚类的计算难题,COVA-FC比现有方法更快更稳定,做公平聚类研究可以看看。
11:40
11:40官方账号arXiv cs.AI@Lopez Jhon, Hinojosa Carlos, Ghanem Bernard
SGA (Symbolic Geometric Agent) 是一个即插即用模块,拦截LLM生成的Manim代码,通过部分执行提取场景图并检测几何遮挡问题。实验在MMMC-Code基准上,使用4种LLM后端和2种流水线配置,SGA在Code2Video + GPT-5.1配置下达到73.11的MVQS分数,相对原始基线提升16.1%。SGA在8种配置中有7种提升了MVQS。
推荐理由:论文提出了SGA模块,能自动修复LLM写动画代码时的几何遮挡错误,实测用GPT-5.1搭配Code2Video能提升16%的画面质量。
11:35
11:35官方账号arXiv cs.AI@Sheldon Yu, Tong Yu, Xunyi Jiang, Rohan Surana, Gagan Mundada, Sungchul Kim, Lina Yao, Julian McAuley, Junda Wu
论文提出SOPHIA方法,通过分析推理轨迹中隐状态转换,发现失败轨迹陷入自循环。该方法构建状态对索引的引导向量库,在推理时实时检测自循环并干预。在多个基准测试中,SOPHIA有效提升任务准确率和令牌效率。实验表明,细粒度控制能改善推理质量。
推荐理由:这篇论文教你如何让大模型不再自己绕圈圈,用激活引导精准干预推理过程,实测有效提升准确率。
11:26
11:26官方账号arXiv cs.AI@Huzaifa Shaaban Kabakibo, Eric Schniedermeyer, Artem Burchanow, Lin Wang
SelectInfer是一个神经元级优化框架,通过离线分析识别任务特定和通用神经元,实现选择性加载和动态计算。在多个数据集上评估,内存占用减少40%-60%,计算量降低30%-50%,同时保持任务性能。该方法无需重新训练或微调,适用于资源受限的边缘设备。
推荐理由:这篇论文提出了一种在手机上跑大模型的新思路:不加载全部神经元,只算有用的部分。效果不错,内存和计算都省很多,关键是精度没掉。
10:40
10:40官方账号arXiv cs.AI@Md Erfan, Ahmed Ryan, Md Rayhanur Rahman
该研究以Hugging Face上的模型仓库为例,实证调查了AI物料清单(AIBOM)的完整性,涉及约97.5K个AIBOM工件。检查发现生成的AIBOM在所需结构字段上覆盖完整,但模型卡、元数据、负责任使用、环境、局限性等AI特定文档字段普遍缺失或薄弱。论文指出当前模型仓库在许可证、数据集声明、模型家族等可追溯性信息上存在不足,呼吁改进模型卡实践和自动化AIBOM验证。
推荐理由:这篇论文对Hugging Face上近十万个模型的文档完整性做了大规模分析,发现很多模型缺少许可证、局限性和环境信息,对想了解开源模型供应链透明度的朋友很有参考。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。