8月4日
09:20
09:20官方账号arXiv cs.AI@Junkai Lin, Junkai Chen, Siqi Hou, Yuhao He, Ruiqi Liu, Chenhan Jin, Shengze Xu, Tieyong Zeng
多模态大语言模型会泄露敏感信息,现有隐私基准多采用画像级删除,而实际请求往往更细粒度。本文提出属性级遗忘任务,覆盖长文本、数值、短文本三类目标和多种遗忘比例。作者提出训练无关的CLRP框架,用激活修补定位因果层,再通过保留感知投影移除目标属性子空间。实验在多种不同架构和参数规模的MLLM上验证了CLRP的有效性。
推荐理由:论文把机器遗忘做到属性级:让模型忘掉指定属性,但保留同一人的其他信息。CLRP不用重训练,在多种多模态模型上都有效。
8月3日
11:10
11:10官方账号arXiv cs.AI@Yimin Chen, Brian Fricke, Bo Shen, Jamie Lian, Mingkan Zhang, James Lo, Yun Zhang, Shi Ye, Jiajing Huang, Han Hu, Chujie Lu, Rui Tang, George Zhuang
FDD-ON是一个模块化、可扩展的本体,用于形式化表达变风量(VAV)空调系统组件、故障类型、症状状态及其影响。该本体整合了故障检测与诊断(FDD)语义,并通过定义受控词汇表来统一描述故障与症状属性。依赖造成原因-故障-症状-影响的四元关系,FDD-ON可为异质FDD输出提供机器可解释的映射基础。研究团队利用公开VAV数据集对该本体进行了评估,并展示了其在FDD应用开发中的实际效果。
推荐理由:这篇论文把空调故障诊断的知识结构做成了能查的本体,以后跨系统做FDD就不用各搞各的了。
10:25
10:25官方账号arXiv cs.AI@Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin
FriendBench 是一个新基准,要求从20秒破冰对话片段判断两人是否熟识。研究对比了7家公司的26个模型与人类受试者在96组对话上的表现。最佳模型与人类在准确率上无显著差异,但模型更倾向于回答“陌生人”。音频和视频信息对模型和人类的好处不同,只有人类能从可见行为中获益。论文公开了全部刺激材料、人类评分和模型预测。
推荐理由:试试看这个新基准,FriendBench测AI能不能从20秒对话看出两人是不是熟人。最强模型和人类打了个平手,但AI有偏见:拿不准就说是陌生人。
09:34
09:34官方账号arXiv cs.LG@Ranveer Singh, Pranuthi Tenali, Saurabh Mathur, Ameet Soni, Vaishali Phatak, Karla Lynch, Daniel Murman, Matthew Rizzo, Sriraam Natarajan
该研究提出一种自动化流程,直接从语言流畅性测试的音频中提取阿尔茨海默病进展指标。方法使用预训练基础模型处理原始音频,构建贝叶斯网络进行推理,并解释各语言标记间的定性关系。系统成功恢复了已知的临床知识,还发现了新的语言学标记关联。相关论文已发布在arXiv上。
推荐理由:不用手动转录音频,自动从语音里挖出阿尔茨海默病早期信号,还能解释推理过程,比黑盒模型更让人放心。
09:31
09:31官方账号arXiv cs.LG@Panupol Untarabut, Narjes Jomaa, Sylvian Cadars, Olivier Masson, Samuel Bernard, Assil Bouzid, Santanu Saha
研究用CGCNN、GATGNN、ALIGNN和M3GNet四种图神经网络,将有序钙钛矿的知识迁移到无序高熵钙钛矿氧化物(HEPOs)上。形成能预测能有效迁移,但HOMO-LUMO带隙预测因对局部化学环境敏感而迁移性有限。加入少量HEPO专属训练数据后,带隙预测精度显著提升。UMAP分析表明ALIGNN编码的三体几何信息对捕捉结构-性质关系至关重要。
推荐理由:高熵钙钛矿不好算,这论文拿四种图神经网络试了迁移学习,发现形成能能搬,带隙不行,加点目标数据才准。ALIGNN表现最好。
09:31
09:31官方账号arXiv cs.LG@Priya Tomar, Aditya Parikh, Christian Bauckhage, Rafet Sifa
该研究将类特定解码器架构扩展到跨手术域知识迁移,使用直肠和胆囊切除术两个数据集验证。实验表明,器官特定解码器模型CEMD在跨域预训练后全微调,分割性能达到62.4%Dice,且收敛速度明显快于从零训练。但类别不平衡问题依然存在,迁移学习对少数解剖结构的改善有限。
推荐理由:这篇论文把迁移学习用在腹腔镜多器官分割上,CEMD模型微调后Dice到62.4%,还比从零训练快不少,做医学影像分割的值得看看。
09:23
09:23官方账号arXiv cs.AI@Chandra Maddila, Mashrur Rashik, Euna Mehnaz Khan, Smriti Jha, James Saindon, Nachi Nagappan, Peter C. Rigby
ARCTIC 是一个面向 AI 生成代码的代码批判系统,核心能力包括意图预测、漂移检测和代码聚焦。系统基于 1.8 万条真实代码评审归纳出六主题分类法。离线评测中,意图预测 F1 达 0.86,漂移检测与人工标注的 QWK 为 0.907,代码聚焦在质量估计上比基线 AI 评审员好 2.4 倍且 token 消耗减少 5 倍。试点中漂移评分让代码错位额外降低 5.76 个点(p=0.026),意图预测获 90.2% 认可。
推荐理由:这篇论文提出了 ARCTIC,专门解决 AI 写代码太多、人工审不过来的问题。它用意图预测和漂移检测揪出真正需要人看的改动,比传统工具更准更省 token。
09:19
09:19官方一手arXiv: DeepSeek@Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi
精选
TwT(Translation with Thought)是一个难度自适应的多领域机器翻译框架,通过强化学习在直觉与深思推理间动态切换。该模型先利用DeepSeek-R1蒸馏并由GPT-4o重写的长思维链进行监督微调,再通过混合奖励优化翻译质量与推理效率。在15个基准、3种已见语言和59种未见语言上,TwT-7B和TwT-14B的翻译质量超过更大的SOTA推理模型,同时token用量减少32%至60%。
推荐理由:这个TwT框架让翻译模型根据难度动态调整思考量,7B和14B的小模型打过大模型,token还省了30%到60%,做多领域翻译的可以看看。
09:18
09:18官方一手arXiv: DeepSeek@Jia Peng Lim, Hai Leong Chieu
DeepSeek的Engram条件记忆模块在存储与推理之间做权衡,但依赖token级N-gram哈希,导致不同tokenizer需从头训练。论文提出用多项式哈希替换XOR哈希,建立跨N的联合嵌入空间。实验显示该改动在保持性能的同时实现tokenizer无关性,字节等价序列哈希相等。
推荐理由:DeepSeek改了Engram的哈希方式,不同tokenizer之间不用再各自训练,效果还一样,做多语言模型的可以看看。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。