7月20日
09:29
09:29官方账号arXiv cs.AI@Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong He
CRAFT是一种新方法,将基于评分标准的评估数据集转化为模型特定弱能力诊断。它从每个提示-评分标准对中提取能力描述,聚类成层次能力树,在4个开源模型、金融和法律两个领域及13个保留基准上评估。在金融领域,CRAFT对所有4个模型的平均分超过基线;在法律领域,对4个模型中的3个表现最强。结果表明,基于评分标准诊断比基于提示或类别能更精确地定位模型弱能力,并生成更有效的微调数据。
推荐理由:CRAFT能帮你找到模型具体弱在哪里,不是笼统说不行,而是通过评分标准拆解能力,还能自动生成训练数据修bug。金融和法律测试里比随机采样效果好很多。
09:28
09:28官方账号arXiv cs.AI@Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza, Markov Grey
前沿AI公司公布的能力阈值差异显著,使得第三方难以验证阈值是否被超过或跨公司比较需求。论文针对三个风险领域开发了协调阈值的方法:对滥用风险(网络与生物)基于预期危害并使用显式风险建模;对自动AI研发基于AI进步速率而非预期危害。该分析扩展了先前工作并指出了现有实证差距与局限性。
推荐理由:这篇论文给了我们一套统一安全阈值的方法,让不同公司的标准能对齐,避免恶性竞争。如果你关心AI安全怎么落地,可以看看。
09:23
09:23官方账号arXiv cs.AI@Bhavana Verma, Priyanka Meel, Dinesh Kumar Vishwakarma
论文提出HCIG和GCCN两个新框架,以建模文本与图像之间的多粒度语义不一致。在MMSD讽刺检测基准上,HCIG达到85.74%准确率和85.29%宏F1。在MultiBully网络霸凌数据集上,GCCN宏F1为68.66%,HCIG准确率69.62%、霸凌类F1 74.90%。实验表明分层多粒度不一致建模优于传统融合策略,为多模态推理提供有效方法。
推荐理由:这篇论文提出了HCIG和GCCN,在MMSD和MultiBully上分别达到85.74%和69.62%准确率,比传统融合方法更善于捕捉图文矛盾。
09:22
09:22官方账号arXiv cs.AI@Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai, Shuai Di, Xu Chu, Xiaotie Deng, Yicheng Gong, Junwu Xiong
JoyNexus是一个统一服务,支持多租户VLA模型的监督微调、强化学习和评估。它通过解耦Training Model Service、Inference Model Service和Environment Service,租户通过API调用。采用group batching技术,使不同VLA数据模式共享一个前向传播,提升训练效率。实验表明,相比单租户独立执行,JoyNexus减少了总GPU时间并提高了服务利用率。
推荐理由:做VLA模型微调或机器人仿真的团队可以看看,JoyNexus用分组批处理省GPU资源,多租户场景下效率更高。
09:20
09:20官方账号arXiv cs.AI@Mazene Ameur, Abdelkader Mekrache, Bouziane Brik, Adlen Ksentini
该论文以教程与综述形式,系统梳理了LLM驱动的智能体AI在5G/6G网络中的应用。Part I形式化5G/6G的控制、管理和AI原生平面,涵盖推理、规划、工具使用、多智能体协调等基础。Part II将智能体能力映射到5G/6G控制面、标准组织及6G主要倡议,指出开放挑战。文章弥补了协议集成、评估和标准化对齐的研究空白。
推荐理由:这篇综述把LLM智能体怎么用在5G/6G网络上讲清楚了,覆盖架构、协议和标准化,做通信AI的可以看看。
09:19
09:19官方账号arXiv cs.AI@Iker Moran-Cavero, Monica Hernandez, Elvira Mayordomo, Naiara Artiaga, Beatriz Pardiñas, Beatriz Cordon, Elena Garcia-Martin
该论文针对OCT图像中视网膜层分割因散斑噪声、伪影、域偏移等挑战,提出一种以中央凹为中心的空间归一化预处理框架。该方法在7种深度学习架构上评估,结合B-scan级的重叠度量、A-scan级的拓扑感知度量和en-face级的厚度度量。无真实标签时,论文提出无需标注的拓扑违反定量指标和基于厚度的定性评估。实验表明空间归一化显著提升分割鲁棒性和一致性,有助于神经退行性疾病中的生物标志物提取。
推荐理由:这篇论文解决了OCT分割跨域泛化难题,用空间归一化让不同来源的数据对齐,实验扎实,适合研究视网膜影像和医学图像分析的朋友。
09:15
09:15官方账号arXiv cs.AI@ SciForge Team, Zhangyang Gao, Minghao Fang, Yifei Liu, Hanhui Yang, Xinyu Gu, Shixiang Tang, Siqi Sun, Lei Bai, Cheng Tan, Mengdi Liu, Hao Wu, Shuizhou Chen
arXiv 论文提出 SciForge,一个专为科学研究设计的 AI 原生多模态工作台。该工作台基于五个核心理念构建:目标导向的决策治理、先翻译后推理的多模态处理、可审计的证据链、协作式团队科学以及实际应用场景。论文通过八个端到端用户案例验证,包括基因发现、从头蛋白质设计、分子优化等旗舰演示。SciForge 目前为桌面应用,已开源在 GitHub 上。
推荐理由:想用 AI 管理整个科研流程?SciForge 把论文、代码、数据整合成可追溯的工作状态,还帮你做基因发现和蛋白质设计,开源可玩。
7月17日
12:08
12:08官方账号arXiv cs.LG@Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
On-Policy Delta Distillation (OPD²) 引入delta信号,定义为教师模型与其未经推理指令微调的基础模型之间的差异。该方法在数学、科学和代码推理基准上一致优于传统on-policy蒸馏。实验表明,仅需短期后训练即可使推理LLM达到强性能。代码已在GitHub开源。
推荐理由:这篇论文用老师模型和基础模型的差值做蒸馏信号,比直接模仿老师更强,数学代码推理都更好,训练时间还短。
11:57
11:57官方账号arXiv cs.LG@Baback Elmieh, Lynn Tsai, Zeman Li, Srinivas Kaza, Tiancheng Sun, Gabor Csapo, Ali Behrouz, Yuan Deng, Stephen Lombardi, Steven M. Seitz, Xuan Luo
该方法将记忆更新与记忆应用解耦,记忆更新周期进行、记忆应用逐帧完成,并采用跨视角注意力处理记忆状态与当前帧之间的形变。引入辅助Memory Loss强制模型内化场景历史,Memory Caching策略防止主动权重灾难性漂移。在动态人体运动场景上实现实时处理,SOTA性能,支持分钟级在线记忆。
推荐理由:这篇论文提出一种新的动态视角合成方法,通过分开记忆更新和应用的频率,实现了实时处理,而且能记住长视频里的短暂遮挡区域。
11:56
11:56官方账号arXiv cs.LG@Arthur G. Bubolz, Abreu Quevedo, Giancarlo Lucca, Rafael A. Berri, Eduardo Borges, Bruno L. Dalmazo
该研究提出一种结合链上数据、金融指标和推特情绪来分类比特币市场情绪的新方法,而非预测价格。使用XGBoost模型进行情绪分类,平均F1-score达到约0.84。通过SHAP方法量化不同链上特征对模型预测的贡献,增强了可解释性。结果显示该数据组合能提供有意义的预测信号,支持数据驱动的加密货币分析。
推荐理由:这篇论文用链上交易数据和推特情绪来给比特币情绪分类,XGBoost模型F1到了0.84,还用了SHAP解释特征重要性,对做加密货币分析的人有参考价值。
11:31
11:31官方账号arXiv cs.AI@Yasheng Sun, Zezi Zeng, Yifan Yang, Chong Luo, Wenyi Wang, Ziwei Liu, Jürgen Schmidhuber
SciDiagramEdit是一个从自然论文修订中学习编辑科学图表的基准和技能演化框架。该基准从arXiv版本历史中挖掘前后图表对,每对都附有作者的修订意图。框架采用智能体学习,通过技能演化不断优化代理的技能规范,提升编辑准确性。实验表明,在保留验证集上,技能逐步提高了编辑准确率,证明自然论文修订是有效的指令驱动图表编辑训练信号。
推荐理由:这篇论文提出了一个从论文修订数据中学习编辑科学图表的框架,还附带了一个基准,适合想做图表自动化编辑的研究者看看。
11:30
11:30官方账号arXiv cs.AI@Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo
该论文提出通过公共讨论界面(如论坛评论)向大语言模型预训练数据注入恶意内容的攻击方法。作者引入HalfLife分析工具,用于评估网络爬虫数据中是否包含对抗性内容。实验表明,基于维基百科等传统数据源的投毒假设不适用于真实的大规模异构预训练语料库。研究强调第三方网页内容可能成为攻击语言模型预训练的潜在向量。
推荐理由:这篇论文讲了一种真实的预训练数据投毒方式——通过论坛评论注入恶意内容,还给出了分析工具HalfLife,搞AI安全的值得看。
11:27
11:27官方账号arXiv cs.AI@Yuyao Zhang, Junjie Gao, Zhengxian Wu, Jiaming Fan, Jin Zhang, Shihan Ma, Yao Yao, Weiran Qi, Chuyan Jin, Guiyu Ma, Xingzhong Xu, Kai Yang, Ji-Rong Wen, Zhicheng Dou
SearchOS是一个系统级多智能体协作框架,旨在解决工具集成大语言模型在信息检索中的重复搜索和预算浪费问题。它通过关系型模式补全和基于引用的证据填充,将隐式搜索进度显式化,并设计了Search-Oriented Context Management (SOCM) 来管理进化状态,包括Frontier Task、Evidence Graph、Coverage Map和Failure Memory。在WideSearch和GISA两个基准上,SearchOS在所有评估指标上均领先于单智能体和多智能体基线模型。
推荐理由:多智能体协作搜索老是卡壳?论文提出SearchOS,用显式状态管理和管道并行调度解决重复循环,在WideSearch和GISA上全面领先。搞检索智能体可以看看。
11:24
11:24官方一手arXiv: DeepSeek@Filippos Vlahos, Guillaume Bied, Tijl De Bie
一项大规模政治偏见研究分析了1394对政府官员条目,使用Grok、Claude、Mistral和DeepSeek四个LLM裁判评估Grokipedia与Wikipedia的中立性。结果显示所有LLM裁判均认为Grokipedia中立性低于Wikipedia。Grokipedia明显偏向经济右翼政治家,而Wikipedia则偏向社会自由派。研究表明LLM撰写的百科并未实现更高中立性,反而嵌入不同意识形态。
推荐理由:这篇论文用四个LLM当裁判,比较了Grok写的百科和维基百科的政治中立性,结果发现Grok版也不中立,甚至更偏,还各有倾向。
11:22
11:22官方一手arXiv: DeepSeek@Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo
该研究分析了GPT-4o mini、DeepSeek和Claude在460个编程任务(Python和Java各230个)上的代码生成质量,将英文提示翻译并人工校订为中文、印地语、西班牙语和意大利语。通过测试通过率、代码度量标准和静态分析工具评估,发现英文提示并非总能产生最佳功能正确性或代码质量,提示语言的影响取决于编程语言和LLM,且生成的代码常在注释和字符串中混合英语与提示语言。这是首个用于研究代码生成中语言偏差的精选多语言基准。
推荐理由:想了解提示语言怎么影响代码生成质量?这篇实测了GPT-4o mini、DeepSeek和Claude在多种语言下的表现,结果英文不一定最好。
11:20
11:20官方账号arXiv cs.AI@Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyde, Maxime Labonne, Alexander Amini, Mathias Lechner
固定分词器在预训练后对新语言无效,导致每个词被拆成更多token,增加延迟和计算。论文提出原地扩展方法,在现有BPE合并基础上继续添加新token,每个新token可精确分解为源token。将该方法应用于LFM2-8B-A1B(8B参数MoE模型),得到LFM2.5-8B-A1B,词汇量从原tokenizer扩展至128K。扩展后,印地语和越南语的token数分别减少约2.4倍和2.6倍,泰语减少高达4.0倍。结合大词汇量的每token成本,估计参考设备上这些语言的每字解码速度提升2.2-3.7倍。
推荐理由:想给模型加新语言但不想从头训?这篇论文的原地分词器扩展办法,让LFM2.5在印地语和越南语上token数砍半,解码快3倍,代码和权重都开源了。
10:58
10:58官方账号arXiv cs.AI@Hoang-Loc Cao, Van Pham, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Phuc Ho, Veronica Whitford, Hung Cao
该论文提出一个自进化、专家参与的MDD症状标注框架,结合LLM辅助标注与专家验证,旨在构建与DSM-5-TR对齐的可解释数据集。框架分为三个阶段:候选证据选择、DSM-5-TR准则分析、病例级综合诊断与严重性标注。采用双记忆架构(示例记忆和反思记忆)内化专家反馈,无需重训即可迭代改进。初步研究表明,该方法在专家评审样本上提升了标注一致性和可解释性,并减少了人工修订量。
推荐理由:这篇论文提出一种结合LLM和专家验证的抑郁症标注框架,能自动生成符合DSM-5-TR标准的推理轨迹,减少人工修订。适合研究可解释AI和心理健康数据标注的人。
10:08
10:08官方账号arXiv cs.AI@Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl
论文提出掩码感知策略梯度方法,解决强化学习应用于掩码扩散语言模型(MDLM)时对数似然估计难的问题。方法将MDLM生成建模为两阶段动作MDP,策略梯度分解为token项和掩码项。联合优化两项后,模型在GSM8K上达87.1%准确率,在MBPP上达53.4%得分,均达到当前最优。
推荐理由:这篇论文给扩散语言模型加了个策略梯度法子,数学推理和编程测试成绩都刷了新高,搞RL训练模型的可以看看。
10:05
10:05官方账号arXiv cs.AI@Madhumitha Venkatesan, Shicheng Wen, Jiajing Guo, Jorge Piazentin Ono, Liu Ren, Dongyu Liu
Plover是一种以计划为中心的视觉GUI自动化系统。它通过规划-执行架构将任务计划外化为可检查、可修改的工件。在六名参与者的形成性研究基础上,Plover支持自然语言指导和截图干预。实验表明,许多自主GUI智能体的失败可通过可见计划和局部干预进行结构性修复。
推荐理由:想了解怎么让GUI智能体更可控?这篇论文讲了Plover系统,能把内部计划展示出来让你改,实验证明能修好很多翻车案例,比黑箱靠谱多了。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。