8月11日
10:44
10:44官方一手arXiv: DeepSeek@Jiayi Li, Di Wu, Qingxu Li, Hongxiao Zhao, Jiaqi Yang, Anjunyi Fan, Wenbin Zhang, Boqiang Wu, Shuting Liu, Shifeng Fang, Jianbo Dong, Dimin Niu, Bonan Yan
精选
C2C-Explorer是一个自适应贝叶斯设计空间探索框架,用于优化大语言模型云计算系统中的芯片间互连架构。该框架集成了LLM工作负载驱动的流量生成器、可扩展互连模拟器(支持交换机/全网格,最多512芯片)和指标引导评估器。模拟器经FPGA原型验证,端到端时序误差为2.46-8.23%,混合周期事件模型比纯周期精确基线加速7.8倍。在32-XPU DeepSeek-R1-671B推理工作负载上,C2C-Explorer将goodput提升44.1%,内存减少98.4%。该框架已开源。
推荐理由:做LLM集群硬件设计的朋友可以看看,这个框架能自动探索芯片间互连方案,在DeepSeek-R1上吞吐提升44%,内存省98%,还开源了。
10:43
10:43官方一手arXiv: DeepSeek@Issac Zhu, Hscos Zhang, Keith Jiang, Jack Li, Hugh Yin, Jason Zhao
精选
FlashBoot是SGLang上的权重加载子系统,针对MoE模型弹性部署中的延迟问题。它通过FabricArena连续内存布局和FlashLoad零拷贝批量传输,将单节点权重加载从20.1秒降至0.4秒,加速50倍。FlashClone利用远程映射替代NCCL初始化,将跨节点复制时间从10-110秒降至约10毫秒。在NVL72上测试DeepSeek-V4-Pro和DeepSeek-V4-Flash,并发机架级加载从87秒降至0.32秒,加速超270倍。
事件专题

推荐理由:SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。
10:38
10:38官方账号arXiv cs.AI@Mengnan Zhao, Geyong Min, Lihe Zhang, Tianhang Zheng, Jie Cui
CGRm 是一种用于长尾对抗训练的插件式框架,利用有向鲁棒误差作为训练信号。它通过周期性鲁棒评估推导源类损失权重、类级鲁棒系数和有向混淆几何图。该方法将反馈加权鲁棒优化与图引导的边界校正相结合,提升脆弱类别的鲁棒性。在长尾基准上的实验显示,CGRm 相比现有方法取得一致的鲁棒性能提升,消融实验验证了各组件贡献。
推荐理由:CGRm 解决了长尾对抗训练中类别不平衡和对抗放大双重问题,用混淆几何图精准定位关键边界,实验效果不错,值得做对抗训练的人看看。
10:24
10:24官方账号arXiv cs.AI@Zian Li, Litong Gong, Borui Liao, Pengfei Liu, Xinyu Wang, Xinyuan Wei, Yifan Gao, Tiezheng Ge, Muhan Zhang
扩散模型视频生成采样成本高,DUET提出将轨迹级蒸馏sCM与分布级蒸馏DMD按噪声层次分工:sCM负责高噪声步保留结构多样性,DMD负责低噪声步细化外观。基于Wan2.1-T2V-1.3B,DUET让两步生成质量接近DMD,同时多样性约为DMD两倍。DUET+通过RL引导专家适配进一步提升整体质量并维持多样性优势。
推荐理由:想看两步视频生成怎么同时保质量和多样性?DUET让sCM和DMD各管一段,在Wan2.1上做到质量接近DMD、多样性翻倍,路子很巧。
8月10日
11:27
11:27官方一手arXiv: OpenAI@Ivan Majic, Zexian Huang, Franziska Hübl, Krzysztof Janowicz, Meilin Shi, Mina Karimi, Zilong Liu, Alexandra Fortacz-Lazan
论文提出一种模态转移任务,要求LMM先用文本描述规则网格中的彩色方块图像,再用新的LMM实例根据文本描述重新生成原空间场景。实验采用OpenAI的近期LMM,结果显示其在重新生成简单彩色方块网格图像时仍存在困难。研究表明,LMM的强健地理空间理解需要严格的多模态对齐,当前模型在图像和文本模态间转移空间信息的能力仍是瓶颈。
事件专题

推荐理由:这篇论文拿彩色方块网格考OpenAI的多模态模型,让它们看图写话再画图,结果画不对,做自动GIS得先解决这问题。
11:19
11:19官方账号arXiv cs.AI@Bella Xinrui Li, Frank Yingjie Huo, Neil F Johnson
arXiv论文2608.07457用两个AI做了交互实验。两个AI共享相同的解码温度,但subordinate却进入独自运行时不存在的异类状态。当boss倾听回复时,两个AI会进入相似的异类动态,论文用一个动力学理论解释了该现象。
推荐理由:这篇arXiv论文发现,两个AI互相聊天时会出现单个AI没有的怪行为,比如一个AI一直发指令不理对方,另一个就会陷入陌生状态。用物理的视角看AI,挺有意思。
11:18
11:18官方账号arXiv cs.AI@Daniel Armstrong, Xuan-Vu Nguyen, Octavian Susanu, Gabriel Gibberd, Théo A. Neukomm, Taddäus Strunden, Dan Forster, Morgane Delattre, Shawn Teh, Clément Rols, John Federice, Hayden Leatherwood, M. Lavelle Barnes, Maarten R. Dobbelaere, Peter Wipf, Jon T. Njardarson, Jieping Zhu, Philippe Schwaller
SynthEx是一个基于大语言模型的智能体框架,用于规划复杂天然产物的全合成路线。它能够提出多种竞争策略,并自行评判和改进路线设计,其路线比传统目录式工具更具收敛性。在盲评中,专家化学家认为SynthEx的关键步骤与已发表的人工合成相当,这是算法路线预测首次获得这样的回应。该团队发布了SynthAtlas,一个开放交互数据库,包含超过一千条天然产物的合成路线,其中许多缺乏现有文献路线。
推荐理由:SynthEx用LLM规划天然产物合成路线,盲评中专家觉得它设计的关键步骤不输人类,还开源了上千条路线数据库。
11:16
11:16官方账号arXiv cs.AI@Afreen Alam, Evgenija Popchanovska, Ana Gjorgjevikj, Maryan Rizinski, Lubomir T. Chitkushev, Irena Vodenska, Dimitar Trajanov
论文提出用LLM辅助的RAG管道分析21个开源AI安全工具,将其能力映射到MIT AI风险分类的32个子类。三名评审的评估显示中等一致性(Fleiss' Kappa = 0.509)。结果显示工具集中在技术和运营控制,而治理、法律和金融控制几乎空白。多数投票后映射协议F1分数达75.5%。
推荐理由:把21个开源AI安全工具对照MIT风险分类,发现都堆在技术防护,法律金融没人管。做治理的值得翻翻。
11:08
11:08官方账号arXiv cs.AI@Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury
论文提出用视觉语言模型处理数值时间序列,将KPI窗口编码为2D图,在Llama-3.2-90B、Qwen2.5-VL-72B和Pixtral-12B上实现3.6-10.4倍输入token缩减。实测推理能耗降低1.8-2.5倍,在电信边缘部署中每天节省约7.2MJ。微调的Llama-3.2-90B-Vision异常检测精度比文本版高220.7%,比LSTM和ARIMA高144%。Pixtral-12B在公共基准上J/F1提升20.6倍,平均F1为0.82。
推荐理由:这篇论文告诉你,把数据画成图再给模型看,能省电还更准。电信场景实测能耗降2.5倍,精度翻倍,值得做时序分析的人看看。
11:06
11:06官方账号arXiv cs.AI@Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang
ResidencyRL通过强化学习在模拟临床环境中训练医疗AI,每个轨迹最多包含60轮对话和8次工具调用。在对抗条件下,该智能体的诊断准确率达到88.0%,比基础模型提升7.0%。漏诊红旗率降低31%,表明能有效减少过早闭合。盲审临床专家在87.6%的对比中更偏好训练后的智能体。在AMIE多访基准的六个临床轴上均超过基础模型。
推荐理由:医疗AI训练新方法ResidencyRL,模拟临床对话,诊断准确率涨7%,漏诊率降31%,专家更看好。
11:05
11:05官方账号arXiv cs.AI@Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang
该论文提出ICQ任务,要求模型同时关联输入视频和人物参考图像,完成身份定位、行为理解与时间推理。配套的ISYV-Bench包含1,377个真实复杂视频和1,377个问答对,分为6个难度等级。训练集ISYV-75K提供75K个高质量样本,经自动标注和人工审核构建。实验显示主流闭源和开源多模态模型在ISYV-Bench上表现吃力,尤其在跨域身份匹配和长时跟踪方面;ISYV-Model超过强基线,部分指标接近闭源模型。
推荐理由:这篇论文搞了个新任务ICQ,让AI对着人像照片在视频里找人、看行为,还放出1377个视频测试集和75K训练集,开源模型里ISYV-Model效果最好。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。