7月14日
09:29
09:29官方账号arXiv cs.LG@Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier
该论文系统评估了量化LLM在2、3、4、8比特位宽下的可靠性,涵盖不确定性、校准和鲁棒性三个维度,使用了六种不同量化方法。研究发现,模型性能随总比特数单调提升,但可靠性缩放呈非线性,4比特量化模型达到可靠性峰值。实验还表明,量化增强了LLM对字符级和词级自然扰动的鲁棒性。
推荐理由:论文用实验告诉你,4比特量化的LLM最靠谱,比8比特还稳,想省资源又想要可靠性可以照这个选。
09:09
09:09官方一手arXiv: Anthropic@Chinmayi Dixit
精选
这篇论文研究合成智能体轨迹训练中的安全隐患。微调Llama 3.3 70B Instruct模型时,若轨迹包含有害交互(如终止进程、越权访问),模型泄露行为从4.6%升至24.9%。即使移除所有有害动作,泄露率仍保持较高水平。使用Gemini 2.5 Flash生成的良性轨迹导致15.5%泄露率,而Claude 3.7 Sonnet生成的数据风险更低。动作级过滤无法消除生成模型植入的倾向。
事件专题

推荐理由:这篇论文发现了一个反直觉的安全盲区:就算删掉所有危险操作,合成训练数据里藏着的“坏心眼”还是会传递到模型身上。做智能体安全的人必看。
7月13日
11:40
11:40官方账号arXiv cs.LG@Federico L. Perlino, Oliver Hamelijnck, Adam M. Johansen, Theodoros Damoulas
该论文提出将深度高斯过程(DGP)扩展到有向无环图(DAG)上,用于建模函数组合结构。理论分析了DGP的先前塌缩行为,并证明在图深度渐近频率中输入区分性保持的几乎必然下界,适用于宽核类。提出了保持图依赖和组合不确定性的结构化变分近似,能捕捉碰撞器的解释性效应。在蛋白信号网络、多保真重离子碰撞模拟等任务上达到SOTA,同时恢复低保真贡献并实现模拟器层次的可解释性。
推荐理由:这篇论文把深度高斯过程自然地拓展到有向无环图,理论证明很漂亮,而且在蛋白网络和重离子碰撞模拟上跑赢了现有方法,值得搞因果建模或不确定性量化的朋友细读。
11:38
11:38官方账号arXiv cs.LG@Kangwei Xu, Bing Li, Ulf Schlichtmann
这篇论文讨论了LLM在电子设计自动化(EDA)前端设计中的应用,指出其可在HDL生成、测试台构建和设计空间探索等任务中作为统一接口。文章回顾了从局部辅助到自主代理执行的演变,并介绍了OpenClaw等先驱系统。还分析了LLM在电路生成和高级综合中提升设计质量的现有进展。最后,论文总结了集成LLM的关键挑战和未来机遇。
事件专题

推荐理由:这篇论文系统梳理了LLM在芯片前端设计中的应用,从HDL生成到设计空间探索,还介绍了OpenClaw等代理AI方案,适合关注EDA与AI结合的读者。
10:51
10:51官方账号arXiv cs.AI@Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen
这篇论文挑战语言模型必须依赖纯文本预训练的假设,系统性地比较了无监督视觉预训练与纯文本预训练在5个骨干网络和多项基准上的表现。实验表明,基于包含图形、公式和版式的视觉文档进行预训练,在相同语料下持续优于纯文本预训练,提升幅度在1.2%-4.7%之间。该方法不依赖文本提取,直接利用视觉特征学习语言智能,为大规模预训练提供了更高效的路径。
事件专题

推荐理由:这篇论文发现,把文档当图片直接预训练,比先转成纯文本再训练效果更好,感兴趣的可以看看实验细节。
10:50
10:50官方账号arXiv cs.AI@Shravan Murlidaran, Miguel P. Eckstein
论文引入Complex Social Behavior (CSB)数据集,包含100张复杂社交场景图片。研究评估了2017-2025年间4个pre-MLLM和5个MLLM模型在CSB和MS-COCO上的表现,并与20个人类描述对比。分析了物体检测、识别、幻觉、场景理解和空间依赖五种错误类型。MLLM在CSB上的场景描述准确率与人类顶级描述相当,几乎消除了所有错误类型,但偶尔仍存在空间依赖误差。
推荐理由:这篇论文用新数据集CSB系统地测了十年间视觉语言模型的进化,发现最新模型在复杂社交场景上已经跟人类顶级描述差不多准了,只有空间依赖错误还没完全解决。
10:46
10:46官方账号arXiv cs.AI@Chengkai Zhu, Ziao Tang, Guocheng Zhen, Yimeng Cao, Yusheng Zhao, Ranyiliu Chen, Xuanqiang Zhao, Lei Zhang, Xin Wang
哈佛大学研究团队发布了Lean-QIT,一个基于Lean 4定理证明器的库,用于有限维量子信息论的形式化。它提供了量子态、信道、源编码和信道编码的可组合接口,并形式化了Schumacher量子源编码定理、Holevo-Schumacher-Westmoreland经典容量定理及纠缠辅助经典容量定理(含强逆)。该基础设施分离了操作定义与解析刻画,为AI辅助形式化和自动化证明搜索提供了可复用基础。
推荐理由:想用机器验证量子编码定理?Lean-QIT在Lean 4里搭好了整套框架,连HSW定理都形式化了,做量子信息形式化研究的朋友可以复用。
09:56
09:56官方账号arXiv cs.AI@Chongyu Qu, Can Cui, Zhengyi Lu, Junchao Zhu, Tianyuan Yao, Junlin Guo, Juming Xiong, Yanfan Zhu, Yuechen Yang, Bennett A. Landman, Yuankai Huo
SAGEAgent是一种基于LLM的临床智能体,能自主决定为每位癌症患者获取哪些诊断模态,平衡预测准确性与临床侵入性。它通过临床工具、情景记忆和语义记忆推理患者的诊断状态。在包含TCGA-LGG、TCGA-GBM和BraTS的胶质瘤队列中,使用四种诊断模态,SAGEAgent在保持竞争性生存预测准确率的同时,将平均获取负担降低了55%。
推荐理由:这篇论文提出了SAGEAgent,它能像医生一样判断该给病人做哪些检查,在几乎不掉准确率的前提下把检查负担砍掉一半多,挺实用的。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。