6月19日
10:14
10:14官方账号arXiv cs.AI@Luyang Fang, Yingchuan Zhang, Jongchan Park, Zhaoji Wang, Ping Ma, Xiaoming Zhai
研究提出基于Vision Transformer(ViT)的自信度感知评分框架,用于自动评估学生绘制的科学模型。在6个NGSS对齐的中学评估项目上,该方法通过从测试时预测分布中提取响应级自信度,实现高置信度响应自动评分,低置信度响应转人工审核。相比传统方法,该框架在保持评分可靠性的同时,支持自动覆盖率和评分风险之间的实用权衡。
推荐理由:这篇论文教你用ViT给学生的科学画图自动打分,还能判断哪些该机器批、哪些该人看,很适合做教育评估的参考。
10:13
10:13官方账号arXiv cs.AI@Simon Aagaard Enni, Malthe Stavning Erslev, Karl-Emil Kjær Bilstrup, Kristoffer Laigaard Nielbo
该论文提出'编辑对齐'作为参与式AI的设计实践,旨在让编辑专家参与重新对齐LLM界面以符合编辑标准。通过和北欧公共知识机构合作,设计并实现了LLM驱动的百科全书界面案例研究。论文将编辑标准视为设计制品,把编辑实践和价值观转化为技术对齐目标。最后讨论编辑对齐如何为编辑提供持续参与和代理权。
推荐理由:这篇论文通过具体案例展示了如何让编辑参与对齐LLM,帮助公共知识机构保持编辑标准,实操性强且有启发性。
10:12
10:12官方账号arXiv cs.AI@Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tuan Dam, Vu Duong, Tung M. Luu, Trung Le, Tran Nguyen Le, Minh Vu, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien
VLA模型(如pi_0、GR00T-N1.5)参数规模达数十亿,微调计算成本高。本文通过中心核对齐(Centered Kernel Alignment)识别冗余层,无需训练即可移除最多50%的层。在LIBERO、RoboCasa、SimplerEnv三个模拟基准和10个真实操作任务、4种机器人本体上验证,压缩后模型性能与完整模型相当。微调时间减少40-50%,实时推理速度提升达30%。结果表明VLA模型实际所需层数远少于现有架构。
推荐理由:这篇论文发现VLA模型很多层是冗余的,用他们的方法可以白嫖50%层数,微调快一半,推理快30%,效果不降。搞机器人微调的可以试试。
10:10
10:10官方账号arXiv cs.AI@Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng YAN
SPOT-E方法针对视觉语言模型在处理证据密集型任务时因小区域视觉证据被忽略导致的读取失败问题。该方法利用答案跨度预测熵作为模型内部反馈,通过低熵锚点和熵整形目标消除歧义,避免模型陷入捷径塌缩。SPOT-E基于GRPO进行每实例轻量级调优,生成问题条件化的聚光灯。在多个VLM族和基准测试中,SPOT-E一致提升了性能并增强了视觉损坏鲁棒性。代码已开源。
推荐理由:SPOT-E这个新方法挺有意思,它不重训模型,只在推理时搞了个视觉聚光灯和熵整形,就让VLM在那些需要细看局部证据的任务上表现好多了。尤其用GRPO调优,效果提升还挺稳定。
09:53
09:53官方账号arXiv cs.LG@Ali Asaria, Tony Salomone, Deep Gandhi
论文使用Qwen2.5-7B-Instruct对比了零样本、仅SFT、仅RAG和SFT+RAG混合四种方法在安大略住宅租赁法条文引用上的效果。混合方法以0.481精确匹配(节+条)取得最高分,且将幻觉降至零。SFT提升了高召回候选集中条款选择的鲁棒性,而仅用bge-small嵌入就超越了更大专用检索模型。扩大训练集未带来提升,0.70目标尚未达到。
推荐理由:这篇论文用Qwen2.5-7B做了个四路对比,发现微调加检索混合方案在法条引用上精确匹配0.481还零幻觉,比纯微调或纯检索都强,而且用轻量bge-small就够用。
09:49
09:49官方账号arXiv cs.LG@Paul Collart, Juergen Gall, Andrea Schnepf, Holger Pagel, Lars Doorenbos
该研究提出了首个混合建模框架,从DNA测序数据推断的宏基因组功能特征中推导过程型土壤有机质周转模型的生物动力学参数值。该框架使用神经网络将基因组性状数据映射到生物动力学参数,并整合生态理论和文献约束以确保行为真实。在合成数据和真实数据上的评估表明,该方法在小训练集条件下仍能有效学习不可观测组分的动态,性能优于多个基线模型。
推荐理由:这篇论文提出了一个新方法,用神经网络从宏基因组数据预测土壤微生物参数,还能在小样本下保持准确,搞生态模拟或AI交叉的可以看看。
09:46
09:46官方账号arXiv cs.LG@Itay Lavie, Noam Levi, Yonatan Kahn
本文从物理学视角分析了深度学习训练与泛化的统计特性,指出其打破了经典统计学的多项直觉。重点讨论了神经缩放定律(neural scaling laws)及其与约束、归纳偏置的相互作用。文章还回顾了构建深度学习模型时的多种选择及其合理性。
推荐理由:这篇论文从物理学角度拆解深度学习的统计特性,解释了神经缩放定律如何打破经典统计直觉,做研究的值得看看。
09:45
09:45官方账号arXiv cs.LG@Philipp Kern, László Antal, Erika Ábráham, Carsten Sinz
SLiR是一种新的神经网络验证方法,仅需Lipschitz常数或临界点即可为任意激活函数生成线性松弛。该方法通过参数化斜率和移位过程确保上界和下界的正确性。实验表明,在多种实际激活函数上,SLiR生成的松弛更紧,可验证的属性数量比现有方法最多提升7.8倍。
推荐理由:SLiR让验证任意激活函数变得简单,比现有方法多验证近8倍属性,做神经网络安全的可以看看。
09:44
09:44官方账号arXiv cs.LG@Luke J. Zachmann, David D. Diaz, Vincent A. Landau, Chelsey Walden-Schreiner, Tony Chang, Nathan E. Rutenbeck, Katharyn A. Duffy, Kiarie Ndegwa, Andreas Gros, Scott Conway, Guy Bayes
VibrantForests框架融合国家森林清查、机载激光雷达和卫星图像,以10米分辨率生成美国本土全区域的森林结构属性图。该模型同时估计冠层覆盖、冠层高度、地上活树生物量、断面积和二次平均直径五项指标。模型扩展了常见被动传感器模型的饱和范围,并减少了回归均值行为(稀疏条件下高估、密集条件下低估)。该框架能以年度节奏提供连贯的全区域森林管理相关属性估计。
推荐理由:VibrantForests搞了个新框架,用卫星和激光雷达做出全美10米分辨率森林地图,比老模型更准,不饱和不回归均值。
09:42
09:42官方账号arXiv cs.LG@Md Moman Ul Haque Khan, Samira Sadaoui
该论文从理论上分析了概念漂移的特征,并分类讨论了多种漂移检测算法。在合成和真实数据集上评估了这些算法在不同漂移场景(如突变和渐变)下的性能。研究旨在加深对概念漂移行为及检测器适用性的理解。
推荐理由:这篇论文系统梳理了概念漂移检测算法,并用合成和真实数据测试了它们在突变和渐变场景下的表现,适合做这一方向基础研究的人参考。
09:40
09:40官方账号arXiv cs.LG@Jian Xu, Delu Zeng, John Paisley, Qibin Zhao
该论文指出量子视觉Transformer和量子卷积网络有两个未解释现象:纠缠更多的ansatz泛化更好,注入量子噪声可提升测试准确率。作者通过量子核视觉模型证明两者由有效维度d_eff控制,去极化噪声使d_eff收缩至1,振幅阻尼在倒U型区间提升准确率最高+13%。论文提供了容量/对齐风险分解,将两个孤立现象统一为可测量原则。
推荐理由:这篇论文把量子视觉模型里两个反直觉现象(纠缠越多越好、加噪声反而更好)归结成一个可测量的有效维度,你读完就能抓住设计关键。
09:36
09:36官方一手arXiv: OpenAI@Ahmad Salimi, Wentao Ma, Yuzhi Tang, Dongming Shen, Mu Li, Alex Smola
IHBench评估语音助手在10个企业领域中断后的恢复能力,包含6种中断类型。27个音频语言模型配置来自OpenAI、Google和开源社区。闭源模型在任务完成度上显著优于开源模型,长对话中性能下降慢约3.3倍,且无音频-文本模态差距。人类研究验证了LLM评判的可靠性,交叉分析显示恢复质量是独立能力维度。
事件专题

推荐理由:想测语音助手被用户打断后能不能接好活?IHBench专门看这个,比谁恢复得自然、不错步骤。闭源模型比开源稳太多了。
09:34
09:34官方一手arXiv: DeepSeek@Ruiyang Ma, Teng Ma, Junru Li, Hantian Zha, Xuchun Shang, Qingda Hu, Zheng Liu, Xinjun Yang, Tao Ma, Guojie Luo
精选71°
长上下文LLM推理的内存瓶颈日益突出。传统RDMA解耦内存池对于稀疏注意力模型效率低下,仍需完整获取KV缓存。SAC系统利用CXL的低延迟、缓存行粒度加载/存储语义,仅在推理时按需获取所需的top-k KV条目。在DeepSeek-V3.2上使用SGLang的评估显示,相比RDMA基线,SAC实现了2.1倍吞吐量提升、9.7倍TTFT降低和1.8倍TBT降低。
事件专题

推荐理由:长上下文推理,内存传输是瓶颈。新方案SAC用CXL按需取KV缓存,比RDMA吞吐量翻倍、延迟降到十分之一,做稀疏推理的值得一看。
6月18日
10:58
10:58官方账号arXiv cs.AI@Zongmin Zhang, Yuyang Lou, Bowen Zhang, Junwu Chen, Ryo Kuroki, Xuan Vu Nguyen, Edvin Fako, Lixue Cheng, Philippe Schwaller
AdsMind提出闭环多智能体框架,通过机器学习力场(MLFF)松弛反馈实现自主纠错。在AA20和OCD-GMAE62基准上分别达到100%和98.8%的成功率。每个案例仅需4.11和4.67次MLFF松弛,比启发式枚举减少约14倍。DFT验证(VASP/PBE)显示,相比开放循环基线,AdsMind在所有测试案例中保持正确的吸附能符号。该框架兼顾可靠性、自反思和可解释性。
推荐理由:AdsMind用物理反馈让AI自纠错,在催化剂吸附搜索中达到近乎完美成功率,比暴力枚举快14倍,值得做计算化学的试试。
10:58
10:58官方账号arXiv cs.AI@Linus Sander, Habtom Kahsay Gidey, Alexander Lenz, Alois Knoll
该论文提出一个包含对手方、负载、交互状态、发现机制和模式灵活性5个维度的分类法,对9个活跃维护的开源协议进行迭代分析。研究发现所有智能体间协议均结合混合负载与会话状态持久化,多数协议支持多个预定义模式,两个协议在运行时协商模式,显示模式灵活性趋势。去中心化发现仍属罕见。短期看协议将趋同统一智能体间与智能体-上下文通信,长期则可能发展为分层协议栈。
推荐理由:这篇论文把9个主流的智能体通信协议拆成5个维度做分类,告诉你哪种协议适合什么场景,以及未来会怎么演进。如果你在做多智能体系统,想选协议或者设计协议,这篇很有参考价值。
10:58
10:58官方账号arXiv cs.AI@Jingyi Zhou, Senlin Luo, Haofan Chen
HACD-H是一个统一框架,将情感适应、关系组织、社交记忆和人格一致性整合为动态系统。实验基于约14,700轮对话数据,发现社交智能与社交认知能量显著负相关(r=-0.391,p<0.001)。交互轨迹展示出稳定的关系吸引子和阶段性发展模式,社交智能源于长期共演而非孤立能力。该理论为构建自适应社交智能AI系统提供了基础。
推荐理由:这篇论文提出了HACD-H框架,用近1.5万轮对话数据说明AI和人的社交智能是在长期互动中慢慢涌现的,而不是单靠单次对话或简单记忆就能做到的。
10:58
10:58官方账号arXiv cs.AI@Kasper Helverskov Petersen, François R J Cornet, Martin Ovesen, Mikkel Jordahn, Kristian S. Thygesen, Mikkel N. Schmidt
研究团队将等变图神经网络GotenNet应用于光学光谱预测,在包含10,533个结构的RPA级别光谱数据集上进行评估。该模型在0-8 eV能量范围内和静态实介电常数预测上显著超越现有最佳方法。结果表明等变几何特征能提升材料光学性质预测精度,对太阳能电池等光电器件的高通量筛选具有直接价值。
推荐理由:这篇论文用GotenNet做光学光谱预测,在1万个结构上比现有模型准不少,特别是0-8 eV区间,搞材料筛选的可以看看。
10:58
10:58官方账号arXiv cs.AI@Eranga Bandara, Ross Gore, Ravi Mukkamala, Asanga Gunaratna, Safdar H. Bouk, Xueping Liang, Peter Foytik, Abdul Rahman, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Chalani Rajapakse, Ng Wee Keong, Kasun De Zoysa, Tharaka Hewa, Amin Hass, Wathsala Herath, Aruna Withanage, Nilaan Loganathan, Atmaram Yarlagadda, Sachin Shetty
该论文指出万维网基于人作为主要消费者的假设运行三十年,但AI代理的崛起使这一假设失效。论文提出在访问层为代理提供等效访问权限(通过速率限制和代理识别元数据),在经济层引入基于意图的层级框架和代币订阅模型,在内容层提出代理文本标记语言(ATML)和加密来源链对抗知识递归问题。包含十项设计原则,涵盖访问、经济、内容三个层面。
推荐理由:这篇论文讨论了如何让网站不再封杀AI代理,而是为它们设计合理的访问、收费和内容标注机制,比如ATML语言。适合关心Web未来和AI治理的人看。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。