7月16日
09:36
09:36官方账号arXiv cs.AI@Michal Štefánik, Philipp Mondorf, Andreas Waldis, Qianying Liu, Chuan Yang, Michal Spiegel, Josef Kuchař, Marek Kadlčík, Adam Vawda-Oomerjee, Chaoran Liu, Simon Frieder, Barbara Plank, Fazl Barez, Pontus Stenetorp
AIMO可解释性挑战赛旨在通过模型内部机制区分前沿数学语言模型的鲁棒推理与虚假推理。比赛基于AI数学奥林匹克(AIMO)问题及Fields Model Initiative资源,提供新发布的奥林匹克级数学推理题及其符号表示。参赛者可访问前沿推理模型及其对抗鲁棒性评估,开发识别鲁棒推理的方法。比赛将创建开放的鲁棒性基准和基线系统,推动数学推理与可解释性研究。
推荐理由:想测试数学推理模型是真会思考还是靠蒙?这个挑战赛提供了新基准和资源,帮你判断模型的鲁棒性。
09:33
09:33官方账号arXiv cs.AI@Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu
AgentHOI 提出一个无需训练的智能体框架,将多模态大模型的推理能力用于人-物交互检测。它通过上下文感知多轮推理和多方面交互定位两个机制,实现开放场景下的语义推理与空间定位。在真实世界设置中,AgentHOI 超越现有有监督和弱监督方法,且无需任何 HOI 检测训练数据。
推荐理由:这篇论文搞了个 AgentHOI,不用训练数据就能做开放世界的人-物交互检测,靠多模态大模型推理,效果还比有监督方法好。
09:31
09:31官方账号arXiv cs.AI@Nan Chen, Zemin Liu, Bryan Hooi, Bingsheng He, Jun Hu, Jia Chen
论文提出NodeImport框架,针对图神经网络在类不平衡场景下对少数类过拟合的问题。该方法通过构建平衡元集来测量节点重要性,筛选出能提升无偏模型性能的标签、未标签及合成节点。理论推导出直接评估节点重要性的公式,并引入阈值用于节点选择。在多个数据集上使用GCN、GAT等架构进行测试,结果优于现有基线方法。
推荐理由:这篇论文讲怎么解决图数据里类别不平衡的问题,NodeImport能动态挑出重要节点,不用重新生成太多假数据,效果还比现有方法好。做图神经网络、节点分类的可以看看方法细节。
7月15日
11:10
11:10官方账号arXiv cs.LG@Xiaoyu Li, Zheng Gao, Xiaoyan Feng, Jiaojiao Jiang, Yulei Sui, Jiankun Hu
该论文从信息论角度研究生成模型水印的取证能力,包括归属用户、提取载荷和定位编辑幸存部分。定义信息轮廓ν(t)=I(S;X_t|X<t)并证明检测由分布距离决定,归属和提取由信息总量决定。主要定理给出统计无失真方案下归属N个用户需Θ(log N/h)个token(h为熵率),提取ℓ位载荷需Θ(ℓ/h)。在GPT-2、Pythia-410M、Qwen2.5上的实验验证了理论常数。
推荐理由:这篇论文用信息论精确测量了水印取样的代价:归属N个用户需要多少个token,提取载荷需要多少,并在GPT-2等模型上验证了理论预测。
10:05
09:55

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。