7月28日
12:12
12:12官方账号arXiv cs.AI@Zhenhan Gao, Marvin Muñoz Barón, Umm-e Habiba, Daniel Graziotin, Stefan Wagner
一篇针对34名程序员的用户研究发现,在AI代码审查中提供详细解释(条件A)获得最高信任评分(3.99/5),但仅提供审查反馈(条件B)反而获得最高同意率(89.22%),说明更多解释会促使开发者更频繁地质疑AI建议。无解释(条件C)的信任和同意率均最低。解释程度并未显著影响审查耗时。该研究为设计可信的AI代码审查系统提供了实证依据。
推荐理由:这篇论文告诉你:给AI代码审查加解释,反而可能让人更不听话。详细解释信任高但同意率低,这结论挺反直觉的。
12:12
12:12官方账号arXiv cs.AI@Zhimin Zhang, Chengzhen Ma, Jia Chai, Rongxin Zhan, Huansheng Ning, Lingfeng Mao, Dan Zhang, Suiping Jiang
该论文重新定义了创新生态系统(IE)并引入人工智能创新生态系统(AIIE)概念,从物理、社会、思维空间三个维度分解IE。通过演化视角分析了AI在AIIE不同发展阶段的角色,使用企业案例验证AIIE定义的可行性与合理性。最后从四个角度探讨了AIIE面临的挑战,为后续研究指明方向。
推荐理由:这篇论文把AI和创新生态的关系讲清楚了,从概念到案例都有,适合想系统了解AI如何推动创新演化的人。
12:03
12:03官方一手arXiv: DeepSeek@Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic
76°
该研究对GPT-5、Claude、Grok、Gemini、DeepSeek、Kimi、Qwen共7个主流模型进行了基于政治轴的可控性压力测试,使用12种意识形态角色提示和70个政治指南针项目,共收集63,700条回答。结果发现,上下文框架解释了经济和社会轴上约88%-93%的方差,而模型自身身份的影响不到3%。在威权提示下,不同模型在相同问题上表现出相似偏移。研究强调需要进行可操控性审计,报告分散性、对称性、饱和度和拒绝底线。数据集和代码已开源。
推荐理由:这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
11:52
11:52官方账号arXiv cs.LG@Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard
该论文提出一种多模态协同学习框架,处理训练与推理时模态不固定的缺失问题,而非传统双模态融合。实验在两种多模态分类基准上,针对任意缺失模态(单模态缺失或仅剩一模态)测试。方法一在单模态缺失时更鲁棒,方法二在极缺失条件下表现更好。代码已开源在GitHub。
推荐理由:这篇论文针对多模态分类中模态任意缺失的问题提出了两种具体方法,在单缺失和极缺失场景下各有优势,代码开源可复现。
11:44
11:44官方账号arXiv cs.LG@Gabriel Singer, Samuel Gruffaz, Olivier Vo Van, Nicolas Vayatis, Argyris Kalogeratos
该研究针对众包标注中的类别不平衡问题,提出一种生成式聚合模型,同时建模项目难度与类别相关的标注者能力。模型在33个真实众包数据集上评估,涵盖图像和文本等多分类任务,以及大规模标注和大规模项目两种场景。实验表明,模型在少数类召回率上持续保持最高,同时平衡精度具有竞争力。
推荐理由:想处理众包标注中的少数类检测?这篇论文的新模型在33个数据集上召回率都最高,值得看看。
11:42
11:42官方账号arXiv cs.LG@Kart-Leong Lim
传统随机变分推理(SVI)依赖共轭后验假设,难以处理非共轭情形。新方法PYPM-GGD基于常数步长随机梯度上升,无需闭式变分后验期望,仅要求可微分。借鉴Adam引入自适应步长,提升随机设置下的收敛性。在MIT67和SUN397数据集上使用ResNet特征,与深度聚类算法相比,聚类指标达到或超越现有最佳方法。
推荐理由:这篇论文提出了一种新的贝叶斯非参数学习方法PYPM-GGD,用自适应步长处理非共轭后验,在MIT67和SUN397上聚类效果不错,比传统SVI更灵活。
11:00
11:00官方账号arXiv cs.AI@Wendi Deng, Hang Du, Guoshun Nan, Haokun Tian, Jiaqi Yu, Xinlei Cao, Jaile Li, Jingfeng Chen, Ling Deng, Ting Li, Hao Yang, Jun Liu, Xudong Jiang, Sicong Leng
多模态大语言模型在推理任务中常出现中间步骤有缺陷但最终答案正确的问题,影响可解释性。论文提出O^2-CritiCuRL框架,在离线阶段通过多轮次分析步骤标注轨迹估计步骤重要性,提取关键推理步骤;在线阶段采用逐步强化学习策略,用截断链引导模型推理缺失步骤。在多个多模态推理基准上达到SOTA,同时训练和推理效率更高。代码已开源。
推荐理由:这篇论文提出了一种新方法,能解决多模态模型推理时中间步骤乱但结果对的问题,效果SOTA还更高效,做推理增强的可以看看。
10:55
10:54
10:54官方账号arXiv cs.AI@Aayush Kumar, Avik Dutta, Sumit Gulwani, Gustavo Soares, Advait Sarkar, Emerson Murphy-Hill
这篇论文构建了一个用于电子表格编程的计划模式原型,并通过24名被试的组内用户研究,将其与无计划基线对比。研究发现,尽管任务结果相似,但使用计划模式减少了用户的调整次数(refinement),并在创造力支持和人机协作维度上获得了更好的工具感知。研究为计划模式在最终用户编程中的设计提供了启示。
推荐理由:这篇论文告诉你,在电子表格里用计划模式(Plan Mode)能少改几遍代码,协作感还能变好。不是玄学,是有24人验证过的。
10:50
10:50官方账号arXiv cs.AI@Yakov Kuzin, Dmitriy Shcheka, Michael Polyntsov, Kirill Stupakov, Mikhail Firsov, George Chernishev
本文研究两种OD发现算法FASTOD和ORDER,并在C++中重新实现以提升性能。在Desbordante开源数据剖析工具中集成后,重新实现版本性能提升最高3倍。结合所提优化技术,性能进一步提升至10倍,内存消耗降低2.9倍。这些改进使顺序依赖发现更贴近工业应用。
推荐理由:这篇论文教你怎么在Desbordante里用C++重写FASTOD和ORDER算法,速度飙到10倍,内存省近3倍,搞数据清洗和查询优化的可以看看。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。