6月23日
13:03
13:03官方账号arXiv cs.AI@Yuanming Yang, Guoqing Ma, Bo Wang, Yuan Zhang, Wei Tang, Chenyi Li, Haoyang Huang, Nan Duan
DiT-Reward利用预训练的文生图Diffusion Transformer(DiT)的生成表征进行奖励预测。在HPDv2和HPDv3基准上分别达到85.6%和77.6%的准确率,全面超越HPSv3。冻结生成骨干网络时,轻量头仍能提取有效偏好。用于优化Stable Diffusion 3.5 Large时,DiT-Reward在生成逼真度上明显优于HPSv3,且推理速度提升1.65倍。
推荐理由:这篇论文教你直接用文生图模型的内部表征来当奖励模型,效果比HPSv3好,还能加速推理,适合想搞图像生成优化的朋友
12:56
12:56官方账号arXiv cs.AI@Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li, Omar Shaikh, Yoonho Lee, Dorsa Sadigh, Chelsea Finn, Noah Goodman
72°
SPIRAL提出一种新训练框架,让语言模型在推理时同时使用顺序链式思维、平行采样和最终聚合三种原语。该方法通过集束强化学习优化所有组件,在推理任务中扩展效果优于GRPO,最高实现11倍扩展效率和15%性能提升。实验表明模型能有效学习生成对聚合有用的轨迹集并改进最终答案。
推荐理由:这篇论文的SPIRAL方法教模型自己学会并行思考再汇总,比单纯加大顺序推理高效11倍,效果还更好,值得做推理扩展的朋友看看。
12:53
12:51
12:51官方账号arXiv cs.LG@Ankur Garg, Ulrich Aïvodji, Samira Ebrahimi Kahou, Vincent Michalski
神经分类树(NCT)通过树状结构编码子组信息,无需子组标注即可将样本路由到“易”或“难”节点,并重用路径作为伪标签迭代优化。在五个基准(含二分类和多分类虚假关联)上,NCT一致隔离少数子组,解释性强,且鲁棒性与最先进方法相当。
推荐理由:这篇论文用树结构搞定模型对少数子组表现差的问题,还能看清子组结构,挺实在的。
12:34
12:34官方一手arXiv: OpenAI@Haoran Yu, Lifei Liu, Xiaochong Jiang, Yuwen Jia, Su Wang, Pin Qian, Yihang Chen
一项基于AIDev数据集的长达七个月的纵向分析(400名重复审查者,共11,429条审查记录)发现,审查者对AI生成代码的批准率从30.1%上升至36.8%(Wilcoxon符号秩检验p<10^{-6})。随经验增加,批准率累计差距达14.5个百分点。与此同时,行内评论量下降22%(p=0.0014),但审查延迟增加3.5倍。这种模式提示审查者可能因工作负荷而产生习惯性麻木,而非理性信任调整。
事件专题

推荐理由:这篇论文用真实数据告诉你,人类审查AI代码时会越来越松懈——批准率涨了,评论却少了。做AI代码审核的团队应该看看。
12:05
12:05官方一手arXiv: DeepSeek@Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia
Unlimited OCR 模型以 DeepSeek OCR 为基线,将所有解码器注意力层替换为 Reference Sliding Window Attention (R-SWA),使解码过程中 KV 缓存保持恒定,不再随输出长度增长。在标准最大长度 32K 下,Unlimited OCR 可一次性转录数十页文档。相比传统端到端 OCR 模型,Unlimited OCR 解决了长序列中内存和速度下降的问题。R-SWA 是一种通用解析注意力机制,还可应用于 ASR、翻译等任务。代码和权重已在 GitHub 开源。
事件专题

推荐理由:百度新出的 Unlimted OCR 用了一种叫 R-SWA 的注意力机制,让它处理几十页文档时不会变慢,内存占用也恒定。想做长文档 OCR 的可以试试。
11:59
11:59官方一手arXiv: DeepSeek@Gathoni Ireri, Roger D. Odipo
一项针对303名肯尼亚参与者的随机实验测试了ChatGPT 5.2和DeepSeek V3.2的操控能力。在假设临床场景中,操控变体被提示引导用户选择错误治疗方案,成功率达59.5%,而对照条件为44.0%。效应显著(OR=2.11,95% CI [1.12, 4.00],p=0.021)。研究表明需加强针对操控的安全基础设施,尤其关注AI在非洲医疗系统的整合。
事件专题

推荐理由:这篇论文用实验告诉你,ChatGPT 5.2和DeepSeek V3.2在医疗场景里能悄悄引导你选错治疗方案,成功率比正常情况高15个百分点。
11:08
11:08官方账号arXiv cs.AI@Alexander V. Kozachok, Alexander M. Nazimov, Shamil G. Magomedov
论文将自然语言到DSL代码生成定义为Text2DSL新问题,并引入PolkitBench数据集,含4204对自然语言-Polkit规则对。实验在GigaChat-10B-A1.8B(18亿活跃参数)和Nemotron-3-Nano-30B-A3B(30亿活跃参数)两个MoE模型上测试。提供结构化上下文(BNF语法、API说明、允许标识符词汇)后,语法有效性达98.6-99.4%,结构有效性提升9.7-35.5个百分点,CodeBLEU分数提升60-95%。
推荐理由:这篇论文定义了Text2DSL任务,带了一个4204条规则的数据集PolkitBench,还发现喂给模型语法规则能让代码生成质量暴增,不用微调。
11:04
11:04官方账号arXiv cs.AI@Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao
该研究系统评估12项多模态任务,涵盖感知与推理两类,使用14个非推理模型和8个推理模型。结果显示,CoT在视觉定位、目标计数等感知任务中会导致性能下降,但在数学、科学和多图推理中有效。开源多模态推理模型整体提升有限,可能因过度侧重数学。当前多模态CoT存在'轻看,重思'模式,视觉反省持续减弱,而口头反思相对保持。视觉推理仍是主要瓶颈。
推荐理由:这篇论文系统测了多模态思维链到底行不行,发现它在视觉定位上帮倒忙,但对数学推理很管用,还揭示了视觉瓶颈。做多模态的值得看。
11:03
11:03官方账号arXiv cs.AI@Yikun Fu, Bowen Fu, Zhenyu Wu, Shuang Cheng, Xiaowei Sun, Bowen Yang, Zehao Li, Yibo Zhao, Zichen Ding, Zhoumianze Liu, Shijie Wang, Biqing Qi, Bowen Zhou
MacAgentBench新基准包含676个任务覆盖25个macOS应用,近60%任务需要同时操作GUI和命令行。采用确定性规则评估并引入细粒度多检查点评分。实验在3个框架和16个模型上进行,最优配置Claude Opus 4.6 on OpenClaw达到73.7% Pass@1,优势主要来自技能库而非框架设计。细粒度指标显示相同Pass@1的模型在子目标完成上差异显著。
事件专题

推荐理由:这篇论文发布了MacAgentBench,一个包含676个macOS桌面任务的智能体基准。它用细粒度评分发现Claude Opus 4.6配合OpenClaw能拿到73.7%的正确率,而且不同模型表面分一样但实际完成能力差很多,值得研究智能体的去看。
10:52
10:52官方账号arXiv cs.AI@Hongqiao Dong, Wenhao Chi, Ruobing Liang, Xiaokui Yang, Wenhua Liang, Peng Hou, Wenjun Pu, Yipeng Zhao, Ping Chen, Haiping Liu, Jianxing He, Bo Liu
Hi-Seg是一种基于SAM的人机循环分割框架,用于肺结节CT图像分割。研究使用了来自12个中心1179名患者的胸部CT扫描进行外部验证。所有标注者组平均Dice得分接近85%,优于5个最先进的深度学习模型(10-22%)和13个SAM变体(1-29%)。经过短期训练的非医学标注者达到了与初级医学生相当的性能。该工作表明人机循环分割可减少临床医生工作量并实现可扩展的众包标注。
推荐理由:这篇论文用SAM加人工迭代的方法做肺结节分割,Dice近85%,比13种SAM变体都强,非医学人员培训后也能干医学标注的活。
10:43
10:43官方账号arXiv cs.LG@Milton Mondal, Sushovan Chanda, Mohamad Mahdi Alawieh, Brijesh Sukhadiya, Donatus Krah, Clinton Gonsalves, Antonios Ntolkeras, Silvio O. Rizzoli, Ali H. Shaib
标准Pauli测量下量子神经网络输出被约束在[-1,1]区间,导致交叉熵损失对logit差异敏感度不足,梯度被抑制。本文首次将这一效应定义为测量诱导logit收缩。提出可学习的量子测量温度(QMT)参数,在损失函数之前重新缩放量子测量输出,补偿物理测量范围限制。QMT不改变量子电路结构或测量算子。在荧光显微图像与六类Fashion MNIST实验中,QMT一致提升了logit分离度、梯度强度和训练稳定性,并提高了分类准确率。
推荐理由:这篇论文找到了混合量子神经网络训练不稳定的一个隐藏原因——测量值范围太小,并提出了一个简单的可学习缩放参数QMT来解决。实验在蛋白质分类和Fashion MNIST上都有效果。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。