12:09
12:09
官方账号arXiv cs.LG@Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipin Chaudhary 这篇论文将测试时缩放形式化为自回归模型隐式前缀树上的预算推理,区分单轨迹连续缩放、叶级缩放和前缀级缩放三种结构。论文提出评估轮廓,将端到端系统性能与候选库诊断分离,并指定推理协议的可重复性要求,区分精确重放与分布可复现。作者在广泛知识、符号推理和竞赛数学基准上应用这些原则,并组装了超过20亿条完整推理轨迹供发布。
推荐理由:这篇论文把测试时缩放拆成三种结构,还给了评估和复现规范,做推理模型的人可以参考。
11:41
11:41
官方账号arXiv cs.AI@Mercy Prasanna Ranjit, Anirban Porya, Sathvik Joel, Niharika Vadlamudi, Nikhilesh Chowdary Eathamukkala, Prasanth V, Abhyuday Kumara Swamy, Pranay Narhari Umredkar, Pradeep Narayan, Vivek Rajagopal, Tanuja Ganu CARE-X 在生成骨干网络上增加焦损失分类与复合损失定位头,与语言建模目标联合训练,使胸片报告生成、发现分类和空间定位互相增强。配合任务级奖励优化的 DAPO 策略,该方法在四个报告生成基准的大部分指标上达到最优,ReXVQA 视觉问答准确率 94.0%,比次优基线高 6.0 个百分点。此外,将 Qwen3-VL-4B-Instruct 与可调用确定性测量工具的原生工具能力结合,在五个依赖测量的诊断场景中平均 F1 比仅靠感知的基线高 43.6 个百分点。
推荐理由:医学影像领域的小伙伴可以看看这篇,CARE-X 把胸片分类、定位、报告生成整合到一个模型里,还靠工具调用做解剖测量,临床实用性比纯生成模型强不少。
11:09
11:09
官方账号arXiv cs.AI@Leijun Zhou, Zhihao Liu, Xiang Qu, Chenxu Liu, Yifei Liu, Yanke Yu, Jingzhe Xu, Xuejun Wu, Buyue Qian, Xi Chen, Yaowei Zheng, Junhao Hu GDPevo是一个基于GDP相关企业工作流的智能体自我进化评估基准,覆盖CRM、ERP、金融、医疗、法律和数据工作流。其规则杂交机制把每个流程拆成原子业务规则,训练与测试任务重组规则,使测试收益可归因于训练经验。V1包含12组120个任务,每组5个训练任务和5个保留测试任务;流水线可在两天内扩展到V2的24组240个任务。研究者在四种监督类型下评估了四个智能体,自我进化使保留测试准确率最高提升16.44个百分点。但最优进化智能体仍远低于91.6%的全知上限,说明当前智能体的自我进化能力尚未充分实现。
推荐理由:想评估智能体能不能从经验里进步?GDPevo用企业真实流程搭了120个任务,最高涨16.44个点,开源可跑。
11:05
11:05
官方账号arXiv cs.AI@Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo, Felipe Ocampo Osorio, Quang Bui, Mohammad Shahin, Armaan Grewal, Emmanuel Paul Kwesiga, Anqi Peter Li, Josephine Nanyonjo, Aaditya Panchal, Arshnoor Bhutani, Nikhil Jaiswal, Milit S. Patel, Maximin Lange, Leo Anthony Celi 一项研究测试了临床多智能体委员会是否会被捷径欺骗,覆盖文本、影像和ICU表格七组队列。在MedQA-USMLE等六个数据集上,Gemini委员会单独面对误导线索时仅有5-16%的翻转率,但两个同伴给出同一错误答案时,holdout模型在38%案例中采纳。三种监督智能体中,gate的假阳性率达100%,同源judge在文本上精确率100%但在影像上失效,而独立referee在影像上取得77-88%精确率。研究还发现,视觉显著性提高三倍不增加传染,但第二个同伴声音使传染率提高一半。
推荐理由:Gemini多智能体会被同伴错误带偏(38%案例),独立裁判能抓,门控不行,做临床AI的注意了。
11:00
11:00
官方账号arXiv cs.AI@Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike Guo FISA 框架从模型自身的失败案例中生成增强图像,避免使用与模型短板脱节的通用变换。该方法通过自检验和双重保真过滤,在保持答案正确的同时提升图像复杂度。在视觉问答基准上的实验表明,FISA 能持续改进分布内与分布外性能,并与现有文本自增强方法兼容。其合成样本的数据效率也优于通用图像增强基线。
推荐理由:这篇讲FISA,拿模型答错的题来造新训练图,比瞎做增强更准,还能和文本增强一起用。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。