7月8日
10:07
09:58
09:58官方账号arXiv cs.LG@Muhammad Imran, Vincenzo Stoico, Ivano Malavolta
该论文研究了Java方法级别的能耗预测,分析了2,786个Java方法的33个静态特征与执行时间和能耗数据。训练并比较了11个回归模型,发现静态代码指标预测性能差,平均R²接近0。加入执行时间后R²提升至0.46,执行时间、内部方法调用和圈复杂度成为最强预测因子。
推荐理由:论文有硬数据:只看代码静态指标预测能耗基本无效,加上执行时间后R²从0升到0.46,做绿色软件开发需要知道这个差异。
09:55
09:55官方账号arXiv cs.AI@Andrea Alfarano, Andrea Bacciu, Saab Mansour, Amin Mantrach, Marcello Federico
该研究首次在22种语言(涵盖高、中、低资源)上系统评估了9种不确定性估计方法。发现用英文推理(即使问题为低资源语言)能显著提升UE性能,并缩小与高资源语言的性能差距。研究还指出,小规模模型下基于概率的开放盒方法更优,大规模模型下封闭盒的自我表述不确定性更有效。论文提供了多语言选择性预测中阈值选择的指导。
推荐理由:这篇论文用22种语言、9种方法实测发现:让模型用英文思考能大幅改善低资源语言的不确定性估计,选方法还得看模型大小。
09:51
09:51官方账号arXiv cs.AI@Yanping Chen, Weijie Shi, Wen Yang, Jiajie Xu
SkillReranker通过任务和技能两侧的语义分解,生成子任务描述和执行状态描述,并构建有向无环执行图。该框架利用交叉编码器对每个任务区间的候选技能进行综合评分,选择最合适的技能集。在ALFWorld和ScienceWorld两个基准上的实验表明,SkillReranker有效提升了任务完成率,减少了环境交互步骤和token消耗。
推荐理由:这篇论文提出了SkillReranker,在智能体任务中通过任务分解引导技能重排序,比传统方法更准更省token,具体在ALFWorld和ScienceWorld上验证了效果。
09:07
09:07官方一手arXiv: DeepSeek@Muhammad Assad Shehbaz, Carlos Francisco Moreno-García
该论文提出端到端管道,用于从房地产问卷文档中提取结构化数据。管道将文档分为三类:text_only、scanned和special_char,使用DeepSeek R1从合格文档中提取35个属性。在3965份文档上测试,2781份成功处理,产生2766条唯一记录。余弦相似度匹配Jaccard得分为0.82,K-Means聚类轮廓系数0.2088。
推荐理由:这篇论文演示了用DeepSeek R1从杂乱文档里提取表格数据,效果不错,做房产数据或文档处理的人可以看看。
7月7日
13:03
13:03官方一手arXiv: OpenAI@Sukanta Ganguly
PLACEMEM将智能体记忆表示为带版本号的胶囊,统一语义、来源、有效性和可重用运行时状态。原型基于vLLM,支持提示级文本检索、KV导向路由和级联失效。通过OpenAI兼容的侧车和类型化元数据契约,测量了首次token延迟、复用率和校正后行为。论文提出了面向终身智能体系统的重放感知服务集成路线图。
事件专题

推荐理由:这篇论文提出了PLACEMEM,用版本化胶囊解决终身智能体的记忆管理问题,原型跑在vLLM上,实测了延迟和复用率,适合研究记忆架构的读者。
12:42
12:42官方账号arXiv cs.LG@Heloísa Dias Viotto, Cauê Samonek, Lucas Garcia Pedroso, Marcos Sunye, André Abed Grégio, Paulo Lisboa de Almeida
本论文针对孪生验证网络(Siamese verification networks)中距离阈值的设定问题,提出了一种基于双峰分布假设的无监督方法。该方法通过识别距离分布两个模态之间的最低点来确定阈值,无需标注数据。在MNIST、CIFAR-10、LFW和PKLot四个数据集上的实验显示,平均验证准确率达到94%,与需要标注的等错误率(EER)方法性能相当。该工作使得验证阈值可直接在部署环境中更新,降低了人工标注成本。
推荐理由:这篇论文教你怎么不用标数据就自动设好验证阈值,在四个数据集上测了准确率94%,跟用标数据的方法差不多,挺实用的。
12:12
12:12官方账号arXiv cs.LG@Pedro Henrique da Costa Avelar, Le Ou-Yang, Min Wu, Sophia Tsoka
该论文报道了Pathway Activity Autoencoders(PAA)框架,通过通路约束的架构实现多组学数据集成与可解释性。在乳腺癌数据集上,该方法在生存预测和亚型分类任务中验证了集成多组学数据的正面效果。分析表明,基因、蛋白质和miRNA表达层对最终性能贡献最大。重复性实验显示,dropout可提升模型鲁棒性,但过度正则化会降低预测性能。可视化展示了特征空间的临床相关性。
推荐理由:这篇论文提出了一个能同时处理基因、蛋白质和miRNA数据的可解释深度学习框架,在乳腺癌生存预测上效果不错,适合关注多组学分析和可解释AI的读者。
12:10
12:10官方账号arXiv cs.LG@Guorun Wang, Simone Foti, Andreas D. Demou, Leonidas Kotoulas, Theodoros Christoudias, Alexandros Koliousis, Mihalis Nicolaou, Stefanos Zafeiriou
该论文提出一个站指导框架,将粗分辨率CAMS大气成分场超分辨率(×40,约1km)并偏差校正为局地PM2.5变化。框架利用多尺度Transformer网络,结合人类活动、土地覆盖、高程、卫星气溶胶观测和风场等异构信息,无需时间序列建模。为解决稀疏原位数据密集监督问题,引入时间无关传播策略,通过空间高斯混合插值OpenAQ观测。在欧洲的定性和站点评估显示,模型能恢复细粒度空间结构并有效缓解CAMS局部偏差。
推荐理由:想用CAMS数据做高分辨率PM2.5预测?这篇论文提出了一个不依赖时间序列的降尺度框架,融合多种地理信息,用OpenAQ观测做伪监督,效果不错。
12:09
12:09官方一手arXiv: OpenAI@Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard, Manuela Del Castillo Suero, Lars Melskens, Gerard Ompad, Maurizio Sessa
该研究开发了一种高斯过程兼容的优化目标(EWACS),用于提升LLM在药物警戒因果关系评估中的表现。在723份FAERS病例上,GPT-5.2在Naranjo算法问题5和10上分别达到74.1%和65.4%的专家一致性。贝叶斯优化后,因果分类一致性从45.0%提升至72.0%,其中Doubtful病例提升最大(+42.9个百分点)。结果表明,温度优化虽无普遍最优值,但可针对特定病例带来显著改善。
推荐理由:这篇论文用GPT-5.2做药物副作用评估,温度调优后准确率从45%跳到72%,对药物安全分析很有参考价值。
11:48
11:48官方一手arXiv: DeepSeek@Xiao Shi, Yingying Sun, Jiangsu Du, Zhiguang Chen, Yutong Lu
CAP框架通过协同激活驱动的专家放置减少跨设备通信,并引入通信感知剪枝选择性移除路由目标。在单节点和多节点实验中,相比DeepSeek EPLB和vLLM的序列放置,吞吐量提升1.23倍至1.86倍。该方法在达到相同加速目标时能保持更好的模型准确率。
推荐理由:这篇论文提出CAP,直接在专家放置和剪枝中考虑通信开销,实测比DeepSeek EPLB快1.2-1.8倍,适合跑大MoE模型的人。
11:41
11:41官方账号arXiv cs.AI@Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
RLVR通过可验证奖励提升推理能力,但每次训练强模型需要大量采样,成本高昂。Direct-OPD方案在小模型上执行RL,将其策略偏移作为隐式奖励传递给强模型。对比后RL教师与前RL参考的对数比率,为学生模型提供密集监督。实验显示,Direct-OPD将Qwen3-1.7B在AIME 2024上的准确率从48.3%提升至62.4%,仅需8块A100 GPU训练4小时。该方法优于step-matched直接RL,并支持多策略偏移的级联组合。
推荐理由:用弱模型训练强模型,Qwen3-1.7B在AIME 2024从48.3%飙到62.4%,只花4小时8卡A100。比直接RL还省,值得试试。
11:40
11:40官方账号arXiv cs.AI@Raphaël Bonnet-Guerrini, Bruno Sanchez, Dominique Fouchez, Benjamin Racine, Maya Guy, Mariam Sabalbal, Manal Yassine, Vincenzo Piuri
该论文提出一种基于注入瞬变源与污染巡天数据、无需人类标注的Real-Bogus分类框架。采用非对称协同训练的双网络模型处理不同噪声等级的类别标签。在基准子集上分类性能强劲,在严重类别污染下仍保持稳定。混合不确定性量化策略在MC dropout与深度集成之间取得低成本且校准良好的结果。隐空间分析显示不确定性对齐决策边界并揭示了假阳性群体内的子类。
推荐理由:这篇论文搞了个新训练方法,不用人工标数据就能把天文瞬变源和假信号分开,还自带靠谱的不确定度估计,对大型巡天项目很实用。
11:39
11:39官方账号arXiv cs.AI@Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
LLM-as-a-Verifier通过计算评分token logits的期望生成连续分数,替代传统的离散评分方法。该框架从评分粒度、重复评估和准则分解三个维度缩放验证能力,在Terminal-Bench V2上达86.5%,SWE-Bench Verified上达78.2%,RoboRewardBench上达87.4%,MedAgentBench上达73.3%。其细粒度信号可用于任务进度估计和RL训练,在SAC和GRPO上提升样本效率。论文还提供了Claude Code扩展,帮助开发者监控代理系统。
事件专题

推荐理由:这篇论文提出一种不依赖额外训练的验证框架,用连续分数替代离散评分,在四个agent基准上刷新了成绩,还顺手提升了RL样本效率。
11:38
11:38官方账号arXiv cs.AI@Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei
本文提出SearchGen-20K数据集和SearchGen-Bench基准,包含20,839条提示,覆盖12类失败模式和22个领域。在SearchGen-Bench上,前沿开放视觉生成模型得分仅21-28分(满分100),比现有基准低40分。作者发现朴素搜索无效,会引入噪声,并识别出生成器特有的知识边界,提出"先教后搜"协同训练框架,即使最小版本也带来单调改进。
推荐理由:想了解视觉生成模型为什么画不出新角色或近期事件?这篇论文用具体数据告诉你差距在哪,还给了个可复现的协作搜索方案。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。