09:23官方一手arXiv: DeepSeek@Qunhui ZhangAiFlow是一种Token原生响应式编排模型,将Provider增量归一化为Context<T>事件并通过有向流图传播。每个节点由Node Guardian管理,声明并执行队列上限、并发、排序、溢出策略与重试规则。微基准测试基于DeepSeek轨迹回放(30次)并与LangGraph基线对比,结果显示AiFlow不改变模型TTFT,但将应用TTFPT降低70.9%-94.7%。运行时队列深度也控制在声明边界内,较无界策略减少93.7%-96.5%的MaxQ。实现代码通过FIT Framework仓库公开提供。论文AiFlowLangGraphRAG推荐理由:AiFlow将LLM输出按token流式编排,实测应用延迟比LangGraph降70.9%-94.7%,队列占用也大幅减小。原文稍后读已读值得跟进有用关注 AiFlow
09:21官方账号arXiv cs.AI@Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav RappoportMedUPS 是一个针对罕见病例诊断决策的对齐框架,配套数据集 MedUPSQA 包含 21,874 个临床决策点,来自 5,535 份真实病例报告。该框架将病例文本按时间顺序切分成累积片段,用 GRPO 强化学习训练模型预测下一步行动,并以 LLM-as-a-Judge 作为奖励。在三个基座模型上,中间步骤对齐将下一步预测准确率从 55.2 提升至 66.7(Qwen3.6-27B)、从 47.2 提升至 57.8(Qwen3.5-9B)、从 37.8 提升至 44.4(HuatuoGPT-3-8B)。MedUPSQA 数据集、代码和对齐后的模型权重已发布。论文MedUPSMedUPSQAQwen推荐理由:MedUPS 用强化学习教模型在罕见病例中预测下一步决策,三个开源模型准确率都提升了,数据集和代码已开源。原文稍后读已读值得跟进有用关注 MedUPS
09:20官方账号arXiv cs.AI@Junkai Lin, Junkai Chen, Siqi Hou, Yuhao He, Ruiqi Liu, Chenhan Jin, Shengze Xu, Tieyong Zeng多模态大语言模型会泄露敏感信息,现有隐私基准多采用画像级删除,而实际请求往往更细粒度。本文提出属性级遗忘任务,覆盖长文本、数值、短文本三类目标和多种遗忘比例。作者提出训练无关的CLRP框架,用激活修补定位因果层,再通过保留感知投影移除目标属性子空间。实验在多种不同架构和参数规模的MLLM上验证了CLRP的有效性。论文机器遗忘属性遗忘多模态推荐理由:论文把机器遗忘做到属性级:让模型忘掉指定属性,但保留同一人的其他信息。CLRP不用重训练,在多种多模态模型上都有效。原文稍后读已读值得跟进有用关注 机器遗忘
09:18官方账号arXiv cs.AI@Nathan Young论文提出分层Solomonoff归纳(HSI),将de Finetti定理应用于Solomonoff归纳(SolInd),构造覆盖所有Solomonoff先验的超先验,以支持对给定数据集的外推。作者扩展了Wood等人的证明,表明通用半测度混合的混合仍等价于SolInd,即HSI=SolInd。他们还证明,HSI在任意分布上的超额误差受该分布在超先验中复杂度的限制,类比于SolInd的预测误差受Kolmogorov复杂度限制。随着数据集增长,HSI的平均超额误差收敛到0,实现极限最优预测。论文Solomonoff InductionHSIKolmogorov复杂度推荐理由:这篇把Solomonoff归纳改成能基于数据集预测,证明与原版等价且误差有界,做理论的人可以看。原文稍后读已读值得跟进有用关注 Solomonoff Induction
11:41官方账号arXiv cs.LG@Arkajyoti Bhattacharjee, Arnab Auddy论文提出DP-GRAMS,一种基于均值漂移的差分隐私模态估计方法,用于多变量密度。该方法在Hölder平滑参数β>2时采用高阶核降低偏差,并用梯度裁剪和校准高斯噪声保护隐私。理论证明所有总体模态能以高概率恢复,渐近误差率为O((log n/n)^{2(β-1)/(d+2β)}) + O((polylog(n,δ)/(n^2ε^2))^{(β-1)/(d+β)})。作者还给出私有模态估计的极小极大下界,表明该估计器在均方误差上近乎最优,仅差对数因子。扩展版本DP-PMS和DP-GRAMS-C分别用于回归和聚类,实验显示隐私-效用权衡优于常见基线。论文DP-GRAMS差分隐私模态学习推荐理由:这篇论文的DP-GRAMS能在差分隐私下找到密度模式,误差接近理论最优,还附赠回归和聚类版本。原文稍后读已读值得跟进有用关注 DP-GRAMS
11:40官方账号arXiv cs.LG@Juncheng Zhong, Chenghuang Shen, Jianfeng Liu, Zhengdong Xiao, Longjiu Luo, Qianrong Wang, Wenjun Xu, Wenlian Lu该论文分析耦合神经PDE发现中的优化路径,发现三种行为:正确支撑集可以持续到训练结束、仅短暂出现或始终未出现。作者提出冻结-再选择方法,用结构化场适配器将场分解为空间特征与三次样条时间系数,在不依赖PDE残差的情况下训练。之后用稳定性验证弱选择(SVWS)在独立弱形式系统中识别重复项、重拟合候选支撑并选出最终方程。在MDBench全部六个稀疏场景中,该方法取得了最高的精确支撑恢复率,在Kuramoto-Sivashinsky动力学上比经典和神经基线提升最明显。对固定库之外,方法还能用于遗传编程生成的表达式,从稀疏含噪观测中恢复未知非线性扩散函数的幂律形式。论文MDBenchKuramoto-SivashinskyPDE发现推荐理由:把方程选择跟神经优化拆开:先冻结场重建,再用SVWS筛项。六个MDBench稀疏场景恢复率最高,KS方程提升最大。原文稍后读已读值得跟进有用关注 MDBench
11:32官方账号arXiv cs.LG@Maria Smirnova, Alexey Kravatskiy论文提出 SignMuon,将 Muon 优化器的更新逐参数取符号压缩为 1 bit。在 CIFAR-10 与 nanoGPT speedrun 实验中,SignMuon 优于 SignSGD,但作者构造线性函数实例证明它可能上升。把符号操作放在线性最小化 Oracle 之前或两侧同样无法保证下降。误差反馈用在 Muon 输出上对所有平滑常数、步长和动量都可能失效;用在梯度上则有效,EF21-MuonSign 在光滑非凸问题上达到 O(T^{-1/2}) 平方梯度范数收敛率。实验里最强的压缩方法是符号放在 Oracle 之后,尽管该配置理论上发散。论文MuonSignMuon误差反馈推荐理由:把 Muon 更新压成每参数 1 bit 的符号,实验里 sign-after-LMO 最强,尽管理论上会发散,结论很反直觉。原文稍后读已读值得跟进有用关注 Muon
11:31官方账号arXiv cs.LG@Idan Roth, Lutz LampeGQ-FSL在联邦分割学习(FSL)中引入随机量化,对客户端和服务器的子模型使用非对称精度,从而解耦设备能耗与全局收敛损失。该方法建立了参数化能耗模型,并推导了数据异构下的理论收敛界。通过联合优化DNN分割点和精度级别,GQ-FSL在满足准确率约束的前提下最小化总系统能耗。实验显示,相比量化联邦学习和全精度FSL,GQ-FSL显著提升能效,支持在资源受限设备上部署大型DNN。论文GQ-FSL联邦学习量化推荐理由:这个新框架把联邦学习和分割学习结合起来,用量化省电,还能控制精度,比传统方法更适合手机这类设备跑大模型。原文稍后读已读值得跟进有用关注 GQ-FSL
11:19官方账号arXiv cs.AI@Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon SuoExtractBench是一个面向模式引导文档提取的新基准,评估集涵盖370份企业文档、4869页、8个业务领域和67种文档类型。该基准同时评测值准确性、记录完整性、来源可追溯性和成本,其中值F1对顺序不敏感。测试发现,商业VLM在短文档上表现良好,但在长文档上常截断记录列表;编码智能体准确率更高但成本明显更高。LlamaExtract Agentic Plus在三个指标上均排第一,成本仅为编码智能体的很小一部分。论文ExtractBenchLlamaExtract企业文档提取推荐理由:Llamaindex出的ExtractBench基准测文档提取。商业VLM长文档会截断,LlamaExtract Agentic Plus更准还更便宜。原文稍后读已读值得跟进有用关注 ExtractBench
11:10官方账号arXiv cs.AI@Yimin Chen, Brian Fricke, Bo Shen, Jamie Lian, Mingkan Zhang, James Lo, Yun Zhang, Shi Ye, Jiajing Huang, Han Hu, Chujie Lu, Rui Tang, George ZhuangFDD-ON是一个模块化、可扩展的本体,用于形式化表达变风量(VAV)空调系统组件、故障类型、症状状态及其影响。该本体整合了故障检测与诊断(FDD)语义,并通过定义受控词汇表来统一描述故障与症状属性。依赖造成原因-故障-症状-影响的四元关系,FDD-ON可为异质FDD输出提供机器可解释的映射基础。研究团队利用公开VAV数据集对该本体进行了评估,并展示了其在FDD应用开发中的实际效果。论文FDD-ONHVACVAV推荐理由:这篇论文把空调故障诊断的知识结构做成了能查的本体,以后跨系统做FDD就不用各搞各的了。原文稍后读已读值得跟进有用关注 FDD-ON
10:31官方账号arXiv cs.AI@Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing HuangAgentHPOBench 提出一个包含30个可执行机器学习任务的序列化基准,覆盖7个研究类别,用于评估LLM智能体的超参数优化能力。每个任务从已验证的基线运行开始,智能体需逐步观察配置、指标和日志后提出下一组超参数。研究在统一协议下评测了12种智能体和传统HPO基线。结果显示当前智能体具备初步实验优化能力,但在持续迭代改进、复杂日志诊断和逼近参考性能方面仍有明显局限。论文AgentHPOBench超参数优化智能体推荐理由:想用LLM自动调超参?这个基准测了12个智能体,告诉你它们能做什么、卡在哪。原文稍后读已读值得跟进有用关注 AgentHPOBench
10:29官方账号arXiv cs.AI@Ilya Mikhelson这篇论文提出了Socratic Test的自动化计算机中介对话式评估框架,整合动态评估原则、多模态工作区、Bloom分类学实时监考和SOLO分类学结构评估。传统静态评估依赖减法扣分制,而面对面口试会引入表现焦虑和学术权力失衡等无关变量。Socratic Test通过渐进化支架量化最近发展区(ZPD),并采用非补偿性加法评分架构,优先衡量掌握程度而非惩罚错误。论文Socratic Test动态评估多模态推荐理由:这篇论文给考试设计开了个新脑洞:用多模态对话和动态评估测认知边界,比传统考试更看重进步而不是扣分。原文稍后读已读值得跟进有用关注 Socratic Test
10:25官方账号arXiv cs.AI@Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin PeloquinFriendBench 是一个新基准,要求从20秒破冰对话片段判断两人是否熟识。研究对比了7家公司的26个模型与人类受试者在96组对话上的表现。最佳模型与人类在准确率上无显著差异,但模型更倾向于回答“陌生人”。音频和视频信息对模型和人类的好处不同,只有人类能从可见行为中获益。论文公开了全部刺激材料、人类评分和模型预测。论文FriendBench多模态LLM推荐理由:试试看这个新基准,FriendBench测AI能不能从20秒对话看出两人是不是熟人。最强模型和人类打了个平手,但AI有偏见:拿不准就说是陌生人。原文稍后读已读值得跟进有用关注 FriendBench
10:14官方账号arXiv cs.AI@Manith Adikari, Bei Peng, Samuele Vinanzi, Angelo CangelosiLEMUR是一个新框架,让智能体从多个人的偏好反馈中学习多目标策略,无需预先定义奖励函数。它同时学习策略和多个目标专属的奖励模型,在训练中平衡竞争目标。在多种多目标任务基准上,LEMUR的表现优于现有基线方法。这项研究为无预设奖励的多目标决策任务提供了新方向。论文LEMUR多目标强化学习偏好反馈推荐理由:这是篇新论文,LEMUR能直接从多人偏好学多目标策略,不用设奖励函数,基准上比现有方法强。原文稍后读已读值得跟进有用关注 LEMUR
10:12官方账号arXiv cs.AI@Hussain Hussain, Stefan Schöberl, Angelika Schneider, Verena GeistCOntExt 是一个面向上下文感知的本体扩展框架,输入结构化指标定义,输出应整合进现有本体的概念与属性建议。该框架将扩展任务拆分为父类预测、关系类型预测和数据属性分配三个子任务。研究者在四个网络安全本体上评估了多种算法,结果显示指标上下文在关系类型预测和数据属性分配上优于仅依赖本体上下文的基线。论文表明运行指标目录是实用且未被充分利用的本体扩展来源,可显著降低本体维护成本。论文COntExt本体扩展网络安全推荐理由:这篇论文提出了 COntExt,用运行指标自动帮你扩展本体,不用再手动梳理概念关系,四个安全本体上验证过效果。原文稍后读已读值得跟进有用关注 COntExt
10:09官方账号arXiv cs.AI@Gaetano Perrone, Simon Pietro RomanoARB基准由1,800篇人类源文本构建,覆盖XSum、WritingPrompts和OpenWebText三个数据集,并使用Llama-3.2-3B、Qwen2.5-7B、Mistral-7B和Gemma-2-9B四个开源模型生成重写变体。在1%假阳性率下,FastDetectGPT和Binoculars-falcon-7b对直接生成文本的召回率分别为91.2%和93.5%,但对人类文本经LLM改写后的召回率骤降至30.8%和15.1%。RADAR同样从66.8%跌至12.2%,而BERT-Defense和RoBERTa-Defense在所有场景下召回率均低于3%。结果表明,传统基准上的检测性能无法迁移到LLM改写的人类文本场景。论文ARBFastDetectGPTBinoculars推荐理由:这篇论文告诉你,现在AI检测器遇到‘人类写、AI改’就失灵,直接生成能抓到九成,改写后只剩三成,做防御的得看看。原文稍后读已读值得跟进有用关注 ARB
10:07官方账号arXiv cs.LG@Antonia Holzapfel, Andres Felipe Posada Moreno, Sebastian TrimpeCENDRe是一种面向CNN时间序列分类器的概念提取方法,自动发现驱动预测的时域和频域模式。它通过两阶段聚类和轮廓系数指导的聚合自动确定概念数量,无需预设。方法利用存在分数的梯度生成时域掩码,并经可逆傅里叶变换映射到频域,实现同一概念的频域定位。在合成基准上,CENDRe的表示正确性与现有方法相当,重要性正确性显著更高。在真实轴承故障数据上,它提取出驱动模型预测的频带,为故障诊断提供时域方法无法给出的证据。论文CENDRe概念提取时间序列推荐理由:这篇论文提出了CENDRe,给时间序列CNN做概念提取,能自动找概念数量,还能同时定位时域和频域,比只看时域的方法更靠谱。原文稍后读已读值得跟进有用关注 CENDRe
10:06官方账号arXiv cs.LG@Luca Viano, Antoine Moulin, Audrey Huang, Volkan Cevher, Philip Amortila, Dylan J. Foster该论文研究专家交互在模仿学习中的作用,发现交互可放宽对学习者模型的表征要求,只需实现专家价值函数而非完整策略。作者提出OVI算法,在能表示专家价值函数时统计高效,并借助线性最大化预言机实现计算高效。负向结果表明,在仅具备价值可实现性假设下,离线模仿学习算法必须依赖策略类复杂度。实验显示OVI优于BC、DAgger及离线价值法,在模型表达能力弱于专家时增益最大。论文模仿学习OVI交互式学习推荐理由:这篇论文把模仿学习里交互到底帮不帮忙讲清楚了,还给了能跑的OVI算法,做RL或蒸馏的值得看一眼。原文稍后读已读值得跟进有用关注 模仿学习
09:48官方账号arXiv cs.LG@Christian Oliva, Luis F. Lago-FernándezarXiv 论文提出EPC评分,这是对Explainability-Performance Coefficient的扩展,用模型无关方式量化解释质量,显式平衡特征选择稀疏性与模型性能保持。研究在表格、文本、图像三种模态上做了实证验证,发现EPC能揭示网络激活、数据维度和解释器性能之间的操作依赖。作者将EPC与独立人类解释对比,证明更高EPC评分与人类词汇情感判断及空间视觉注释有强一致性。论文EPC可解释性XAI推荐理由:这篇论文给可解释性打分提出了一个新指标EPC,不挑模型,而且拿人类判断验证过,做XAI研究的可以看。原文稍后读已读值得跟进有用关注 EPC
09:46官方账号arXiv cs.LG@Hakan Ferhatosmanoglu, Kushal Kumar, Tal Wagner, Andy WarfieldQASP 通过一次监督回归预测每条查询的完整召回曲线,省去搜索中的迭代模型调用。它使用缩放不变特征和搜索前推理,可跨召回目标、索引配置和数据集泛化。实验显示,QASP 达到 99% 召回率时数据访问减少 80%,并显著降低召回方差和偏差。论文还证明其训练样本量不随数据规模增长,数据访问节省随内在维度指数增长。论文QASP向量检索搜索策略推荐理由:向量搜索老是调参?QASP 一次预测整条召回曲线,不用反复试,还省 80% 数据访问。做检索的朋友可以看看。原文稍后读已读值得跟进有用关注 QASP
09:46官方账号arXiv cs.LG@Jiajia Tang, Sizhe Yuen, Francisco Gomez Medina, Yali Du, Adam Sobey参数高效微调(PEFT)通常使用单一共享LoRA适配器,在异构任务序列上会产生干扰和灾难性遗忘。现有方法通过增加参数容量或组合多个适配器来提升表现,但仍依赖共享优化路径。本文提出自动多策略PEFT框架,通过任务分组和排序组织优化路径,采用独立QLoRA实现异构任务解耦优化。在TRACE基准上,该框架在相同可训练容量下达到44.78的最佳性能,验证了优化路径组织比单纯增加适配器容量更有效。论文LoRAQLoRATRACE推荐理由:这篇论文提出用自动任务排序加独立QLoRA来微调LLM,在TRACE基准上拿到44.78,比堆参数容量更管用。原文稍后读已读值得跟进有用关注 LoRA
09:44官方账号arXiv cs.LG@Yanwei Jia, Du Ouyang该论文在Wang等(2020)和Jia与Zhou(2022b)的连续时间强化学习框架下,研究扩散环境中多臂老虎机问题的策略梯度更新。使用logit参数化随机策略时,作者证明在任意常数学习率下算法几乎必然收敛到最优臂。此外,当常数学习率低于一个时不变阈值时,得到了非渐近遗憾上界O(log T)。作者通过构造新的Lyapunov函数改进了Lattimore(2026a)对同一SDE的分析,并展示了用SDE工具分析策略梯度的透明性。论文policy gradientmulti-armed banditsSDE推荐理由:这篇论文用Lyapunov函数严格证明了策略梯度在扩散环境老虎机里的收敛性,遗憾界做到O(log T),搞理论的人可以看看。原文稍后读已读值得跟进有用关注 policy gradient
09:44官方账号arXiv cs.LG@Mostafa ElAraby, Samer B. Nashed, Liam Paull这篇论文研究持续学习系统中的分布外(OOD)检测退化问题。作者发现OOD遗忘与先前任务分类性能仅呈弱负相关,且能量型和特征型检测器分别因置信度缺口和流形拥挤而退化。他们提出无需训练的后续校准方法TOOD,将logits分解为逐任务能量分数并用重放缓冲统计重新校准。在CIFAR-10、CIFAR-100和100任务ImageNet-1K流上,TOOD在九个十项CIFAR配置中排名第一或第二。论文TOOD持续学习OOD检测推荐理由:持续学习里OOD检测老退化,这篇论文讲清了原因,还给了免训练的TOOD校准方法,CIFAR上九成配置都能排前二。原文稍后读已读值得跟进有用关注 TOOD
09:39官方账号arXiv cs.LG@Ismayil Ismayilov, Atakan Kara, Kaan OktayDungeonBench是一个面向D&D战斗的战术推理基准,覆盖2014版SRD中大部分战斗相关内容,保留行动经济、生物特性、战场几何等机制。基准分Encounter和Day两个轨道:Encounter评估单场战斗的局部战术,Day通过持久生命值、法术位、消耗品和短休息将战斗串联,考验资源调度。同一决策流支持启发式控制器、语言模型策略、学习型排序器和强化学习智能体。评测显示前沿语言模型策略在直接对战中常获胜,但在链接战斗日上暴露资源预算、休息时机和规则纪律的不足。论文DungeonBenchD&D战术推理推荐理由:DungeonBench用D&D战斗测AI战术推理,分单场和连战两关,发现大模型会打单场却管不好资源,想测AI决策的可以看看。原文稍后读已读值得跟进有用关注 DungeonBench
09:37官方账号arXiv cs.LG@Boxiao Wang, Runxiang Wang, Kai Li, Chongming Li, Zhiwei Chen, Yifan Zhang, Jian ChengMOT-SR是一种面向符号回归的多目标工具增强框架,利用外部分析工具提取结构先验,并通过动态Pareto前沿同时优化精度、复杂度和泛化性。在40个标准任务上,MOT-SR在准确率、泛化性和效率上优于现有符号回归方法。在极端质量比旋进轨道建模中,该方法发现的可解释修正项在留出配置上取得了最低的轨迹级积分误差。论文MOT-SR符号回归多目标优化推荐理由:MOT-SR把工具和大模型结合起来找方程,40个任务上又快又准,还能处理引力波轨道建模,挺实用。原文稍后读已读值得跟进有用关注 MOT-SR
09:36官方账号arXiv cs.LG@Jinze Zhao2015年Lacoste-Julien和Jaggi猜想,多胞体添加一个顶点且所有旧顶点仍是顶点时,其棱锥宽度不会增大。本文在三维空间中用六个整数点构造了精确反例:P由五个顶点构成,Q加入第六个顶点后五个旧顶点仍为顶点。但P和Q的棱锥宽度平方分别为48/353和36/133,比值约为1.410886779。证明利用棱锥宽度与面距离的等价性,并用整数支撑超平面验证面格。论文附带了无依赖的精确验证器。论文棱锥宽度多胞体凸几何推荐理由:数学家们把一个2015年的猜想推翻了,用六个整数点就让棱锥宽度变大,差41%呢。原文稍后读已读值得跟进有用关注 棱锥宽度
09:34官方账号arXiv cs.LG@Ranveer Singh, Pranuthi Tenali, Saurabh Mathur, Ameet Soni, Vaishali Phatak, Karla Lynch, Daniel Murman, Matthew Rizzo, Sriraam Natarajan该研究提出一种自动化流程,直接从语言流畅性测试的音频中提取阿尔茨海默病进展指标。方法使用预训练基础模型处理原始音频,构建贝叶斯网络进行推理,并解释各语言标记间的定性关系。系统成功恢复了已知的临床知识,还发现了新的语言学标记关联。相关论文已发布在arXiv上。论文Alzheimer's DiseaseBayesian Network神经符号推荐理由:不用手动转录音频,自动从语音里挖出阿尔茨海默病早期信号,还能解释推理过程,比黑盒模型更让人放心。原文稍后读已读值得跟进有用关注 Alzheimer's Disease
09:33官方账号arXiv cs.LG@Carlos Rodriguez-Pardo, Massimo TavoniTerraNova 是一个面向人类世的地球与社会耦合基础模型,在 arXiv 2607.29527 发布。它用 1,024 条记录训练,其中 512 个格点化地球系统场和 512 个国家指标。跨模态 Transformer 融合位置、国家、时间和任务,两个对比目标分别对齐国家与境内坐标、预训练地理空间嵌入。TerraNova 在消费级硬件上数分钟内即可重构稀疏观测的密集场并适配未见变量。与专用地理空间编码器相比,TerraNova 还覆盖时间、海洋和不确定性维度。论文TerraNova地球系统模型多模态推荐理由:TerraNova把地球和社会数据一起训练,能几分钟适配新变量,比地理模型多覆盖海洋和不确定性。原文稍后读已读值得跟进有用关注 TerraNova
09:31官方账号arXiv cs.LG@Panupol Untarabut, Narjes Jomaa, Sylvian Cadars, Olivier Masson, Samuel Bernard, Assil Bouzid, Santanu Saha研究用CGCNN、GATGNN、ALIGNN和M3GNet四种图神经网络,将有序钙钛矿的知识迁移到无序高熵钙钛矿氧化物(HEPOs)上。形成能预测能有效迁移,但HOMO-LUMO带隙预测因对局部化学环境敏感而迁移性有限。加入少量HEPO专属训练数据后,带隙预测精度显著提升。UMAP分析表明ALIGNN编码的三体几何信息对捕捉结构-性质关系至关重要。论文ALIGNNCGCNN图神经网络推荐理由:高熵钙钛矿不好算,这论文拿四种图神经网络试了迁移学习,发现形成能能搬,带隙不行,加点目标数据才准。ALIGNN表现最好。原文稍后读已读值得跟进有用关注 ALIGNN
09:31官方账号arXiv cs.LG@Priya Tomar, Aditya Parikh, Christian Bauckhage, Rafet Sifa该研究将类特定解码器架构扩展到跨手术域知识迁移,使用直肠和胆囊切除术两个数据集验证。实验表明,器官特定解码器模型CEMD在跨域预训练后全微调,分割性能达到62.4%Dice,且收敛速度明显快于从零训练。但类别不平衡问题依然存在,迁移学习对少数解剖结构的改善有限。论文CEMD迁移学习腹腔镜分割推荐理由:这篇论文把迁移学习用在腹腔镜多器官分割上,CEMD模型微调后Dice到62.4%,还比从零训练快不少,做医学影像分割的值得看看。原文稍后读已读值得跟进有用关注 CEMD
09:29官方账号arXiv cs.LG@Xiaotian Zhang, Lai Shun Chan, Yue Shang, Entao Yang, Ge Zhang一篇来自arXiv的论文研究了高熵解对模型鲁棒性的影响。作者以模算术中的grokking为受控场景,对比AdamW训练的Transformer与基于Wang-Landau分子动力学采样的高熵模型。噪声注入实验显示,AdamW模型在强制记忆随机标签后,原任务测试准确率从100%跌至75%以下,而高熵模型仍保持约95%。通过奇异值分解发现,高熵网络在注意力层和MLP层具有更高的有效秩,可缓冲灾难性遗忘。论文GrokkingAdamWWang-Landau推荐理由:这篇论文用模算术实验揭穿了一个幻觉:模型泛化好不代表扛得住后续干扰。高熵模型比AdamW更抗遗忘,想了解训练鲁棒性的可以看看。原文稍后读已读值得跟进有用关注 Grokking
09:28官方账号arXiv cs.LG@Sergey Salishev论文研究固定有限精度因果Transformer的转录管理机制,每个通道按块划分,PopContext操作可删除最新块并暴露前驱。无Pop的受限模型RTMTn{k}对任意固定k只能实现确定性有限状态转换。引入Pop后,单通道的k=1等价于DCFL,k≥2时表达能力升至RE。论文证明一个或两个智能体中的两个Pop转录本即可达到通用性。论文TMTRTMTTransformer推荐理由:这篇论文把Transformer的上下文管理建模成带Pop的栈,证明两个可弹出的通道就够模拟一切可计算函数,比只看参数规模有意思多了。原文稍后读已读值得跟进有用关注 TMT
09:28官方账号arXiv cs.LG@Qian Tan, Huaifei Liang, Xuanyu Zhu, Lei Jiang, Yuqiang Li在线蒸馏(OPD)沿学生生成轨迹提供密集教师监督,但长响应会拖慢批量完成。现有加速方法用固定预算或绝对师生一致阈值控制回滚长度,难以反映学习进度。Adaptive FastOPD 仅在当前边界区域学习趋于平稳且视野利用充分时扩展回滚视野,由四个师生信号相对值判断进度。在两个师生对上,Adaptive FastOPD 比 OPD 15K 减少训练时间 49.1%–71.2%,同时取得最高平均性能,且对超参数设置鲁棒。论文Adaptive FastOPDOPD在线蒸馏推荐理由:发了个叫Adaptive FastOPD的蒸馏加速方法,比OPD 15K快一半多,性能还更高。做训练加速的可以看看。原文稍后读已读值得跟进有用关注 Adaptive FastOPD
09:25官方账号arXiv cs.LG@Xining Xun在辛普森悖论设定下,增加预训练中干预样本比例并不能让模型正确判断因果方向,do()响应幅度增大但符号仍复制观察上下文。完全观察上下文在50个世界中29个出现符号反转,混合上下文19个,而仅对齐干预探针则41个正确。擦除上下文中的观察证据立即释放模型被压制的因果插值能力(ratio_true=+0.56)。在0.93B参数模型上,匹配探针仅干预分支的符号反转率为6%,而观察+干预分支为31.8%。作者提出证据平均协议,将符号错误从26%降至9%。论文CLadder辛普森悖论因果推理推荐理由:这篇论文用辛普森悖论测试干预数据,发现模型因果方向取决于上下文证据类型而非训练比例,还给了降错方案。原文稍后读已读值得跟进有用关注 CLadder
09:24官方账号arXiv cs.LG@Qian Tan, Xuanyu Zhu, Lei Jiang, Zhonghang Yuan, Chen Zhang, Yuqiang LiMolGVR 提出生成器-验证器-精炼器三段式框架,用于解决文本到分子生成中的化学约束违反问题。生成器先推断结构证据并产出候选分子,验证器将描述转化为化学约束逐一检查,精炼器则对未通过验证的候选进行修正。在 ChEBI-20 和 PCDes 基准上,MolGVR 提升了精确匹配性能。研究显示,将生成与可执行验证及反馈修正结合,能有效改善文本到分子生成任务。论文MolGVR文本到分子ChEBI-20推荐理由:这篇论文把分子生成从一把梭变成边生成边检查,验证不过就改,效果在 ChEBI-20 和 PCDes 上有提升,做化学AI的值得看看。原文稍后读已读值得跟进有用关注 MolGVR
09:23官方账号arXiv cs.AI@Chandra Maddila, Mashrur Rashik, Euna Mehnaz Khan, Smriti Jha, James Saindon, Nachi Nagappan, Peter C. RigbyARCTIC 是一个面向 AI 生成代码的代码批判系统,核心能力包括意图预测、漂移检测和代码聚焦。系统基于 1.8 万条真实代码评审归纳出六主题分类法。离线评测中,意图预测 F1 达 0.86,漂移检测与人工标注的 QWK 为 0.907,代码聚焦在质量估计上比基线 AI 评审员好 2.4 倍且 token 消耗减少 5 倍。试点中漂移评分让代码错位额外降低 5.76 个点(p=0.026),意图预测获 90.2% 认可。论文ARCTIC代码审查漂移检测推荐理由:这篇论文提出了 ARCTIC,专门解决 AI 写代码太多、人工审不过来的问题。它用意图预测和漂移检测揪出真正需要人看的改动,比传统工具更准更省 token。原文稍后读已读值得跟进有用关注 ARCTIC
09:22官方账号arXiv cs.AI@Jiayang Niu, Yan Wang, Jie Li, Ke Deng, Azadeh Alavi, Muhammad Usman, Yongli RenDreamQAS提出一个基于模型的强化学习框架,保留电路构建的确定性动态,只学习昂贵的VQE后反馈。在15000集预算和冻结评估下,它在五个分子任务中的四个取得最低平均冻结策略能量误差,另一个排第二。在两种方法所有种子都能达到的精细误差目标上,它用1.6倍到2.0倍更少的真实VQE调用完成四个任务,在BeH2-8q上少用10.6倍。反事实动作排序效用五个任务平均提高0.346,95%置信区间为[0.185, 0.507]。论文DreamQASVQE量子架构搜索推荐理由:DreamQAS用强化学习省真实VQE调用,BeH2少10.6倍,五任务里四个误差最低,做量子计算可看看。原文稍后读已读值得跟进有用关注 DreamQAS
09:21官方一手arXiv: DeepSeek@Rui Zou, Yutao Zhu, Mengqi Wei, Ji-Rong WenAMTFV提出将数学验证建模与具体执行解耦,通过数学工具流接口支持精确计算。该方法先让验证智能体构建工作流,再用工具代理执行精确计算,最后辅助答案判定与修正。在DeepSeek、GPT和Gemini的七种模型配置上评估五个数学推理数据集,AMTFV总体优于基线。相比最强基线,单个模型配置下平均准确率最高提升8.3个百分点,中等和高等验证复杂度样本上提升更大。论文AMTFV数学推理自我修正推荐理由:这篇论文搞了个AMTFV,把数学验证拆成流程和计算两步,比直接写验证程序更稳,在多个模型上最高涨了8.3个点。原文稍后读已读值得跟进有用关注 AMTFV
09:19官方一手arXiv: DeepSeek@Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi精选TwT(Translation with Thought)是一个难度自适应的多领域机器翻译框架,通过强化学习在直觉与深思推理间动态切换。该模型先利用DeepSeek-R1蒸馏并由GPT-4o重写的长思维链进行监督微调,再通过混合奖励优化翻译质量与推理效率。在15个基准、3种已见语言和59种未见语言上,TwT-7B和TwT-14B的翻译质量超过更大的SOTA推理模型,同时token用量减少32%至60%。论文TwTDeepSeek-R1GPT-4o推荐理由:这个TwT框架让翻译模型根据难度动态调整思考量,7B和14B的小模型打过大模型,token还省了30%到60%,做多领域翻译的可以看看。原文稍后读已读值得跟进有用关注 TwT
09:18官方一手arXiv: DeepSeek@Jia Peng Lim, Hai Leong ChieuDeepSeek的Engram条件记忆模块在存储与推理之间做权衡,但依赖token级N-gram哈希,导致不同tokenizer需从头训练。论文提出用多项式哈希替换XOR哈希,建立跨N的联合嵌入空间。实验显示该改动在保持性能的同时实现tokenizer无关性,字节等价序列哈希相等。论文DeepseekEngramTokenizer推荐理由:DeepSeek改了Engram的哈希方式,不同tokenizer之间不用再各自训练,效果还一样,做多语言模型的可以看看。原文稍后读已读值得跟进有用关注 Deepseek