17:49官方账号arXiv cs.LG@Di Yang Shi, W. Bradley Knox该论文提出一套形式化流程,让非专家也能构建符合人类偏好排序的奖励函数。流程分三步:先从自然语言任务中提炼基本目标并导出可测量的结果变量,再通过最小成本部分覆盖在因果DAG上选择奖励项,最后用偏好查询拟合权重。权重拟合被转化为凸可行性问题,借助分离预言机迭代收窄可行区域,只需 O(n log κ) 次偏好查询。这是首个保持确定性无冲突可行权重区域的奖励设计方法。论文奖励函数偏好对齐RLHF推荐理由:这篇论文把奖励函数设计拆成三步,还有个只要 O(n log κ) 次偏好查询的算法,做 RLHF 或奖励建模的值得一读。原文稍后读已读值得跟进有用关注 奖励函数
17:49官方账号arXiv cs.LG@Yidi Kao, Shawn Burnham, Tommi Rose Fahy, Ali GhanbariADEPT 是一个集成了多种深度学习测试充分性度量的统一框架,覆盖神经元覆盖率、惊喜充分性、输入分布覆盖、边界覆盖以及源级和模型级变异分数。框架提供基于模板的度量接口和扩展点,支持 YAML 配置管理、预处理缓存复用和结构化结果报告。该框架旨在让研究者和开发者无需花费数天或数周配置分散的研究原型,即可复现和应用充分性度量。论文发表于 arXiv,编号 2608.12144v1,并附有演示视频。论文ADEPT深度学习测试测试充分性推荐理由:做深度学习测试的人可以省事了,ADEPT 把各种覆盖率度量统一成一个框架,不用再挨个配置那些难搞的原型工具,直接就能跑。原文稍后读已读值得跟进有用关注 ADEPT
17:48官方账号arXiv cs.AI@Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping ZhangSCOUT 提出结构化思维链框架,显式建模 3D 环境感知以增强空间理解。其强化学习算法引入多目标过程奖励和定制的优势估计方法,实现推理轨迹的细粒度信用分配。研究者构建了 SCOUT-24k 结构化空间推理数据集。SCOUT-3B 在通用空间基准上提升 16.85%,在复杂空间推理任务上提升 6.3%。SCOUT-7B 超出 GPT-4o 4.28%,且能泛化到多图像和视频场景。论文SCOUT空间推理VLM推荐理由:空间推理一直是视觉语言模型的硬伤,SCOUT 用新的训练方法把 3D 理解做得更准,7B 规模直接超过 GPT-4o,还能迁移到视频上。原文稍后读已读值得跟进有用关注 SCOUT
17:48官方账号arXiv cs.LG@Sara Vardanega, Patrick Segers, Philip Aston, Ernst Rietzschel, Jordi Alastruey, Manasi Nandi研究人员用 SPAR 方法将光电容积脉搏波(PPG)和动脉张力测量得到的脉搏波时间序列转换为图像,再用卷积神经网络分类健康受试者的年龄。模型在内部和外部测试集上表现一致,对 PPG 和张力测量信号的 F1 分数均超过 70%。该模型能区分 35-40 岁和 50-55 岁两个相近年龄组,说明 SPAR 图像保留了健康成年人中随年龄变化的形态特征。论文SPARPPG动脉脉搏波推荐理由:用 SPAR 把脉搏波变成图像,再让 CNN 分年龄,35-40 和 50-55 岁分得挺准,F1 超 70%。原文稍后读已读值得跟进有用关注 SPAR
17:47官方账号arXiv cs.LG@Junyi Ye, Ivy Gateri Wanjiku该论文系统研究了后训练量化(PTQ)中激活值校准对S&P 500横截面波动率预测的影响,涵盖7种神经网络架构、8个walk-forward测试年(2018-2025)和560个训练模型。结果显示,8比特下校准影响很小,但4比特时校准成为预测性能的主要决定因素。在默认abs-max校准下,静态4比特量化权重和激活值会使受影响架构的全精度平均信息系数损失11-62%。改用百分位校准可恢复四种受影响最严重架构中53-94%的退化。论文指出激活值校准是金融预测中可靠4比特PTQ的一级部署决策,剩余退化严重时可选用8比特激活值或仅权重4比特量化。论文PTQ量化金融预测推荐理由:论文用560个模型实测了4比特量化在S&P 500波动率预测上的效果,发现校准方式能决定性能好坏,做量化部署的可以看看。原文稍后读已读值得跟进有用关注 PTQ
17:47官方一手arXiv: DeepSeek@Xucheng Yu, Emily Knox, Haohan Wang一项基于40,800组问答的系统实验发现,主流大模型对受限书籍的拒绝率仅为0.07%。实验覆盖400本书、17种提示设计和六大前沿模型,包括Claude Sonnet 4.5、GPT-4o和DeepSeek-V3。模型差异体现在警告语言上,警告率提升8-15个百分点,犹豫标记提升2-5个百分点。提及性内容的频率是最强信号,差距达33-52个百分点。提示框架可让警告率差距变化最多19个百分点。论文Claude Sonnet 4.5GPT-4oDeepSeek-V3推荐理由:这篇论文用四万组问答测了六大模型,发现它们很少拒绝聊敏感书,但会用警告和犹豫来暗示,想了解内容审核现状可以看看。原文稍后读已读值得跟进有用关注 Claude Sonnet 4.5
17:46官方一手arXiv: OpenAI@Del Coburn, Scott Sanner, Dan SilverOpenAI 2026年报告显示,全球超过5%的ChatGPT消息与医疗健康相关。研究者提出Social Chain of Thought(SCoT),一个面向医学鉴别诊断的多轮协作推理管道。在与单智能体基线、单智能体管道消融和best-of-n扩展的对比中,SCoT的召回优势无法靠单体推理复现。在最难诊断的病例上,多轮专科对话能恢复真实诊断并收敛到更高召回率的鉴别结果。论文SCoT医疗诊断多智能体10 个信源在谈事件专题推荐理由:SCoT把多轮专家会诊搬进模型协作,在难诊断病例上比单模型召回更高,做医疗AI的可以看看。原文稍后读已读值得跟进有用关注 SCoT
17:45官方账号arXiv cs.LG@Jean-Pierre Busch, Guido Linden, Jan Bergmann, Lutz Eckstein该论文提出一种混合规划架构,将深度神经网络与基于优化的监督层结合。神经网络负责解释复杂交通场景并提出驾驶行为,监督层则验证提议并施加可驾驶性和安全约束。作者在真实城市数据的开环研究中评估了学习规划器的行为,并讨论了闭环稳定运行的系统集成问题。研究团队还在其研究车辆karl.上完成了实际部署。论文自动驾驶行为规划深度学习推荐理由:自动驾驶圈可以看看这篇:他们没让神经网络直接开车,而是给它加了安全监督层,还在自家车karl.上真跑了。原文稍后读已读值得跟进有用关注 自动驾驶
17:45官方账号arXiv cs.LG@Pedro Sousa, Will Tebbutt, Sadiq Jaffer, Robin Young, Anil Madhavapeddy, Richard E. Turner该研究将TESSERA地球观测基础模型的嵌入引入概率天气降尺度,压缩10米分辨率的嵌入补丁作为局部表面描述符。在25公里ERA5再分析场基础上,该方法使2米温度CRPS技能提升11.5%,10米风速提升6.2%。改善在五个气候区域的时空外站点上均成立,且换用Aurora预报模型作为输入时依然有效。这是首次证明长期尺度地球观测嵌入能支持短期天气降尺度任务。论文TESSERAERA5Aurora推荐理由:这篇论文把卫星嵌入加到天气降尺度里,温度风速预测都更准了,CRPS提升两位数,做天气AI的值得看看。原文稍后读已读值得跟进有用关注 TESSERA
17:44官方账号arXiv cs.LG@Vaneet Aggarwal论文给出SGS-Poisson算法的对抗鲁棒性定理:在不修改泊松强度、单元素交换规则和spiteful drop步骤的情况下,该算法对非单调目标保持极限近似比1/e,对单调目标保持1-1/e。对于任意满足|f̂(S)-f(S)|≤ξ的受控预言机,算法返回集合期望值至少为(1/e-ε)OPT-O(kξ)或(1-1/e-ε)OPT-O(kξ),调用次数为O~(n k² ε⁻²)。离线到在线转化得到一般拟阵约束子模奖励的全臂老虎机CMAB算法,极限近似-遗憾因子为1/e和1-1/e,遗憾为O~(n^{1/5}k^{4/5}T^{4/5})。论文SGS-Poisson子模最大化拟阵推荐理由:SGS-Poisson在带误差的预言机下仍保1/e和1-1/e近似比,还直接给出全臂老虎机遗憾界,做组合优化和在线学习值得看。原文稍后读已读值得跟进有用关注 SGS-Poisson
17:43官方账号arXiv cs.AI@Jin Lu, Xuening Han, Yang Zhong, Lin Tan, Kevin Luo, Andrew Gacek, Neha RungtaVICBench 面向代码漏洞检测,包含 100 个经人工专家与智能体工作流双重验证的漏洞引入提交,对应 100 个 CVE,覆盖 88 个项目的 Python、Java、C++ 代码。该基准涵盖 48 种 CWE 类型,修复补丁平均 38.6 行,漏洞引入提交平均 252.5 行,复杂度高于此前数据集。评测中,现有最先进的 V-SZZ 和 LLM4SZZ 算法 F1 值仅为 33.3%-40.1%,表明自动化检测仍需大量人工介入。VICBench 能更可靠地评估漏洞检测方法的真实表现。论文VICBenchCVE漏洞检测推荐理由:VICBench 搞了个 100 个真实漏洞提交的基准,覆盖 Python/Java/C++,平均改动比旧数据集大不少,测漏洞检测用它更靠谱。原文稍后读已读值得跟进有用关注 VICBench
17:43官方账号arXiv cs.AI@Saman Marandi, Yu-Shu Hu, Mohammad Modarres该研究提出利用检索增强生成和大语言模型,从系统描述中自动构建动态主逻辑模型,并表示为知识图谱(KG-DML)。方法沿DML层级进行定向检索,保留功能依赖和显式逻辑关系,支持故障向上传播和向下依赖追踪。验证应用于一座退役沸水反应堆的低压冷却剂注入系统,重复运行结果一致。多级评估覆盖各层精度、召回率、逻辑门一致性与结构完整性,证明自动化构建可将技术文档转为可用于诊断和可靠性分析的可执行功能模型。论文DML知识图谱RAG推荐理由:这篇论文讲怎么用RAG和LLM把技术文档自动变成知识图谱,用在反应堆诊断上,跑得还稳,搞可靠性的可以看看。原文稍后读已读值得跟进有用关注 DML
17:43IT之家(博客/媒体)约克大学与卡尔加里大学分析了Reddit上2023年2月至2026年3月间的3801个LLM热门帖子,筛选出446个AI编程安全相关帖子及6000多条评论。研究显示2025年7月是问题帖子数量最多的月份。按工具划分,Cursor报告的问题最多,其次是Claude、Codex、Copilot等。Cursor多涉及运行安全和未授权数据访问,而Claude的问题主要与第三方工具集成风险相关。论文CursorClaudeAI编程7 个信源在谈事件专题推荐理由:约克大学和卡尔加里大学扒了6000条Reddit评论,发现AI编程工具里Cursor出事最多,Claude的第三方集成风险也高,用AI写代码的可以看看。原文稍后读已读值得跟进有用关注 Cursor
17:43官方账号arXiv cs.AI@Kazi Nabiul Alam, Pooneh Bagheri Zadeh, Akbar Sheikh-AkbariSGNet 用分组卷积和深度空间路径分离光谱与空间特征,引入通道挤压激发与空间门控双注意力。在自建 16 天冷藏三文鱼片数据集上,准确率 97.8%,MAE 0.64 天,参数仅 4.75M。相比 ResNet-50 和 Vision Transformer,参数降低 5 至 18 倍。消融实验证明了各组件贡献,面向工业实时预测的域感知设计有效。论文SGNet高光谱成像鱼类新鲜度推荐理由:SGNet 只 4.75M 参数,就达到 97.8% 准确率,比 ResNet-50、ViT 小 5-18 倍,适合工业鱼类新鲜度检测。原文稍后读已读值得跟进有用关注 SGNet
17:43官方账号arXiv cs.AI@Avijit Roy, Proma Roy论文以孟加拉语为例,分析AI教育工具在低连接环境中的结构性障碍。孟加拉语占全球人口近4%,但全球网页内容占比不足0.5%。主要多语语料库中,英语与孟加拉语的训练token比例达67:1。孟加拉语的元音附标文字还带来额外的token化惩罚,加剧数据短缺。农村地区个人互联网普及率为36.5%,城市为71.4%,形成连接排斥。论文孟加拉语低资源语言tokenization推荐理由:这篇论文讲孟加拉语在AI基建里的吃亏,67:1的token差距和36.5%的农村联网率是硬数据。原文稍后读已读值得跟进有用关注 孟加拉语
17:41elvis@omarsar0精选一项研究追踪了1,867个仓库中247,694条指令的生命周期,发现CLAUDE.md等指令文件会无限增长。追加一条指令无需成本,而删除一条需付出指数级验证成本,因此无人删除。文件中的提示词在生命周期内增长超过三倍,每次提交净增4.9条指令。研究者提出用注释记录指令理由,在可验证环境中消除了99.3%的多余指令,并将真实智能体指令遵循度提升至多23.1%。论文CLAUDE.mdAGENTS.md提示词工程推荐理由:这条论文用24万条指令数据告诉你CLAUDE.md为什么越写越长,还给了注释法这个解法,提升多到23%。原文稍后读已读值得跟进有用关注 CLAUDE.md
17:41官方账号arXiv cs.LG@Zhao Su, Yuxin Xia, Haoran Li, Jun Shen, Qi Zhu, Qingguo Zhou, Binbin YongKolmogorov-Arnold网络(KAN)用可学习单变量函数替换标量权重以增强非线性逼近,但每个连接独立函数导致参数冗余。HYDRA将输入映射到Poincaré球的双曲空间,在切空间执行KAN更新,并用低秩原型块跨隐藏维共享函数变换。在八个基准数据集上,HYDRA在保持竞争性或更优预测性能的同时,提高了参数效率和表示可解释性。论文HYDRAKAN双曲空间推荐理由:这篇论文提出HYDRA,给KAN“减负”,参数更省还不掉点,双曲空间让表示更可解释。做KAN相关研究的可以看看。原文稍后读已读值得跟进有用关注 HYDRA
00:57Jerry Liu@jerryjliu073°LlamaParse 团队发布 36 页 ArXiv 论文,介绍企业文档抽取基准 ExtractBench。该基准用 370 份企业文档、4869 页、67 种文档类型评估 14 套抽取系统。核心发现是:超过 50 页的长文档会让商业 VLM 召回率跌到 35% 以下,原因是静默截断表格行。ExtractBench 用价值准确率、空间溯源和单页成本等指标做确定性评测,不依赖 LLM 裁判。同时发布的 LlamaParse Agentic Plus 在榜单上取得 95.6% 价值准确率,成本不到最接近竞品的三分之一。论文ExtractBenchLlamaParseAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse 发布 ExtractBench:长文档让商业模型召回崩到 35%;自家 Agentic Plus 95.6% 登顶,成本更低。原文稍后读已读值得跟进有用关注 ExtractBench
22:25官方账号Nathan Lambert: Interconnects@Nathan Lambert作者反思了AI写作能力,探讨AI模型如何变得更强大。他写了一本AI教科书,并思考AI何时能超越人类写作。文章分析了AI在写作上的进步速度,以及人类作者面临的挑战。作者认为AI在写作方面已接近人类水平,但仍有差距。论文AI写作教科书AI能力推荐理由:作者亲测AI写作,看看AI多久能超越人类写教科书,挺有意思的。原文稍后读已读值得跟进有用关注 AI写作
19:32The Rundown AI@therundownaiAnthropic近日发布了一项新研究,聚焦于提升Claude模型在复杂任务中的表现。该研究引入了新的训练方法,使Claude在推理和代码生成任务上取得了显著进步。在多个基准测试中,Claude的得分超越了前代版本,接近GPT-4的水平。研究团队还公开了部分技术细节,为后续模型优化提供了方向。论文AnthropicClaude推理模型10 个信源在谈事件专题推荐理由:Anthropic发了新研究,Claude在推理和代码上又强了,接近GPT-4,想了解细节的可以看看。原文稍后读已读值得跟进有用关注 Anthropic
18:42官方一手arXiv: DeepSeek@Linhao Wu, Yizhou Chen, Zhen Yang, Pengyu Xue, Dan HaoCausalRepair是一个基于对话的自动程序修复框架,通过双切片策略构建最小因果上下文。静态切片净化测试语义,动态切片基于执行轨迹捕获精确运行时依赖。在Defects4J V1.2、V2.0和Defects4J-Trans上使用DeepSeek-V3评估,正确修复313个缺陷,优于ReinFix和TSAPR,平均修复成本降至0.029美元。论文CausalRepairDeepSeek-V3Defects4J推荐理由:想搞LLM自动修bug的可以看看,CausalRepair用双切片把上下文搞干净了,修复数比ReinFix多,成本还低。原文稍后读已读值得跟进有用关注 CausalRepair
18:41官方一手arXiv: DeepSeek@Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi稀疏自编码器(SAE)常用于解释大语言模型行为,但区分表面词汇特征与真正高层特征一直困难。研究者提出特征非局域性(FNL),定义为SAE特征激活的逐位置影响熵,可在73%-84%的随机配对中正确区分上下文相关推理特征与词元驱动特征。在越狱缓解审计中,FNL发现多数有效特征实为低FNL的位置特征而非真正识别有害意图。在DeepSeek-R1-Distill-Llama-8B上,引导高FNL特征使MATH-500准确率提升4.6个百分点,优于低FNL特征,但效果因模型而异。论文SAEFNL稀疏自编码器推荐理由:想搞懂SAE特征到底抽没抽到抽象概念?这篇提出FNL指标,不用LLM打分就能测抽象度,还能帮你挑干预特征,实测提分4.6。原文稍后读已读值得跟进有用关注 SAE
18:40官方一手arXiv: DeepSeek@Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng精选EvoX Genesis 框架将软件项目设为持久递归世界,本地智能体保持有限寿命,通过递归委派推进版本历史。基于 DeepSeek V4 Flash,Genesis 在 120 小时内构建了约 25 万行 Rust 的 C 编译器,花费仅 44 美元,通过完整 c-testsuite 及多数 LLVM 和 Csmith 测试。在 GLM 5.2 生成的编译器世界中,多次替换智能体后开发仍保持全部测试性能。Genesis 还将 13 个 MESA 模块(超 10 万行 Fortran)重写为约 9 万行 Rust,六个数值工作负载中位数加速 1.55 至 6.87 倍。结果表明,长期软件开发可围绕持久项目而非持久智能体组织。论文EvoX GenesisDeepSeek V4 FlashGLM 5.26 个信源在谈事件专题推荐理由:想低成本搞大型软件项目?EvoX Genesis 用 44 美元让 AI 写了 25 万行编译器,换人也不掉链子,值得看看。原文稍后读已读值得跟进有用关注 EvoX Genesis
18:39官方一手arXiv: DeepSeek@Liang Zhang, Stephen Hwang, Yue Ma, Jinfa Cai一项研究测试了LoRA监督微调能否提升LLM在数学隐喻编码任务上的表现。研究者使用2,265条6-8年级学生回答,让模型完成效价强度编码和主题编码。对比了GPT-4o mini、GPT-5 mini与DeepSeek-R1 1.5B、Mistral 7B,微调后开源模型性能大幅提升,且与专有模型竞争甚至超越。结果表明紧凑开源模型可支持可扩展、隐私友好的教育测量。论文LoRA微调DeepSeek-R1推荐理由:想知道小模型微调后能不能干过大厂API?这篇用2千多条真实学生数据实测,DeepSeek-R1 1.5B微调后比GPT-5 mini还稳。原文稍后读已读值得跟进有用关注 LoRA
18:38官方一手arXiv: DeepSeek@Francisco León Zúñiga Bolívar一项研究比较了DeepSeek V4 Pro、Qwen3-Max、Kimi K2.5和GLM-5.1四个中国前沿模型在进化囚徒困境中的合作倾向。通过固定代码转换器为GPT-5.4 Mini,排除了编码能力干扰,发现各模型攻击性均衡比例从Qwen3-Max的1%到DeepSeek V4 Pro的9%不等。四个实验室间的差异(8个百分点)大于中国与西方生态系统的均值差异(5.0%对5.0%)。研究支持H6假设,即中国模型并非单一整体,实验室层面而非生态系统层面决定合作倾向。论文DeepSeek V4 ProQwen3-MaxKimi K2.54 个信源在谈事件专题推荐理由:想知道中国大模型是不是都一个样?这篇论文用囚徒困境测了DeepSeek、Qwen、Kimi和GLM,发现它们合作倾向差别挺大,别再把它们当铁板一块了。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
18:35官方一手arXiv: Anthropic@Giuseppe Destefanis, Daniel Graziotin, Matteo Vaccargiu, Marco OrtuGitSkills 数据集收录了 2026 年 7 月从 282,200 个公共仓库中采集的 3,797,117 个 SKILL.md 文件。这些文件按内容哈希去重后得到 1,877,981 个不同版本,每个版本附带完整文本、front matter、文件夹内容及仓库元数据。数据集以单个 SQLite 文件发布,支持研究 Agent 技能的采用、复用、结构、维护与安全问题。该研究指出技能文件缺乏中央注册表,主要通过复制文件夹传播。论文GitSkillsAgentGitHub推荐理由:想研究 Agent 技能生态的,这个数据集直接给你 380 万份真实 SKILL.md,比你自己爬 GitHub 省事多了。原文稍后读已读值得跟进有用关注 GitSkills
18:33官方账号arXiv cs.LG@Nikolai Bolik, Lennart Stöpler, Artur AndrzejakShani等人2026年的研究显示LLM表征能大致还原人类类别边界,但无法捕捉细粒度典型性结构。本文用稀疏自编码器(SAE)活跃潜变量集的重叠度作为更可解释的相似度度量,重新审视该分析。在受控玩具模型中SAE潜变量集能恢复并集式组合结构,在自然文本中也能诱导语义连贯的邻域。但扩展到人类概念分析时,SAE激活集并未比稠密嵌入或残差流状态更忠实还原类别边界或典型性,而是追踪模型内部相似性结构。在受控语义修改下,人类概念变化判断与SAE活跃集变化存在显著不匹配,说明在理想化设置之外SAE特征不按简单词袋语义组合。论文稀疏自编码器SAE可解释性推荐理由:这篇论文用SAE潜变量集做相似度度量,发现它并不比稠密嵌入更贴近人类概念判断,搞可解释性的人值得看看这个反直觉结论。原文稍后读已读值得跟进有用关注 稀疏自编码器
18:27官方账号arXiv cs.LG@Eric A. F. Reinhardt, Adam J. Hauser该论文提出软注意力机制在概率单纯形上的精确量子实现方案。注意力分数通过Hadamard测试统计获得,指数softmax与Born规则测量存在精确双射。温度参数对应重复测量次数,值聚合通过确定性列加载通道实现。所有可学习参数均为旋转门角度,组合层在无限射击极限下精确。代数核心已用Lean 4形式化验证。论文量子计算softmax注意力机制推荐理由:量子计算和注意力机制结合的新思路,把softmax映射到量子测量,数学上还挺严谨,搞量子ML的可以看看。原文稍后读已读值得跟进有用关注 量子计算
18:26官方账号arXiv cs.LG@Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu DaiMMCS是一种新的多模态预训练方法,通过将文本实体替换为对应视觉对象,提供显式的对象级监督。该方法仅用50K样本就能匹配或超越在600K图像-文本对上训练的模型,数据效率提升12倍。MMCS在773K样本的预训练数据集上验证了有效性,并持续提升不同规模模型的视觉定位和感知能力。该研究针对现有MLLMs中图像级对齐的指称歧义问题,提出了更精确的局部视觉-语言对齐方案。论文MMCS多模态预训练推荐理由:这篇论文提出MMCS,用50K样本就干翻别人600K的效果,做多模态预训练的可以看看这个新思路。原文稍后读已读值得跟进有用关注 MMCS
18:24官方账号arXiv cs.LG@Nguyen Thai Anh, Truong Viet Vu, Tran Thien Thanh, Vo Nguyen Quoc Bao, Ngo Hoang TuHEB-NB通过Type-II最大似然学习Dirichlet先验浓度,实现数据自适应的平滑,解决了Laplace等固定平滑在高基数数据上的偏差问题。理论证明其非渐近误差界匹配经验分布极小极大率,并给出有限样本风险级严格优于Laplace的证明。在31个UCI和OpenML基准上,HEB-NB取得最佳平均Friedman排名,高基数数据集对数损失降低达22.1%。HEB-AODE扩展也一致优于原始AODE。结合互信息加权,top-1 ECE降低41%-70%。论文HEB-NBNaive Bayes经验贝叶斯推荐理由:如果你用朴素贝叶斯处理高基数分类数据,HEB-NB能自动调平滑参数,比固定Laplace更准,论文还给了理论保证和实测数据。原文稍后读已读值得跟进有用关注 HEB-NB
18:23官方账号arXiv cs.LG@Pavel Averin, Theodoros Moysiadis, Ioannis Katakis该综述系统梳理了约束因果发现中的条件独立性检验方法,涵盖PC和FCI算法中骨架剪枝与方向判定的核心环节。文章将CI测试分为偏相关、列联表、回归、最近邻、核和机器学习六大家族,并重点分析各族的鲁棒性局限。综述指出CI检验的统计功效随条件集规模增大而衰减,且I型/II型错误不对称会影响图级骨架恢复和v结构定向。文章还比较了主要R和Python库的采用情况,并总结了混合类型数据、小样本误差控制等开放挑战。论文条件独立性检验因果发现PC算法推荐理由:做因果发现的朋友可以看看,这篇把PC和FCI背后的CI检验方法按六个家族梳理清楚了,还讲了每种方法什么时候会失效,省得自己踩坑。原文稍后读已读值得跟进有用关注 条件独立性检验
18:22官方账号arXiv cs.LG@Shiqi Huang, Jiani He, Dingyan Shang, Yihua Xu, Jize Li, Yan Lyu, Lashimi Muraleedharan NairDACRI 研究提出 CriticalSCM-Bench v1,一个带因果真值的合成基准,用于评估供应链干预策略。相比全信息静态基准,LambdaMART 在中位归一化净值上提升 5.7% 至 16.2%,在半导体和关键材料场景有统计支持,但在数字基础设施上不如领域常量缓冲策略。部分和延迟信息下,LambdaMART 保留全信息价值的 33% 至 75%。压力测试显示干预保真度、时机、成本和未见过中断会改变策略排序,关键材料的外推保留最弱。540 次生成中的受保护解释研究在确定性验证和模板回退后保留了所有固定干预决策,但措辞不稳定。论文DACRI供应链因果推断推荐理由:这篇论文用合成基准测了不同干预策略在供应链里的实际效果,LambdaMART 在某些场景确实更优,但数字基础设施上简单策略反而更强,值得做决策的人看看。原文稍后读已读值得跟进有用关注 DACRI
18:21官方账号arXiv cs.LG@Zetao Hong, Song Yuan, Yuanhao Ding, Yibo Zhu, Daxin Jiang, Zhibin Wang, Chen TianMISA-T是一种针对混合强化学习rollout服务的路由层准入策略,解决RLVR、RLHF和智能体rollout共享推理服务时的KV缓存竞争问题。在Step3.7和Qwen3.6-35B-A3B上的消融实验中,MISA-T相比调优的vLLM Router将rollout吞吐分别提升53.3%和43.6%,同时保持高前缀缓存命中率。在50次迭代的Step3.7实验中,吞吐提升35.6%,平均迭代时间减少22.8%,且任务分数相当。论文MISA-TRLHFKV缓存推荐理由:做LLM后训练的朋友可以看看,MISA-T把混合rollout调度做得更精细,吞吐提升明显,而且不牺牲任务效果。原文稍后读已读值得跟进有用关注 MISA-T
18:20官方账号arXiv cs.LG@Kaan Buyukkalayci, Kyle Pak, Merve Karakas, Christina Fragouli该论文提出一种基于推荐系统的传感器子集选择方法,用于目标跟踪。此前研究利用低成本声学RSSI测量推荐传感器节点子集,使昂贵传感模式(如摄像头)实现高跟踪精度,但RSSI易受声学干扰。新方法采用频带声学特征和双塔多层感知机(MLP)架构,高效评分候选传感器子集。在户外车辆跟踪部署实验中,该方法相比RSSI基线将跟踪精度提升约20%,同时保持实时选择性传感所需的低计算开销。论文传感器选择目标跟踪推荐系统推荐理由:这篇论文用推荐系统思路解决传感器选择,抗干扰还提精度20%,做跟踪或边缘计算的朋友可以看看。原文稍后读已读值得跟进有用关注 传感器选择
18:19官方账号arXiv cs.LG@Vladimir IglovikovAlbumentationsX 是一个新的数据增强库,确保图像及其相关标注(如掩码、边界框、关键点)在增强时使用相同的随机变换。它通过将变换列表、概率、标注设置和随机种子封装在一个 Compose 对象中,每次调用只生成一次随机值并应用于所有部分。该库支持自定义变换,并能保存管线定义、展示单次调用过程及重放。示例显示其位于文件解码后、PyTorch 批处理前,由实践者决定变换是否保持标签正确。论文AlbumentationsX数据增强图像标注推荐理由:做目标检测或分割的可以看看,AlbumentationsX 把图像和标注的增强统一了,避免随机变换错位,还能重放调试。原文稍后读已读值得跟进有用关注 AlbumentationsX
18:16官方账号arXiv cs.LG@Songlin Du, Xiaoyong Lu, Zeyu Wu, Xiaobo Lu, Guobao Xiao, Bin Fan, Jiayi Ma, Takeshi Ikenaga该综述系统梳理了跨视角特征匹配领域,提出涵盖特征提取、单类型匹配器、多类型匹配器、视觉基础模型方法、训练策略和鲁棒估计的分类体系。文章对代表性方法在统一协议下进行基准测试,比较性能差异。综述指出领域正从任务特定模型转向统一可泛化的对应模型,并讨论了效率、极端条件鲁棒性和跨域泛化等开放挑战。论文跨视角特征匹配视觉基础模型综述推荐理由:想了解跨视角匹配的现状和未来?这篇综述把方法分类、基准测试和基础模型趋势都讲清楚了,适合快速入门。原文稍后读已读值得跟进有用关注 跨视角特征匹配
18:15官方账号arXiv cs.LG@Robert Bitterling, Christian Nettersheim, Jörn Hees, Michael Rademacher针对LoRa智能城市部署,研究者用真实城市数据系统分析机器学习路径损耗预测精度随训练集规模的变化。随机森林结合LiDAR地形特征,k近邻使用坐标数据,两者在随机池化分割下均优于经验模型和专用LPWAN模型。最大训练规模时,ML模型RMSE低于6.5 dB,最佳基线为9.7 dB。留一网关验证显示,随机森林对未见网关有位置依赖的迁移,坐标k近邻在网关位置未见时大幅退化。论文LoRa路径损耗预测随机森林推荐理由:想搞LoRa网络规划?这篇用真实数据告诉你ML模型比传统模型准多少,还分析了换网关会翻车的情况,挺实在的。原文稍后读已读值得跟进有用关注 LoRa
18:14官方账号arXiv cs.LG@Artyom Sabitov, Daniil Volkov, Alexey Zaytsev该论文研究内存受限下推荐系统训练中批大小与负样本数量的分配问题。理论分析表明,在固定内存预算下,增大批大小比增加负样本数量带来更快的收敛速度。作者提出将内存优先分配给更多样本的实用规则,并在MovieLens-20M等四个真实推荐基准上验证。实验显示该配置在相同内存下获得更优的收敛速度和最终推荐质量。论文推荐系统采样softmax内存优化推荐理由:推荐系统训练时内存不够用?这篇论文告诉你该加批大小还是加负样本,结论很实用。原文稍后读已读值得跟进有用关注 推荐系统
18:13官方账号arXiv cs.LG@Sepideh Saran, Mahsa Ghanbari, Uwe Ohler该研究对基因组学中深度学习模型的不确定性量化方法进行了系统比较,涵盖Deep Ensembles、贝叶斯神经网络和MC-dropout。实验基于序列到活性模型和单细胞表达分析两类任务,评估了不同方法在类别不平衡和分布外数据下的表现。结果显示贝叶斯神经网络在捕获不确定性方面更优,尽管计算成本较高。研究还展示了不确定性分数在蛋白质-RNA相互作用预测中的应用。论文不确定性量化基因组学贝叶斯神经网络推荐理由:想知道基因组学里哪个不确定性方法靠谱?这篇实证对比了三种主流方法,贝叶斯网络在类别不平衡时表现最好,还教你怎么用不确定性挑高质量预测。原文稍后读已读值得跟进有用关注 不确定性量化
18:12官方账号arXiv cs.LG@Nikita Sevriukov, Anna Barabanova, Uliana Gagarina, Karina Ivanova, Sofiia Kasaeva, Ilya Levin, Marina Sheshukova逆强化学习(IRL)旨在从专家演示中恢复奖励函数,通常被建模为双层优化问题,内层为策略优化,外层衡量策略与专家数据的差异。然而,外层更新需要计算涉及内层目标逆Hessian向量积的超梯度,计算成本高昂。本文证明在内层最优处,内层目标的Hessian与策略的Fisher信息矩阵成正比,从而提出基于Fisher的超梯度,与自然超梯度下降紧密相关。为应对大规模Fisher矩阵的瓶颈,作者使用流式谱草图近似逆Fisher向量积,避免显式构造Fisher矩阵。在离散和连续控制环境中,该方法相比一阶随机双层基线,实现了有竞争力的策略性能和奖励排序质量,同时降低了曲率存储复杂度并提升了计算效率。论文逆强化学习超梯度Fisher信息矩阵推荐理由:这篇论文给IRL的超梯度计算找了个巧妙的捷径,用Fisher矩阵和谱草图省下大量算力,做强化学习的朋友可以看看。原文稍后读已读值得跟进有用关注 逆强化学习