数据同化方向的论文,用流匹配把经典集合滤波升级成非线性更新,实验上超过了四种经典滤波器,做预报或同化的朋友可以看看。
论文
搞材料计算的朋友可以看看,1540 万个固液界面 DFT 结构直接可用,配 MACE 模型就能训练自己的机器学习势。
有人在 6GB 显存的笔记本上,用土耳其语 109 页报告实测了五款 7B-8B 开源模型,还顺手证明花哨检索方案打不过 TF-IDF,做 RAG 的可以看看。
arXiv 上一篇讲 KV 缓存的新论文,用本地历史替换当前 token 分支,126M 模型上困惑度降了约 1.4%,做推理优化的人可以看看。
小模型跑工具智能体老犯重复调用、提前写入这类错,这篇把失败经验做成异构图记忆来避免,τ-Bench 和 AppWorld 都验证有效,做本地部署的可以看看。
这论文把 KV-cache 压缩变成了能签合同的事:给定风险目标,自动算出能砍多少缓存,砍不了就回退全 KV。做长文本推理部署的可以看看。
Wayve 这篇论文教你怎么用不到5%的语言标注训出能开车的VLA,Bench2Drive 上分数还超过全监督基线,做自动驾驶的值得看看方法细节。
把 Muon 里那套 Newton-Schulz 迭代搬到注意力输出上,不加参数,ViT 和 Swin 在 CIFAR 上 12 组对比全涨,代价是推理变慢一点。
这篇把表格模型上下文学习拆开讲了,RefineICL 比 TabPFN-3 高 31.4 Elo,还解释了为什么去掉 FFN 反而更好,做表格任务的建议看看。
做强化学习的可以看看:RACER 用自适应扰动和 critic 一致性正则,解决了对抗训练里对手太狠把智能体带偏的问题,连续控制实验效果确实比老基线稳。
把 LLM 当遗传算法的调参师用,8 个控制案例全部跑通,成本才 $0.002 一次,做控制或自动化的朋友可以看看这套架构。
这篇论文造了个诊断集,专门测长上下文模型“找到了但没用上”的问题,DeepSeek 两个模型都被测出检索满分但解读掉分,做长文本评测的可以看看。
越南 PDPD 合规催生的实用论文:本地跑 Qwen3.5-27B 配混合 RAG,效果追平云端 DeepSeek-V4-Flash,还公开了越南语 RoPA 基准。
这篇用分层贝叶斯方法量化了 DeepSeek-R1-Distill 系列的推理能力与 token 消耗,结论是加大模型只提升能力不提升效率,做选型或研究 scaling 的朋友可以看看。
论文提出了 CASPER 框架来摘要审讯对话,还配套 6000 条标注的 MINDSum 数据集,做法是让警官、督察等多角色打分迭代,ROUGE 和 BERTScore 都超了基线。
论文提出 ARIA 框架,专门解决多个各自合规的 AI 智能体放一起可能产生集体性歧视的问题,还对照了 EU AI Act 的监管要求,做金融合规的值得看看。
想做 AI 出题自动质检的可以看看:论文实测了 LLM、BERT、传统 ML 在布鲁姆分类上的 OOD 表现,LLM 拿到 0.79 的 F1,还给了几个低成本补救手段。
机器人换个机位就翻车的问题有解了:InfiNoVA 用 3D Gaussian 造新视角训练数据,陌生视角成功率提升 5.4 倍,不用改模型架构。
一篇交通预测论文,提出了 LoReST 网络,用局部加区域两级建模替代昂贵的全对交互,在 LargeST 四个数据集上误差明显下降。
医院里 AI 写放射报告容易漏病灶或编造发现,这篇论文用 Jev 做低成本裁判,成本不到 3 美分评 100 对报告,做医疗 AI 评估的可以看看。
做游戏内或实时状态类对话智能体的朋友看看,三个包装器把接地准确率从 60% 多拉到 96.7%,延迟还压在 1.5 秒。
这篇论文发现 ICL 微调会让模型更容易被假上下文带偏,实测最多降 14.95 个点,J-ICL 方法能两边兼顾,做 RAG 或智能体的朋友可以看看。
做仓库级代码生成的可以看看这篇:FeatLens 用功能索引建图再检索,比全仓库图方法省六成节点、四成多 token,检索还不用调 LLM。