论文
研究者用对比学习训练了一个 ModernBERT Bi-Encoder,判断两段文字是不是同一人写的,在 PAN21 上准确率 98.4%,还列出了调参要点。
把 transformer 注意力当成动力系统来分析的物理论文,找出了混沌、凝聚这些相变结构,做理论或注意力机制研究的可以看看。
一篇理论论文,搞清楚了两层 ReLU 分类器什么时候解唯一、什么时候全局最优,还证明加个 skip connection 就能消除次优局部解,做理论的朋友可以看看。
一篇很新颖的智能体论文:不模拟工具输出,而是让模型直接修改任务状态,Action Judge 拿了 70.5% F1,做 Agent 的值得看看思路。
arXiv 上的新论文,Clifford-VAE 把图像数据编码成超维符号向量,做 VSA 基准测试比 Gaussian 和 Hyperspherical VAE 都强,搞神经符号方向的可以看看。
一篇改注意力机制的论文:value 不再做投影,改查 token 记忆表,推理还能省显存,做模型结构的可以看看。
教小模型做数学题的新训练方法,把教师模型的逐token提示和答案对错验证揉进一个GRPO更新里,Qwen3-1.7B和4B都涨了不到1个点,做RL训练的可以看看细节。
给机器人策略做"删除指定动作"的遗忘方法,在 Unitree G1 和 H2 上验证过,涉及 GDPR 和安全问题的话很值得看看思路。
数据同化方向的论文,用流匹配把经典集合滤波升级成非线性更新,实验上超过了四种经典滤波器,做预报或同化的朋友可以看看。
搞材料计算的朋友可以看看,1540 万个固液界面 DFT 结构直接可用,配 MACE 模型就能训练自己的机器学习势。
有人在 6GB 显存的笔记本上,用土耳其语 109 页报告实测了五款 7B-8B 开源模型,还顺手证明花哨检索方案打不过 TF-IDF,做 RAG 的可以看看。
arXiv 上一篇讲 KV 缓存的新论文,用本地历史替换当前 token 分支,126M 模型上困惑度降了约 1.4%,做推理优化的人可以看看。
小模型跑工具智能体老犯重复调用、提前写入这类错,这篇把失败经验做成异构图记忆来避免,τ-Bench 和 AppWorld 都验证有效,做本地部署的可以看看。
这论文把 KV-cache 压缩变成了能签合同的事:给定风险目标,自动算出能砍多少缓存,砍不了就回退全 KV。做长文本推理部署的可以看看。
Wayve 这篇论文教你怎么用不到5%的语言标注训出能开车的VLA,Bench2Drive 上分数还超过全监督基线,做自动驾驶的值得看看方法细节。
把 Muon 里那套 Newton-Schulz 迭代搬到注意力输出上,不加参数,ViT 和 Swin 在 CIFAR 上 12 组对比全涨,代价是推理变慢一点。
这篇把表格模型上下文学习拆开讲了,RefineICL 比 TabPFN-3 高 31.4 Elo,还解释了为什么去掉 FFN 反而更好,做表格任务的建议看看。
做强化学习的可以看看:RACER 用自适应扰动和 critic 一致性正则,解决了对抗训练里对手太狠把智能体带偏的问题,连续控制实验效果确实比老基线稳。
这篇讲了怎么把智能体跑长任务的 token 开销砍一半,方法只有一条:压缩只删不改,还开源了能在 Claude Code 里直接用的实现。
一篇很实在的论文:作者发现长文档检索差的真正元凶是近处无关文字抢注意力,给出 LYRA 方法外加 ProxBench 基准,做了 RAG 的话值得看他们的实验数据。
量化到 2-bit 后模型做数学题会发疯循环?这篇论文用 on-policy 蒸馏把 MATH-500 保留率从 35% 拉到 70%,做端侧部署的可以看看。
标注预算不够又想评估策略?这篇 arXiv 论文告诉你怎么分配人工标注最省钱,RMSE 能降一半以上。
研究 grokking 为什么突然泛化的论文,理论算出 grokking 时间由学习率乘 weight decay 决定,还用上千个网络验证了,做可解释性的可以看看。
数据集成领域的新论文,LOKI 能自动从文本里发现不同表之间的行级关联,精度 0.982,比直接调 LLM 便宜 40 倍,做数据湖的可以看看。
一篇挺有意思的论文:同样的模型和提示,BF16 和 FP16 居然输出不一样,作者还给出了低于 4% 延迟开销的修复方法。