论文
研究者用对比学习训练了一个 ModernBERT Bi-Encoder,判断两段文字是不是同一人写的,在 PAN21 上准确率 98.4%,还列出了调参要点。
把 transformer 注意力当成动力系统来分析的物理论文,找出了混沌、凝聚这些相变结构,做理论或注意力机制研究的可以看看。
一篇理论论文,搞清楚了两层 ReLU 分类器什么时候解唯一、什么时候全局最优,还证明加个 skip connection 就能消除次优局部解,做理论的朋友可以看看。
一篇很新颖的智能体论文:不模拟工具输出,而是让模型直接修改任务状态,Action Judge 拿了 70.5% F1,做 Agent 的值得看看思路。
arXiv 上的新论文,Clifford-VAE 把图像数据编码成超维符号向量,做 VSA 基准测试比 Gaussian 和 Hyperspherical VAE 都强,搞神经符号方向的可以看看。
一篇改注意力机制的论文:value 不再做投影,改查 token 记忆表,推理还能省显存,做模型结构的可以看看。
教小模型做数学题的新训练方法,把教师模型的逐token提示和答案对错验证揉进一个GRPO更新里,Qwen3-1.7B和4B都涨了不到1个点,做RL训练的可以看看细节。
给机器人策略做"删除指定动作"的遗忘方法,在 Unitree G1 和 H2 上验证过,涉及 GDPR 和安全问题的话很值得看看思路。
一个自动驾驶推理数据集,41 万多帧标注把视觉证据和驾驶决策串成思维链,多个骨干模型实测轨迹误差明显下降,做自动驾驶 VLM 的可以看看。
有人把 EU AI Act 那套系统性风险分类做成了开源评估面板,18 个模型最坏情况评分比平均分低 14–37 分,证据可逐条追溯。
一篇把拍卖机制套到 LLM 采购上的论文,Llama 和 Qwen 实测显示固定定价比竞价贵 10% 到 71%,做 API 成本优化的可以看看思路。
给做机器人策略的人:MemBodied 用固定大小记忆替代越堆越长的上下文,RMBench 上成功率达到无状态策略的 7.81 倍,参数开销还小 10 倍。
多机器人协作的新玩法:COMPASS 让一群机器人自己本地算反馈,最多能带 1024 台一起飞,比集中式 LLM 策略稳不少。
arXiv 上这篇论文讲怎么让智能体改的代码和硬件设计在合并、部署前拿到可核验的授权,对做工程流程和合规的人挺有参考价值。
这个叫 PASTABench 的新基准测了 16 个大模型给智能体踩刹车的时机,最好的也只拿到 40.74%,还拆穿了不少小模型靠关键词得分。
数据同化方向的论文,用流匹配把经典集合滤波升级成非线性更新,实验上超过了四种经典滤波器,做预报或同化的朋友可以看看。
搞材料计算的朋友可以看看,1540 万个固液界面 DFT 结构直接可用,配 MACE 模型就能训练自己的机器学习势。
有人在 6GB 显存的笔记本上,用土耳其语 109 页报告实测了五款 7B-8B 开源模型,还顺手证明花哨检索方案打不过 TF-IDF,做 RAG 的可以看看。
arXiv 上一篇讲 KV 缓存的新论文,用本地历史替换当前 token 分支,126M 模型上困惑度降了约 1.4%,做推理优化的人可以看看。
小模型跑工具智能体老犯重复调用、提前写入这类错,这篇把失败经验做成异构图记忆来避免,τ-Bench 和 AppWorld 都验证有效,做本地部署的可以看看。
这论文把 KV-cache 压缩变成了能签合同的事:给定风险目标,自动算出能砍多少缓存,砍不了就回退全 KV。做长文本推理部署的可以看看。
Wayve 这篇论文教你怎么用不到5%的语言标注训出能开车的VLA,Bench2Drive 上分数还超过全监督基线,做自动驾驶的值得看看方法细节。
把 Muon 里那套 Newton-Schulz 迭代搬到注意力输出上,不加参数,ViT 和 Swin 在 CIFAR 上 12 组对比全涨,代价是推理变慢一点。
这篇把表格模型上下文学习拆开讲了,RefineICL 比 TabPFN-3 高 31.4 Elo,还解释了为什么去掉 FFN 反而更好,做表格任务的建议看看。
做强化学习的可以看看:RACER 用自适应扰动和 critic 一致性正则,解决了对抗训练里对手太狠把智能体带偏的问题,连续控制实验效果确实比老基线稳。
把 LLM 当遗传算法的调参师用,8 个控制案例全部跑通,成本才 $0.002 一次,做控制或自动化的朋友可以看看这套架构。