做智能体记忆的可以看看:别再用一套 embedding 搜所有记忆了,先分类再按类型检索,三个数据集上 Recall@1 最多涨 16.18%,还附了 TriMEM 数据集。
#论文
有篇叫 Agent Plasticity 的论文挺有意思,专门研究智能体能不能靠经验越用越好,还给了量化评估的框架,做 agent 的可以看看。
这篇论文把 RAG 从'检索'升级成'主动算证据',RouterLM 用 Qwen3.5-9B 就打赢了 Gemini 3.5 Flash,做 RAG 的可以看看思路。
化学+AI方向的朋友可以看看,NPF把Petri网直接做成网络结构,零样本原子映射就超过了RXNMapper,反应产物预测还保证分子合法。
Yann LeCun 圈子的人发了 H-JEPA,把世界模型按抽象层级拆开做规划,Visual AntMaze 成功率从 18% 干到 73%,算力还更省。
Google 发的这篇论文很实用:给智能体加个想法排序地图加审计员,比 ScientistOne 快 3 倍出结果,做 agent 的可以抄作业。
这篇论文教你用线性响应理论给 AI 模拟器做体检,储备池计算机统计上看着挺对但响应错了,神经 ODE 反过来,挺反直觉。
一群研究者做了个叫 IdeaLens 的检测器,专看想法是人的还是 AI 的。有人照 AI 详细大纲写文,Pangram 照样误报 92%,它只误报 7%,挺有意思的思路。
一篇做少样本分类的研究:RepICL-I 在 12 个设定里全赢了 Logistic Regression,靠的是 episodic whitening 这一步,做小样本任务可以看看。
论文发现重启推理链的位置本身就有讲究,选对位置在 MATH-500 上能用更少算力超过 self-consistency,做推理成本优化的人可以看。
arXiv 上的新论文 RETRACE,教 AI 智能体从真实 CI 修复历史里学经验,mini-SWE-agent 成功率从 19.6% 涨到 31.9%,做智能体修复的可以看看。
微软发了篇论文叫 CorpusMap,提前把文档集合里的实体建好索引页,智能体检索时准确率涨最多 11.7 分,token 还省一半多。
做回归或不确定性量化的人可以看看:标准 GP 一旦 kernel 选错就崩,PrO-GPs 直接优化预测校准,实验显示误设下表现更稳。
研究因果发现的朋友可以看看:SPADE 把组合搜索做到了 1600 变量级别,还顺手把四类主流方法的优劣捋了一遍,省你自己跑实验。
只拿 200 道题微调,就让 LLaDA-8B-Instruct 的数学和代码成绩跑赢 SFT 和扩散 RL,方法还挺省算力,做扩散模型训练的可以看看。
这篇用有解析解的金融博弈当考卷,发现 PPO 奖励给对了也学不准,问题出在 critic 排序动作的能力上,对做 RL 金融应用的人很有参考价值。
Basis Research 提出的 Double-Stitch 免去训练时反复跑数值求解器,比 WLM 快 4-14 倍,还覆盖梯度流搞不定的周期性动力学,JAX 代码已开源。
Google 这篇论文有点反直觉:答案一致反而可能是错的。VeriHarness 用同款模型当验证器挑毛病,五个基准上都能涨分,数据也开源了。
Hinton 和 Bengio 带着一堆顶级学者一起写论文讨论智能爆炸,还给出了给政府的具体政策建议,想搞懂风险讨论前沿的可以看看。
Long-context 智能体靠摘要记事,写漏一步就全完。这篇论文把摘要器的损失量化拆解,还给出了直接用读者损失训练写入器的 DSSR 方法,做 agent 记忆的值得细看。
一篇理论味很浓的 checkpoint 合并论文:证明信息论下界,给出达到 O(h^3) 最优误差的合并系数,还在 SmolLM3-3B 上做了实测对比。