arXiv 上一篇讲 KV 缓存的新论文,用本地历史替换当前 token 分支,126M 模型上困惑度降了约 1.4%,做推理优化的人可以看看。
全部动态
小模型跑工具智能体老犯重复调用、提前写入这类错,这篇把失败经验做成异构图记忆来避免,τ-Bench 和 AppWorld 都验证有效,做本地部署的可以看看。
这论文把 KV-cache 压缩变成了能签合同的事:给定风险目标,自动算出能砍多少缓存,砍不了就回退全 KV。做长文本推理部署的可以看看。
Wayve 这篇论文教你怎么用不到5%的语言标注训出能开车的VLA,Bench2Drive 上分数还超过全监督基线,做自动驾驶的值得看看方法细节。
把 Muon 里那套 Newton-Schulz 迭代搬到注意力输出上,不加参数,ViT 和 Swin 在 CIFAR 上 12 组对比全涨,代价是推理变慢一点。
这篇把表格模型上下文学习拆开讲了,RefineICL 比 TabPFN-3 高 31.4 Elo,还解释了为什么去掉 FFN 反而更好,做表格任务的建议看看。
做强化学习的可以看看:RACER 用自适应扰动和 critic 一致性正则,解决了对抗训练里对手太狠把智能体带偏的问题,连续控制实验效果确实比老基线稳。
把 LLM 当遗传算法的调参师用,8 个控制案例全部跑通,成本才 $0.002 一次,做控制或自动化的朋友可以看看这套架构。
这篇论文造了个诊断集,专门测长上下文模型“找到了但没用上”的问题,DeepSeek 两个模型都被测出检索满分但解读掉分,做长文本评测的可以看看。
越南 PDPD 合规催生的实用论文:本地跑 Qwen3.5-27B 配混合 RAG,效果追平云端 DeepSeek-V4-Flash,还公开了越南语 RoPA 基准。
这篇用分层贝叶斯方法量化了 DeepSeek-R1-Distill 系列的推理能力与 token 消耗,结论是加大模型只提升能力不提升效率,做选型或研究 scaling 的朋友可以看看。
论文提出了 CASPER 框架来摘要审讯对话,还配套 6000 条标注的 MINDSum 数据集,做法是让警官、督察等多角色打分迭代,ROUGE 和 BERTScore 都超了基线。
论文提出 ARIA 框架,专门解决多个各自合规的 AI 智能体放一起可能产生集体性歧视的问题,还对照了 EU AI Act 的监管要求,做金融合规的值得看看。
想做 AI 出题自动质检的可以看看:论文实测了 LLM、BERT、传统 ML 在布鲁姆分类上的 OOD 表现,LLM 拿到 0.79 的 F1,还给了几个低成本补救手段。
机器人换个机位就翻车的问题有解了:InfiNoVA 用 3D Gaussian 造新视角训练数据,陌生视角成功率提升 5.4 倍,不用改模型架构。
一篇交通预测论文,提出了 LoReST 网络,用局部加区域两级建模替代昂贵的全对交互,在 LargeST 四个数据集上误差明显下降。
医院里 AI 写放射报告容易漏病灶或编造发现,这篇论文用 Jev 做低成本裁判,成本不到 3 美分评 100 对报告,做医疗 AI 评估的可以看看。
做游戏内或实时状态类对话智能体的朋友看看,三个包装器把接地准确率从 60% 多拉到 96.7%,延迟还压在 1.5 秒。
这篇论文发现 ICL 微调会让模型更容易被假上下文带偏,实测最多降 14.95 个点,J-ICL 方法能两边兼顾,做 RAG 或智能体的朋友可以看看。
Apple 发的新方法 probe guidance,不用多跑一次 forward pass 就能给 flow matching 模型加引导,搞生成模型的可以看看。
腾讯混元做了个新基准 WebCraftBench,用 369 条真实需求测 AI 写网页到底靠不靠谱,测了 17 个模型,和 Code Arena 榜单相关性 0.89。
偏头痛患者可以看看,Nerivio 应用用 5.3 万人的数据训练模型,提前一天预测头痛,准确率 91%。
Google 这篇论文值得做 Agent 的人细读:自动优化 harness 会让你 eval 分数涨但真实任务变差,RRSI 用双向正则化解决了这个问题。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档