#长上下文
DeepSeek 把智能体的 KV 缓存砍到每 token 890 字节,比 V1 小 437 倍,Flash 还在 AA Index 上反超 V4-Pro,价格只要一半不到。
TheUnbiasedCo 发布的 Pareto 26.10 在 OpenRouter 上线,价格比旧版便宜近七成,还支持多模态和长上下文。
Meta 给智能体配了个记忆员,专记它犯过的错并适时提醒,把 Claude Sonnet 4.5 成绩从 37.6% 拉到 45.9%,做智能体的可以看看。
这篇论文造了个诊断集,专门测长上下文模型“找到了但没用上”的问题,DeepSeek 两个模型都被测出检索满分但解读掉分,做长文本评测的可以看看。
小米把 1M 长上下文的预填充成本砍掉 5 倍,KV 缓存也小了 4.5 倍,跑智能体任务的人可以看看这套 HySparse 2 架构。
一篇很实在的论文:作者发现长文档检索差的真正元凶是近处无关文字抢注意力,给出 LYRA 方法外加 ProxBench 基准,做了 RAG 的话值得看他们的实验数据。
一篇新论文 CompKV,重新设计了稀疏注意力里的 token 选择逻辑,长上下文推理自注意力最高快 6.85 倍,做推理优化的可以看看。
SGLang、Qwen和NVIDIA联手推出NVFP4 KV Cache,4-bit精度下1.78倍容量提升,长上下文推理提速近80%。
Boltzbit 和剑桥把对话内容动态编译成 LoRA 权重贴到模型上,长文档和多轮对话反超堆 Prompt,每轮算力还恒定。
OpenAI 用 1 万个代理做了个实验,结果挺有意思的,DeepSeek 也出了个新版本,对长文本处理更便宜了。
DeepSeek 新出的 V4.1-Flash 模型,KV 缓存占用比之前版本小很多,适合做长上下文对话,比如百万级文本的对话,而且性能还更好。
Hugging Face 新出的 TRL 库版本,能直接训练百万级 token 的模型,比之前版本更强大,适合做长文本任务。
LoGo让模型智能决定哪些token需要全局注意力,大幅提升长文本处理效率,比传统Transformer更聪明。