AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:缓存机制×
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
6月2日
09:39
09:39arXiv cs.AI@Xin Su, Dawid Majchrowski, Fangyuan Yu, Vanshil Atul Shah, Sebastian Rogawski, Pawel Morkisz, Anahita Bhiwandiwalla, Phillip Howard
大语言模型的自回归生成成本高昂,推测解码通过草拟多个token并一次性验证来加速,但加速效果取决于草稿被接受的长度。无参数草稿源在结构化任务和智能体工作流中能以低成本生成长序列,但缓存匹配的收益在不同步骤间波动。本文提出Hybrid Verified Decoding,在验证前预测缓存草稿的接受长度,并据此选择缓存验证或基于模型的草稿器。在三个LLM和十六个数据集上,该方法在智能体工作流中表现尤为突出,平均加速2.73倍,全面超越EAGLE3。分析揭示了提示结构如何创造缓存机会、高收益缓存草稿如何集中在少数区域,以及收益引导的选择如何减少顺序解码工作量。
论文推测解码推理加速智能体工作流缓存机制EAGLE3

推荐理由:做LLM推理加速的团队终于有了一个能动态分配验证资源的方案——在智能体工作流中平均加速2.73倍,比EAGLE3还强,搞推测解码的开发者值得点开看看具体实现。
原文
5月30日
11:46
11:46宝玉@dotey
精选
本文对比了OpenAI和Anthropic在API设计上的两个关键差异:一是system消息权重不同,OpenAI对system消息权重较低,而Claude对其权重很高;二是缓存机制不同,OpenAI自动缓存,Anthropic需要手动设置cache_control断点。这些差异影响开发者如何构建提示词和优化性能。对于使用Claude或OpenAI API的开发者,理解这些差异有助于更高效地设计对话系统和控制成本。
AI产品OpenAIAnthropicAPI设计缓存机制System消息

推荐理由:API设计差异直接影响提示词效果和缓存成本,用Claude或OpenAI的开发者建议看看,能帮你少踩坑。
原文
精选全部日报登录