09:39arXiv cs.AI@Xin Su, Dawid Majchrowski, Fangyuan Yu, Vanshil Atul Shah, Sebastian Rogawski, Pawel Morkisz, Anahita Bhiwandiwalla, Phillip Howard大语言模型的自回归生成成本高昂,推测解码通过草拟多个token并一次性验证来加速,但加速效果取决于草稿被接受的长度。无参数草稿源在结构化任务和智能体工作流中能以低成本生成长序列,但缓存匹配的收益在不同步骤间波动。本文提出Hybrid Verified Decoding,在验证前预测缓存草稿的接受长度,并据此选择缓存验证或基于模型的草稿器。在三个LLM和十六个数据集上,该方法在智能体工作流中表现尤为突出,平均加速2.73倍,全面超越EAGLE3。分析揭示了提示结构如何创造缓存机会、高收益缓存草稿如何集中在少数区域,以及收益引导的选择如何减少顺序解码工作量。论文推测解码推理加速智能体工作流缓存机制EAGLE3推荐理由:做LLM推理加速的团队终于有了一个能动态分配验证资源的方案——在智能体工作流中平均加速2.73倍,比EAGLE3还强,搞推测解码的开发者值得点开看看具体实现。原文
11:46宝玉@dotey精选本文对比了OpenAI和Anthropic在API设计上的两个关键差异:一是system消息权重不同,OpenAI对system消息权重较低,而Claude对其权重很高;二是缓存机制不同,OpenAI自动缓存,Anthropic需要手动设置cache_control断点。这些差异影响开发者如何构建提示词和优化性能。对于使用Claude或OpenAI API的开发者,理解这些差异有助于更高效地设计对话系统和控制成本。AI产品OpenAIAnthropicAPI设计缓存机制System消息10 个信源在谈推荐理由:API设计差异直接影响提示词效果和缓存成本,用Claude或OpenAI的开发者建议看看,能帮你少踩坑。原文