11:40官方一手arXiv: Anthropic@Bowen Sun, Yixi Cai, Xiaogeng Liu, Zhengyue Zhao, Yinzhi Cao, Chaowei XiaoKeyPooling是一种测量方法,可追踪客户身份通过缓存查找和写入的路径。研究测试了五个连接OpenAI和Anthropic的开源网关,发现默认情况下没有将客户绑定到上游凭据。在共享凭据下,所有五个网关都暴露了跨客户的缓存读取,覆盖了OpenRouter框架中33.7%的令牌量。研究确定了控制身份转换的关键因素,包括主体分割、命名空间关联和适配器对比。论文KeyPoolingLLM API缓存隔离10 个信源在谈事件专题推荐理由:这篇论文揭示了LLM API中继路径中的缓存隔离漏洞,测试了五个开源网关,提出了防御契约。原文稍后读已读值得跟进有用关注 KeyPooling
03:25elvis@omarsar0Thesean 发布了 Ship 端点的测试版,通过修改 model="original" 为 model="ship-like/original",每次请求固定降低 50% 成本。Ship 保留原有模型的提示词、输出格式和工具行为,在幕后选择最高效的运行方式并匹配原模型质量。如果请求执行成本高于用户支付,Thesean 承担差额。用户可选择削减账单或保持预算不变,运行两倍的智能体、重试和验证来提升输出质量。Ship 已支持 Opus 和 GPT 5.6 Sol,提供 50% 的保证节省和质量 SLA。AI产品TheseanShip成本优化推荐理由:Thesean 的 Ship 让你的 LLM 调用费直接砍半,还能保留原模型名和质量,省下来的钱可以跑更多实验,实用。原文稍后读已读值得跟进有用关注 Thesean
09:22官方账号arXiv cs.AI@Alexandre Belloni, Yan Chen, Yehua Wei该论文提出了一种在线上下文潘多拉魔盒模型,用于自适应查询和选择LLM API。决策者在每个周期观察请求上下文,面临两阶段决策:查询阶段顺序调用API并产生输出相关成本,选择阶段从生成的输出中选一个部署并观察下游奖励。与经典模型不同,该模型输出反馈结构不直接揭示奖励。研究者直接建模保留索引,结合广义矩估计和UCB置信界,实现了维度相关的√T累积遗憾。论文LLM API自适应查询潘多拉魔盒模型推荐理由:LLM API调用成本高、选择困难,这篇论文为开发者提供了理论驱动的自适应查询策略,做模型编排或API调度的团队可以直接参考其方法优化成本与效果。原文稍后读已读值得跟进有用关注 LLM API
08:39官方账号Together AI@togethercompute精选Together AI 的 DevRel 团队发布了一篇关于 LLM 推理引擎的入门指南,解释了 tokenization、调度、prefill、decode、KV 缓存、批处理和流式处理等关键组件如何影响 API 调用的速度、可扩展性和生产就绪性。这些底层系统决定了 AI 原生应用的体验质量。对于开发者而言,理解推理引擎有助于优化应用性能和成本。AI产品推理引擎LLM APITogether AI推荐理由:做 AI 原生应用开发的团队,理解推理引擎能帮你优化 API 调用成本和响应速度,建议点开这篇入门指南。原文稍后读已读值得跟进有用关注 推理引擎