AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

LLM API

共 4 条相关 AI 资讯
8月19日
11:40
11:40官方一手arXiv: Anthropic@Bowen Sun, Yixi Cai, Xiaogeng Liu, Zhengyue Zhao, Yinzhi Cao, Chaowei Xiao
KeyPooling是一种测量方法,可追踪客户身份通过缓存查找和写入的路径。研究测试了五个连接OpenAI和Anthropic的开源网关,发现默认情况下没有将客户绑定到上游凭据。在共享凭据下,所有五个网关都暴露了跨客户的缓存读取,覆盖了OpenRouter框架中33.7%的令牌量。研究确定了控制身份转换的关键因素,包括主体分割、命名空间关联和适配器对比。
论文KeyPoolingLLM API缓存隔离
事件专题

推荐理由:这篇论文揭示了LLM API中继路径中的缓存隔离漏洞,测试了五个开源网关,提出了防御契约。
原文
7月22日
03:25
03:25elvis@omarsar0
Thesean 发布了 Ship 端点的测试版,通过修改 model="original" 为 model="ship-like/original",每次请求固定降低 50% 成本。Ship 保留原有模型的提示词、输出格式和工具行为,在幕后选择最高效的运行方式并匹配原模型质量。如果请求执行成本高于用户支付,Thesean 承担差额。用户可选择削减账单或保持预算不变,运行两倍的智能体、重试和验证来提升输出质量。Ship 已支持 Opus 和 GPT 5.6 Sol,提供 50% 的保证节省和质量 SLA。
AI产品TheseanShip成本优化

推荐理由:Thesean 的 Ship 让你的 LLM 调用费直接砍半,还能保留原模型名和质量,省下来的钱可以跑更多实验,实用。
原文
6月8日
09:22
09:22官方账号arXiv cs.AI@Alexandre Belloni, Yan Chen, Yehua Wei
该论文提出了一种在线上下文潘多拉魔盒模型,用于自适应查询和选择LLM API。决策者在每个周期观察请求上下文,面临两阶段决策:查询阶段顺序调用API并产生输出相关成本,选择阶段从生成的输出中选一个部署并观察下游奖励。与经典模型不同,该模型输出反馈结构不直接揭示奖励。研究者直接建模保留索引,结合广义矩估计和UCB置信界,实现了维度相关的√T累积遗憾。
论文LLM API自适应查询潘多拉魔盒模型

推荐理由:LLM API调用成本高、选择困难,这篇论文为开发者提供了理论驱动的自适应查询策略,做模型编排或API调度的团队可以直接参考其方法优化成本与效果。
原文
5月29日
08:39
08:39官方账号Together AI@togethercompute
精选
Together AI 的 DevRel 团队发布了一篇关于 LLM 推理引擎的入门指南,解释了 tokenization、调度、prefill、decode、KV 缓存、批处理和流式处理等关键组件如何影响 API 调用的速度、可扩展性和生产就绪性。这些底层系统决定了 AI 原生应用的体验质量。对于开发者而言,理解推理引擎有助于优化应用性能和成本。
AI产品推理引擎LLM APITogether AI

推荐理由:做 AI 原生应用开发的团队,理解推理引擎能帮你优化 API 调用成本和响应速度,建议点开这篇入门指南。
原文
精选全部日报登录