8月18日
8月15日
19:32
8月14日
02:20
02:20官方账号Perplexity@perplexity_ai
精选
Perplexity 发布了两批 Search SDK 更新,用于 Computer 环境。更新后,模型执行可靠性从 81.9% 提升到 92.6%。更高的可靠性让模型能更稳定地完成动作编排。该更新强调 SDK 的形态直接决定了模型的调用能力。

推荐理由:Perplexity 把 Search SDK 的执行可靠性从 81.9% 拉到 92.6%,做智能体编排的更稳了。
8月13日
17:49
17:49官方账号arXiv cs.AI@Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor
精选
研究人员推出VAKRA基准,包含62个领域的8000多个可执行API,用于测试智能体在工具使用策略约束下的多跳推理。最佳模型在单跳端点任务上准确率只有70.4%,在组合API任务上降至50-51%。当推理深度增加时,模型性能下降超过50%。在策略约束的不可回答查询上,部分模型准确率低至2.4%。错误分析显示,失败主要集中在实体消歧和跨源信息对齐等语言中介推理环节。
推荐理由:IBM新基准VAKRA,测API和文档多跳推理,最强70.4%,多跳掉一半,暴露AI短板。
8月7日
8月6日
21:49
21:49OpenRouter@OpenRouterAI
OpenRouter发布两个基于真实花费份额的任务排行榜。Shell执行任务中,DeepSeek V4 Pro排名第一。工具调度任务中,Kimi K3占据首位。两个榜单均由开放模型登顶。
事件专题

推荐理由:OpenRouter按真实花费给模型排名,DeepSeek V4 Pro拿下Shell执行第一,Kimi K3拿下工具调度第一,开放模型领先。
7月29日
01:06
01:06Philipp Schmid@_philschmid
72°
Google AI Studio 新增 Gemini 3.6 Flash 作为默认模型,并允许用户自定义模型。新增工具执行前后钩子(pre/post hooks),可注入自定义逻辑。引入 token 预算上限防止失控循环。支持远程 Cron 定时触发智能体调用。所有功能在 Gemini API 免费层中可用。
推荐理由:Google AI Studio 现在默认用 Gemini 3.6 Flash,还能自定义模型、加工具钩子、设预算防止跑飞,甚至远程定时调度,免费层就能用。
7月18日
22:19
22:19berryxia@berryxia
精选73°
Google更新Gemma 4,修复历史轮次处理、思考保留、工具输出延续和工具调用一致性问题。预填充速度提升25-70%。Unsloth跟进发布GGUF、MLX和NVFP4量化版本,支持本地部署。此次更新解决了Gemma之前工具调用不稳定或卡住的痛点。
事件专题

推荐理由:Google刚修了Gemma 4工具调用的老毛病,速度还快了25-70%,Unsloth立马出了量化版能本地跑,做Agent的兄弟可以试试。
7月17日
7月16日
17:22
17:22官方账号Decoder@Jonathan Kemper
Google对其开源模型Gemma 4进行了一次静默更新。更新修复了工具调用中的错误,并解决了回复被截断的问题。新版本在Nvidia Hopper GPU上的运行性能有所提升。此次更新沿用原名,未改变版本号。
事件专题

推荐理由:Google悄悄修了Gemma 4的bug,工具调用更稳,回复不截断,还在Hopper GPU上跑更快。
7月14日
23:35
23:35官方账号LangChain@LangChainAI
精选
LangChain 为 LangSmith 构建了 Codex 会话追踪插件。用户只需两个配置块和一个标志即可启用。该插件会记录每个回合的工具调用、token 使用量和子代理线程。所有追踪数据以 LangSmith 真实追踪形式呈现,方便开发者深入调试。
推荐理由:LangChain 把 Codex 会话追踪直接集成到 LangSmith 了,配置超简单,调试智能体流程更方便。
7月10日
01:48
01:48官方账号Simon Willison’s Weblog博客/媒体
精选
llm 0.31.1 版本修复了 OpenAI Chat Completion 端点中工具调用参数为空时可能引发 JSON 错误的 bug。该问题源自 issue #1521,在测试 llm-meta-ai 时被发现。此修复解决了某些提供者无法处理空参数字符串的情况。
事件专题

推荐理由:Simon Willison 的 llm 工具发布了 0.31.1,专门修了一个 bug:调用 OpenAI 工具时,空参数不再导致 JSON 报错,测试更稳定了。
6月30日
01:33
01:33官方一手AWS Machine Learning Blog@Joshua Lacy
精选
本文介绍如何使用Amazon Bedrock AgentCore的内置可观测性功能调试生产环境中的智能体故障。文章涵盖常见的故障模式,如无限循环和工具调用失败。通过追踪和指标分析智能体行为,并提供结构化工作流来解决问题。本文是两部分系列的第一部分,第二部分将讨论性能优化和内存管理。
推荐理由:AWS博客教你用Bedrock AgentCore内置观察功能排查生产智能体故障,比如无限循环和工具调用失败,省去自己搭建监控的麻烦。
6月24日
22:46
22:46官方账号LangChain@LangChainAI
精选
Jeff Barg在Interrupt会议上透露,Clay每月运行3.5亿个GTM智能体。他指出,缓存可将LLM调用成本降低高达70%。限制工具调用范围不仅能节省成本,还能提升输出质量。在多租户负载下,引入公平队列机制至关重要。
推荐理由:做AI智能体上线的小伙伴必看,Clay的AI负责人亲自讲了怎么降本70%和优化队列,干货12分钟。
00:33
00:33Philipp Schmid@_philschmid
精选71°
这篇指南由 Google AI Studio 发布,帮助开发者上手 Gemini Interactions API。它通过 `previous_interaction_id` 实现对话链式衔接,演示了如何启用和处理 streaming 响应。指南还展示了执行本地函数调用的完整循环,并介绍了在远程沙箱中运行 Antigravity Agent 的方法。
推荐理由:Google 官方出的 Gemini 交互 API 教程,从 streaming 到 agent 沙箱都有代码示例,想写多轮工具调用可以看这个。
6月23日
05:06
05:06官方账号LangChain@LangChainAI
精选
Deep Agents v0.6 新增代码解释器,代理可在运行时调用工具。中间结果保留在模型上下文之外,仅传回相关输出。这减少了往返次数和 token 浪费。该版本由 LangChain 发布。

推荐理由:Deep Agents v0.6 出代码解释器了!运行时调工具,中间结果不占上下文,省 token 还少跑几趟。看详情。
6月11日