#工具调用
DoorDash 分享了落地 AI 购物助手的实操经验,重点在工具调用和记忆系统,不是只靠模型,做电商或生活服务 AI 的同学值得看
LangChain 把 Codex 会话追踪直接集成到 LangSmith 了,配置超简单,调试智能体流程更方便。
OpenAI出了三个价位的GPT-5.6,最贵的Sol编程跑分居然超了Claude Fable 5,还加了省token的自动调用工具功能,想比差距的可以看看
Simon Willison 的 llm 工具发布了 0.31.1,专门修了一个 bug:调用 OpenAI 工具时,空参数不再导致 JSON 报错,测试更稳定了。
Meta 给 Muse Spark 1.1 加了 API,工具调用和电脑操控都更强了,还有自对话的玄学彩蛋,玩起来挺有意思。
Thariq讲得实际:别死磕提示词,让模型用工具。Claude Code砍掉80%提示词后反而更强,还给了盲区扫描等具体玩法,值得一看。
Armin 用实际 bug 案例拆解了 Claude 新模型在工具调用上的奇怪倒退,解释了为什么更强的模型反而更不听话,读起来很爽。
AWS博客教你用Bedrock AgentCore内置观察功能排查生产智能体故障,比如无限循环和工具调用失败,省去自己搭建监控的麻烦。
手把手教你用 Colab 搞定 Fable 5 Traces 数据,从解析到审计再到训练基线,全流程避坑实战。
手把手教你用 Colab 搭一个能调用工具、记住对话的 AI 智能体,还把 MCP 服务器也揉进去了,代码全开源。
Google 官方出的 Gemini 交互 API 教程,从 streaming 到 agent 沙箱都有代码示例,想写多轮工具调用可以看这个。
这篇论文提出了LedgerAgent,用独立账本管理状态,防止智能体用过时信息或违反政策,在多个客服场景和模型上明显提升工具调用的准确率。
Liquid 这个 8B MoE 模型只用 4.8GB 内存就比 OpenAI 20B 模型多调用了一倍工具,速度还快两倍,本地跑 agent 任务很实用。
做 AI 智能体的开发者终于有了运行时安全网——用代码定义策略来防止工具调用失控,比事后补救靠谱太多,建议直接集成到你的 agent 工作流里。
做AI智能体强化学习的团队终于有了更精细的信用分配方法——APPO在13个基准上稳定提升4个点,且不牺牲效率,做多轮工具调用优化的开发者值得一试。
LangChain 的 Deep Agents 解决了构建长周期、多步骤智能体的痛点,做自动化流程或复杂任务编排的开发者可以直接上手试试。
做智能体开发和评测的团队终于有了一个贴近真实工作场景的排行榜——Agent Arena 用 30 万+ 任务和 200 万+ 工具调用数据,告诉你哪个模型在写代码、做研究、处理文档时真正靠谱,值得点开看看你的模型排第几。
企业 AI 智能体评估终于有了更贴近真实场景的基准——3 领域 121 工具覆盖 IT、HR、客服,做企业级 AI 落地的团队可以直接用这个数据集来测试自己的智能体。
做城市模拟、交通规划或政策分析的团队,终于有了一个无需训练就能解释预测结果的方案——AgentMob 在模糊场景下准确率提升 18%,建议直接试一下开源代码。
Claude Code 重度用户注意了——4.8 版本的解析 bug 会打断你的自动化流程,遇到类似问题的开发者可以看看评论区是否有临时方案。
Qwen3.7-Plus把视觉、推理和工具调用整合到一个模型里,做多模态应用的开发者可以直接在百炼平台体验,省去拼接多个模型的麻烦。
做AI代理安全与隐私的开发者会关心——投机执行加速了响应,却让用户意图裸奔给外部服务,这篇论文给出了可落地的运行时方案,值得研究隐私工程的团队细读。
Qwen3.7-Plus 把多模态 Agent 的实用门槛又拉低了一截,做自动化工作流或 GUI 操作的开发者可以直接关注,性价比和功能覆盖都很能打。
做本地 AI 智能体或工具调用开发的团队,这个对比直接告诉你:模型大小不是关键,控制能力才是。LFM2.5-8B-A1B 的性价比碾压,值得在本地部署试试。
Hermes Agent 的 Tool Search 解决了智能体工具冗余加载的痛点,做 Agent 开发的团队可以直接参考实现,提升任务执行效率。
本地 Agent 开发者终于不用等大模型了——1.5B 活跃参数就能跑出接近 4 倍参数模型的效果,笔记本就能部署,隐私和延迟都解决了,做本地自动化的建议直接试。
做智能体开发的团队终于有了一个原生支持工具调用且速度极快的开源模型——400 tokens/s 的推理速度能显著提升任务执行效率,建议直接上手测试。
端侧部署大模型一直受限于算力和内存,LFM2.5-8B-A1B 用 1.5B 激活参数实现 128K 上下文和工具调用,做移动端 AI 应用或边缘推理的开发者可以直接评估其性能。