10:11官方一手Pandaily@contact@pandaily.com (Pandaily)DeepSeek Harness 发布 v0.1.0 - rc.8 更新,为自公开测试版以来的首次重要更新;本次更新包含 14 项变更,涉及多模态输入与子代理协作等方面;新增原生图像请求与混合文本图像输入功能,使代理能够处理截图;还通过 OCR 与像素分析实现‘视觉’功能,让原本仅支持文本的模型也能‘看见’;AI模型DeepSeek Harness多模态子代理3 个信源在谈事件专题推荐理由:DeepSeek Harness 推出 v0.1.0 - rc.8 更新,加了图像请求和多模态功能,比之前能处理更多内容的了。原文稍后读已读值得跟进有用关注 DeepSeek Harness
03:31官方账号Cursor@cursor_ai精选Cursor这款AI模型现调整为在操作过程中等待下一个工具调用指令,不再中途终止动作。该功能更新后支持连续的工具调用序列,提升交互完整性。与之前版本相比,现在可在完成整个工具调用后才切换到下一步操作。AI模型Cursor工具调用提示词工程5 个信源在谈事件专题推荐理由:Cursor这AI调整了工具调用流程,现在等下个工具指令才结束动作,比之前更顺畅啦。原文稍后读已读值得跟进有用关注 Cursor
00:07宝玉@dotey精选78°Jason Wei在推文中反驳了“小模型加工具就能达到大模型智能”的观点。他认为,虽然理论上1B参数模型配合工具能完成任何任务,但实际体验差距明显。他提出三点理由:速度上直接回答远快于工具调用;理解深度上大模型能基于海量数据给出综合判断,而小模型只能搬运搜索结果;可靠性上每次重新查找和推导更容易出错。他以羽毛球训练类比,强调内化知识的重要性,并引用“苦涩的教训”支持扩大规模优于精巧设计。技巧Jason Wei小模型工具调用推荐理由:Jason Wei用羽毛球比喻讲透了为什么小模型加工具撑不起顶级智能,三点理由很实在,值得一看。原文稍后读已读值得跟进有用关注 Jason Wei
00:21官方一手@OpenAIDevs@OpenAIDevs精选OpenAI开发者团队总结了初创公司用GPT-5.6构建智能体的实践经验。核心是通过更精准的模型选择、推理策略和工具调用降低Agent成本。团队发现,让模型在复杂任务中自主决定何时调用工具,能减少无效计算。这些经验来自多个行业的实际部署,而非实验室基准。技巧GPT-5.6OpenAI智能体8 个信源在谈事件专题推荐理由:OpenAI官方分享了用GPT-5.6做智能体的省钱打法,从选模型到调工具都有,做Agent的可以学几招。原文稍后读已读值得跟进有用关注 GPT-5.6
19:32官方一手marktechpost@Sana Hassan精选教程展示了基于XYZ-Aquila-SFT和Qwen3搭建工具调用模型微调流程。内容涵盖轨迹解析、结构化工具调用提取以及Qwen兼容的ChatML渲染。最后使用PyTorch实现LoRA高效参数适配。技巧XYZ-Aquila-SFTQwen3微调推荐理由:想自己做工具调用模型?这篇手把手教你用XYZ-Aquila-SFT和Qwen3微调,从数据到LoRA都有。原文稍后读已读值得跟进有用关注 XYZ-Aquila-SFT
04:11Harrison Chase@hwchase1779°LangChain OSS发布新版本,新增对OpenAI 3.0 SDK(基于httpx2)的支持,并兼容gemini-3.7-flash。工具调用和结构化输出功能得到增强,错误提示更清晰,且验证时尊重pydantic别名。流式处理时token用量回调错误及OpenRouter成本元数据问题已修复。针对异常Anthropic内容块增加了防护,同时保留提示词模板中的非字符串与非字典项。AI产品LangChainOpenAIGemini10 个信源在谈事件专题推荐理由:LangChain出新版了,接上了OpenAI 3.0 SDK,还支持Gemini 3.7 Flash,修了一堆工具调用的坑,用起来更稳。原文稍后读已读值得跟进有用关注 LangChain
02:20官方账号Perplexity@perplexity_ai精选Perplexity 发布了两批 Search SDK 更新,用于 Computer 环境。更新后,模型执行可靠性从 81.9% 提升到 92.6%。更高的可靠性让模型能更稳定地完成动作编排。该更新强调 SDK 的形态直接决定了模型的调用能力。AI产品PerplexitySearch SDK智能体推荐理由:Perplexity 把 Search SDK 的执行可靠性从 81.9% 拉到 92.6%,做智能体编排的更稳了。原文稍后读已读值得跟进有用关注 Perplexity
17:49官方账号arXiv cs.AI@Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor精选研究人员推出VAKRA基准,包含62个领域的8000多个可执行API,用于测试智能体在工具使用策略约束下的多跳推理。最佳模型在单跳端点任务上准确率只有70.4%,在组合API任务上降至50-51%。当推理深度增加时,模型性能下降超过50%。在策略约束的不可回答查询上,部分模型准确率低至2.4%。错误分析显示,失败主要集中在实体消歧和跨源信息对齐等语言中介推理环节。论文VAKRAIBM智能体推荐理由:IBM新基准VAKRA,测API和文档多跳推理,最强70.4%,多跳掉一半,暴露AI短板。原文稍后读已读值得跟进有用关注 VAKRA
08:28官方账号Simon Willison’s Weblog(博客/媒体)精选Meta 发布新模型 Muse Glimmer,参数量 30B,采用 Apache 2.0 许可证。它在 DeepSearch QA、MCP-Atlas、τ-Bench 和 SWE-Bench 等基准上实现高成功率,可完成搜索问答、工具调用与代码调试。该模型支持视觉输入,作者用 LM Studio 的 18.16 GB 量化版本实测了代码库问答和图像描述。Muse Glimmer 在 32GB 内存设备上运行后仍留有余量,适合本地部署。AI模型Muse GlimmerMeta开源模型推荐理由:Meta 出了个 30B 开源模型,能自己调工具写代码,还能看图,Apache 2.0 随便用,跑得动。原文稍后读已读值得跟进有用关注 Muse Glimmer
04:11Gary Marcus@GaryMarcus精选Gary Marcus 在 X 上吐槽,自己 2001 年就写过神经符号 AI 的原始定义,却被没读过的人教育。争议点是编码工具调用(coding harness)是否算神经符号 AI。Marcus 认为在 LLM 中嵌入并执行 WASM 更接近他 2003 年以来的相关实验。他贴出的链接指向 ChristosTzamos 的讨论。论文Gary Marcus神经符号AIWASM推荐理由:Gary Marcus 在线怼人,翻出自己 2001 年的论文说对方没读过定义。想围观神经符号 AI 的考古级争论就看这条。原文稍后读已读值得跟进有用关注 Gary Marcus
21:49OpenRouter@OpenRouterAIOpenRouter发布两个基于真实花费份额的任务排行榜。Shell执行任务中,DeepSeek V4 Pro排名第一。工具调度任务中,Kimi K3占据首位。两个榜单均由开放模型登顶。AI模型DeepSeek V4 ProKimi K3OpenRouter10 个信源在谈事件专题推荐理由:OpenRouter按真实花费给模型排名,DeepSeek V4 Pro拿下Shell执行第一,Kimi K3拿下工具调度第一,开放模型领先。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
01:06Philipp Schmid@_philschmid72°Google AI Studio 新增 Gemini 3.6 Flash 作为默认模型,并允许用户自定义模型。新增工具执行前后钩子(pre/post hooks),可注入自定义逻辑。引入 token 预算上限防止失控循环。支持远程 Cron 定时触发智能体调用。所有功能在 Gemini API 免费层中可用。AI产品Gemini 3.6 FlashGoogle AI Studio智能体推荐理由:Google AI Studio 现在默认用 Gemini 3.6 Flash,还能自定义模型、加工具钩子、设预算防止跑飞,甚至远程定时调度,免费层就能用。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
02:52elvis@omarsar0LLaDA 2.2 是首个大规模扩散语言模型,能够作为智能体自主完成规划、工具调用和错误修正。它在长多轮对话轨迹中保持稳定表现,并凭借块并行解码实现更快推理速度。该模型标志着扩散模型从静态生成向主动代理任务的关键跨越。AI模型LLaDA扩散语言模型智能体推荐理由:可以把扩散模型当成真智能体用,规划工具自己纠错,解码还比自回归快,不试试?原文稍后读已读值得跟进有用关注 LLaDA
04:35Claude@claudeaiClaude的语音对话功能现在可以使用更多现有聊天模型,包括Claude Opus和Sonnet。用户可以在对话中途调用已连接的工具,如邮箱和日历。这一更新提升了语音交互的灵活性和实用性。推文发布于X平台,获得244次点赞和33次分享。AI产品ClaudeClaude OpusSonnet1 个信源在谈事件专题推荐理由:Claude语音现在能用Opus和Sonnet模型,还能中途调工具,发邮件查日历更顺手了。原文稍后读已读值得跟进有用关注 Claude
04:33Claude@claudeai72°Claude 语音模式现已基于更强大的模型运行,支持用户在对话中途调用已连接的工具(如代码解释器、搜索等)。该功能支持更多语言,可边说话边解决复杂问题。Anthropic 在 X 平台宣布此更新,获得 3229 次点赞。AI产品ClaudeAnthropic语音模式10 个信源在谈事件专题推荐理由:Claude 的语音模式现在能边聊边调用工具,还支持更多语言,解决复杂问题更顺手了。原文稍后读已读值得跟进有用关注 Claude
22:19berryxia@berryxia精选73°Google更新Gemma 4,修复历史轮次处理、思考保留、工具输出延续和工具调用一致性问题。预填充速度提升25-70%。Unsloth跟进发布GGUF、MLX和NVFP4量化版本,支持本地部署。此次更新解决了Gemma之前工具调用不稳定或卡住的痛点。AI模型Gemma 4GoogleUnsloth3 个信源在谈事件专题推荐理由:Google刚修了Gemma 4工具调用的老毛病,速度还快了25-70%,Unsloth立马出了量化版能本地跑,做Agent的兄弟可以试试。原文稍后读已读值得跟进有用关注 Gemma 4
03:39官方一手AWS Machine Learning Blog@Melanie LiGrok 4.3现已上线Amazon Bedrock。该模型支持可配置的推理努力(reasoning effort)、工具调用(tool calling)和结构化输出。它还能处理图像输入并支持有状态的多轮对话。这些能力使其适用于智能体和企业级工作负载。AI模型GrokAmazon Bedrock智能体推荐理由:Grok 4.3上Bedrock了,支持工具调用和图像输入,做智能体应用很顺手。原文稍后读已读值得跟进有用关注 Grok
17:22官方账号Decoder@Jonathan KemperGoogle对其开源模型Gemma 4进行了一次静默更新。更新修复了工具调用中的错误,并解决了回复被截断的问题。新版本在Nvidia Hopper GPU上的运行性能有所提升。此次更新沿用原名,未改变版本号。AI模型Gemma 4GoogleNvidia Hopper10 个信源在谈事件专题推荐理由:Google悄悄修了Gemma 4的bug,工具调用更稳,回复不截断,还在Hopper GPU上跑更快。原文稍后读已读值得跟进有用关注 Gemma 4
15:59小互@imxiaohu精选DoorDash 自2026年6月起连续发布三篇工程博客,详解刚上线的 AI 购物助手 Ask DoorDash。其运行时架构分为四层,业务逻辑单独沉淀在一层中,不写入提示词。系统依赖记忆系统来跟踪用户偏好和历史订单,并用评测框架保障上线质量。该助手能通过自然语言理解用户需求,支持餐厅搜索、三餐规划、购物车生成等功能。技巧DoorDashAsk DoorDash智能体推荐理由:DoorDash 分享了落地 AI 购物助手的实操经验,重点在工具调用和记忆系统,不是只靠模型,做电商或生活服务 AI 的同学值得看原文稍后读已读值得跟进有用关注 DoorDash
23:35官方账号LangChain@LangChainAI精选LangChain 为 LangSmith 构建了 Codex 会话追踪插件。用户只需两个配置块和一个标志即可启用。该插件会记录每个回合的工具调用、token 使用量和子代理线程。所有追踪数据以 LangSmith 真实追踪形式呈现,方便开发者深入调试。AI产品LangSmithCodexLangChain推荐理由:LangChain 把 Codex 会话追踪直接集成到 LangSmith 了,配置超简单,调试智能体流程更方便。原文稍后读已读值得跟进有用关注 LangSmith
04:52官方一手marktechpost@Michal Sutter81°OpenAI于2026年7月9日推出GPT-5.6,包含Sol、Terra、Luna三个档次。Sol定价为$5/$30每百万输入/输出token,在Artificial Analysis Coding Agent Index上以80分领先Claude Fable 5达2.8分,并在OSWorld 2.0上达到62.6%,比Opus 4.8少用85%输出token。新功能Programmatic Tool Calling在隔离V8运行时执行JavaScript,减少Clio 38%的prompt tokens和PlayCo 63.5%的总tokens。但Claude Fable 5仍在Artificial Analysis Intelligence Index、GDPval-AA v2和Toolathlon上领先,Mythos 5在SWE-Bench Pro领先约15分。AI模型GPT-5.6OpenAISol10 个信源在谈事件专题推荐理由:OpenAI出了三个价位的GPT-5.6,最贵的Sol编程跑分居然超了Claude Fable 5,还加了省token的自动调用工具功能,想比差距的可以看看原文稍后读已读值得跟进有用关注 GPT-5.6
01:48官方账号Simon Willison’s Weblog(博客/媒体)精选llm 0.31.1 版本修复了 OpenAI Chat Completion 端点中工具调用参数为空时可能引发 JSON 错误的 bug。该问题源自 issue #1521,在测试 llm-meta-ai 时被发现。此修复解决了某些提供者无法处理空参数字符串的情况。AI产品llmOpenAI工具调用10 个信源在谈事件专题推荐理由:Simon Willison 的 llm 工具发布了 0.31.1,专门修了一个 bug:调用 OpenAI 工具时,空参数不再导致 JSON 报错,测试更稳定了。原文稍后读已读值得跟进有用关注 llm
00:49官方账号Simon Willison’s Weblog(博客/媒体)精选Meta 推出 Muse Spark 1.1,这是 Spark 系列首个提供 API 的模型。相比 4 月的初始版本,该模型在 agentic tool calling 和 computer use 方面有显著改进。Meta 发布了 Muse Spark 1.1 评估报告,其中包含“自对话中的吸引子状态”实验,两个模型副本对话会产生类似“我的整个存在是一个等候室”的表述。开发者可通过 llm-meta-ai 插件在命令行或 Python 中调用该模型。AI模型Muse Spark 1.1Meta智能体推荐理由:Meta 给 Muse Spark 1.1 加了 API,工具调用和电脑操控都更强了,还有自对话的玄学彩蛋,玩起来挺有意思。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
15:53宝玉@dotey76°Thariq Shihipar在AI Engineer World's Fair演讲中提出,模型能力存在“悬余”——例如问宝可梦名字以aw结尾,模型无法直接回答,但借助代码执行工具两秒内就能找出结果。他透露Claude Code砍掉了80%的系统提示词,因为Fable级别模型自身想象力比示例更丰富,应给上下文而非约束。他还建议让模型做“盲区扫描”、一口气生成四种不同原型,并通过提问挖掘用户未写明的细节。技巧Claude CodeAnthropic工具调用10 个信源在谈事件专题推荐理由:Thariq讲得实际:别死磕提示词,让模型用工具。Claude Code砍掉80%提示词后反而更强,还给了盲区扫描等具体玩法,值得一看。原文稍后读已读值得跟进有用关注 Claude Code
08:30官方一手@OpenAIDevs@OpenAIDevsOpenAI 发布了 GPT-Realtime-2.1-mini 新模型,其 API 现已可用。该模型在 Realtime mini 系列中新增了推理能力和工具调用功能。定价与原有的 GPT-Realtime-mini 相同,开发者无需额外付费。AI模型GPT-Realtime-2.1-miniOpenAI推理模型10 个信源在谈事件专题推荐理由:OpenAI 新推 mini 实时模型,能推理还能调用工具,价格不变,适合实时场景开发。原文稍后读已读值得跟进有用关注 GPT-Realtime-2.1-mini
12:46shao__meng@shao__meng精选71°Flask/Sentry 工程师 @mitsuhiko 发现,Claude Opus 4.8 与 Sonnet 5 在调用 Pi 的嵌套 edits[] 工具时,会在 edit 对象末尾产生 requireUnique、type、id 等虚构字段,导致 schema 校验失败。此问题在单轮 prompt 下不出现,在长 agentic 历史中复现率约 20%。去掉历史中的 thinking 块后失败率减半,开启 strict 模式后问题消失。作者推测根因是 Anthropic 的 RL 后训练在 Claude Code 的 forgiving harness 中进行,该 harness 接受参数别名和未知键,导致模型学到“edit 操作可多带可选字段”的先验。相比之下,OpenAI 的 harmony 路线在 prompt 中显式标记 JSON 边界并支持约束采样,未出现此回归。AI模型Claude Opus 4.8Sonnet 5Anthropic10 个信源在谈事件专题推荐理由:Armin 用实际 bug 案例拆解了 Claude 新模型在工具调用上的奇怪倒退,解释了为什么更强的模型反而更不听话,读起来很爽。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
07:28官方账号Simon Willison’s Weblog(博客/媒体)精选Armin报告在Pi编程工具中发现异常:Claude Opus 4.8和Sonnet 5调用编辑工具时,会在edits[]数组中添加不存在的字段,导致工具调用被Pi拒绝。旧版本模型(如Haiku)未出现此问题。Armin推测原因是新模型通过强化学习被训练为更适配Claude Code的内置编辑工具,从而牺牲了对第三方工具模式的兼容。这一现象提示第三方工具可能需要为不同模型实现多种编辑工具以获得最佳效果。行业ClaudeAnthropicPi10 个信源在谈事件专题推荐理由:Armin发现新版Claude模型反而在Pi里用编辑工具时会乱加字段,旧版反而正常。这是模型训练方向影响第三方工具的真实案例。原文稍后读已读值得跟进有用关注 Claude
14:53向阳乔木@vista8精选MCP是目前唯一在协议层考虑人在回路的方案,支持回传会话、UI嵌入、等待人操作等特性。API适合90%的场景,内置接口描述和状态元信息有助于Agent决策。CLI现在最好用,具有强大的可组合性和本地调试能力,但依赖Unix shell环境,存在命令卡死等问题,长期是死路。技巧MCPAPICLI1 个信源在谈事件专题推荐理由:vista8帮你理清了MCP、API、CLI各自适合什么场景,选哪种工具调用方式不再纠结。原文稍后读已读值得跟进有用关注 MCP
01:33官方一手AWS Machine Learning Blog@Joshua Lacy精选本文介绍如何使用Amazon Bedrock AgentCore的内置可观测性功能调试生产环境中的智能体故障。文章涵盖常见的故障模式,如无限循环和工具调用失败。通过追踪和指标分析智能体行为,并提供结构化工作流来解决问题。本文是两部分系列的第一部分,第二部分将讨论性能优化和内存管理。技巧Amazon BedrockAgentCore可观测性推荐理由:AWS博客教你用Bedrock AgentCore内置观察功能排查生产智能体故障,比如无限循环和工具调用失败,省去自己搭建监控的麻烦。原文稍后读已读值得跟进有用关注 Amazon Bedrock
15:15官方一手marktechpost@Sana Hassan精选本教程基于 Hugging Face 的 Fable 5 Traces 数据集,在 Colab 中构建稳定工作流。手动解析合并的 JSONL 文件避免依赖问题,检查仓库文件并标准化工具调用。通过审计结构、脱敏密钥和可视化分布,导出安全的无 CoT 聊天数据集。最后使用纯 Python 的朴素贝叶斯模型在 traces 上训练基线,无需复杂框架。技巧Fable 5 TracesColab工具调用推荐理由:手把手教你用 Colab 搞定 Fable 5 Traces 数据,从解析到审计再到训练基线,全流程避坑实战。原文稍后读已读值得跟进有用关注 Fable 5 Traces
16:09官方一手marktechpost@Sana Hassan本教程分步指导你在 Google Colab 中从零构建一个轻量级 AI 智能体,灵感来源于 Nanobot 架构。内容包括:实现提供者抽象层、注册工具调用功能、添加会话记忆管理、集成生命周期钩子、定义技能模块,以及部署一个 MCP 风格的工具服务器。全程不使用外部框架,让你理解消息、工具、记忆与模型响应的协作机制。最终得到一个可对接真实 LLM 提供者的智能体循环。技巧NanobotGoogle ColabMCP服务器推荐理由:手把手教你用 Colab 搭一个能调用工具、记住对话的 AI 智能体,还把 MCP 服务器也揉进去了,代码全开源。原文稍后读已读值得跟进有用关注 Nanobot
22:46官方账号LangChain@LangChainAI精选Jeff Barg在Interrupt会议上透露,Clay每月运行3.5亿个GTM智能体。他指出,缓存可将LLM调用成本降低高达70%。限制工具调用范围不仅能节省成本,还能提升输出质量。在多租户负载下,引入公平队列机制至关重要。技巧ClayGTM agentsLLM成本推荐理由:做AI智能体上线的小伙伴必看,Clay的AI负责人亲自讲了怎么降本70%和优化队列,干货12分钟。原文稍后读已读值得跟进有用关注 Clay
00:33Philipp Schmid@_philschmid精选71°这篇指南由 Google AI Studio 发布,帮助开发者上手 Gemini Interactions API。它通过 `previous_interaction_id` 实现对话链式衔接,演示了如何启用和处理 streaming 响应。指南还展示了执行本地函数调用的完整循环,并介绍了在远程沙箱中运行 Antigravity Agent 的方法。技巧Gemini Interactions APIGoogle智能体推荐理由:Google 官方出的 Gemini 交互 API 教程,从 streaming 到 agent 沙箱都有代码示例,想写多轮工具调用可以看这个。原文稍后读已读值得跟进有用关注 Gemini Interactions API
05:06官方账号LangChain@LangChainAI精选Deep Agents v0.6 新增代码解释器,代理可在运行时调用工具。中间结果保留在模型上下文之外,仅传回相关输出。这减少了往返次数和 token 浪费。该版本由 LangChain 发布。AI产品Deep AgentsLangChain代码解释器推荐理由:Deep Agents v0.6 出代码解释器了!运行时调工具,中间结果不占上下文,省 token 还少跑几趟。看详情。原文稍后读已读值得跟进有用关注 Deep Agents
14:36小互@imxiaohu豆包实时语音模型3.0 API 正式上线,支持全双工模式,可同时听和说并随时插话。采用端到端语音进语音出,无需转录,响应更快更自然。模型能精准遵循指令,例如在多人聊天中设定规则后静待话题出现再参与。支持自定义工具调用,可在实时对话中完成预定日历、发邮件、总结文档等任务,向语音 Agent 迈进。AI模型豆包实时语音模型3.0全双工推荐理由:豆包出了3.0语音模型,能同时听说、随时插话,还能在对话里调工具办事情,比传统语音助手强一大截。原文稍后读已读值得跟进有用关注 豆包
11:38官方账号arXiv cs.AI@Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta BaralLedgerAgent是一种推理时方法,维护工具调用智能体的观察任务状态在独立账本中,并渲染到提示中。该方法在执行环境变更工具调用前检查状态依赖策略约束,阻止违反。在四个客户服务领域和开源/闭源混合模型面板上,相比标准提示工具调用方法,平均pass^k提升。更严格的多试一致性指标下增益最大。论文LedgerAgent智能体工具调用推荐理由:这篇论文提出了LedgerAgent,用独立账本管理状态,防止智能体用过时信息或违反政策,在多个客服场景和模型上明显提升工具调用的准确率。原文稍后读已读值得跟进有用关注 LedgerAgent
12:59@atomic_chat_hq@atomic_chat_hq精选Liquid 的 LFM2.5-8B-A1B(8B总参、1B激活)在 MacBook Pro M5 Max 上本地运行,与 OpenAI 的 gpt-oss-20b 对比工具调用能力。面对需执行7个工具调用的旅行规划任务,LFM2.5-8B-A1B 全部成功,而 gpt-oss-20b 仅完成 3 个。内存方面,LFM2.5-8B-A1B 仅用 4.8 GB,远低于对手的 11 GB。速度上,LFM2.5-8B-A1B 达到 266 tok/s,总耗时 6.9 s,而 gpt-oss-20b 为 146 tok/s 和 15.0 s。该模型利用 38T 训练 token 的 MoE 架构,实现了小参数下的高效工具调用。AI模型LiquidLFM2.5-8B-A1Bgpt-oss-20b10 个信源在谈事件专题推荐理由:Liquid 这个 8B MoE 模型只用 4.8GB 内存就比 OpenAI 20B 模型多调用了一倍工具,速度还快两倍,本地跑 agent 任务很实用。原文稍后读已读值得跟进有用关注 Liquid
08:02AI SDK@aisdkAI SDK 推出新功能,允许开发者通过 Open Policy Agent 为智能体工具调用设置运行时防护栏。这些策略以代码形式定义,可在智能体执行过程中实时拦截和审核工具调用,防止其做出意外或危险的操作。该功能解决了 AI 智能体在生产环境中可能“失控”的核心安全问题,让开发者能更安全地部署自主代理。目前该功能已可用,适合需要精细控制智能体行为的团队。AI产品智能体安全/防护Open Policy Agent推荐理由:做 AI 智能体的开发者终于有了运行时安全网——用代码定义策略来防止工具调用失控,比事后补救靠谱太多,建议直接集成到你的 agent 工作流里。原文稍后读已读值得跟进有用关注 智能体
11:09官方账号arXiv cs.AI@Xucong Wang, Ziyu Ma, Yong Wang, Yuxiang Ji, Shidong Yang, Guanhua Chen, Pengkun Wang, Xiangxiang Chu精选72°APPO(Agentic Procedural Policy Optimization)是一种新的强化学习方法,旨在改进大语言模型智能体的多轮工具使用能力。传统方法在粗粒度的交互单元(如工具调用边界)上分配信用,难以识别影响最终结果的关键中间决策。APPO通过分支评分(Branching Score)在序列中细粒度地选择分支点,并结合程序级优势缩放(procedure-level advantage scaling)更精确地分配信用。实验表明,APPO在13个基准测试上平均提升近4个百分点,同时保持高效的工具调用和可解释性。这项研究解决了智能体强化学习中信用分配不精确的问题,对开发更可靠、高效的AI智能体具有重要意义。论文强化学习智能体工具调用推荐理由:做AI智能体强化学习的团队终于有了更精细的信用分配方法——APPO在13个基准上稳定提升4个点,且不牺牲效率,做多轮工具调用优化的开发者值得一试。原文稍后读已读值得跟进有用关注 强化学习
00:52lmarena.ai@lmarena_ai72°Agent Arena 团队指出,传统依赖人类偏好的评测方式无法扩展至智能体场景,因为人类难以判断30分钟轨迹中的数百次工具调用。他们构建了基于真实使用轨迹的客观信号评测方法,包括Bash错误、工具幻觉和“疯狂信号”等指标。这种方法能更准确地评估智能体在复杂任务中的表现,避免人类主观判断的局限性。该评测方法已应用于Agent Arena排行榜,为开发者提供更可靠的模型性能参考。AI模型智能体评测方法Agent Arena推荐理由:智能体评测一直是个难题,Agent Arena 用真实轨迹信号替代人类偏好,做智能体开发的团队可以直接参考这套方法论来改进自己的评测体系。原文稍后读已读值得跟进有用关注 智能体