#工具使用
阿里新出的 Qwen3.8-Omni-Flash 模型,音频视频理解能力更强,还能用工具自动编辑视频、翻译视频,比之前的版本更便宜,适合做长视频处理。
MidTool为模型如何识别工具可用性、从上下文中定位论点、组成工具调用工作流程和从不完整信息中恢复提供了新方法,与基线相比,在中训练后性能显著提升,值得一试。
Cohere和LG CNS把111B参数模型压到单卡可跑,还能在韩英混合任务里切换推理模式,做SQL和工具调用都变强了。
Anthropic 出了 Sonnet 5,能自己规划任务、用浏览器和命令行,比 Sonnet 4.6 强,但比 Opus 便宜,适合想搞 Agent 又不想花大钱的人。
想看看你用的LLM在多工具长流程场景下到底多靠谱?PlanBench-XL用上千个工具设计了真实任务链,测出来主流模型成功率不到40%,值得一测。
做工具使用和任务自动化开发的团队可以关注——Skywork用自建环境训练出了超越开源前沿的模型,而且提供了轻量版降低使用成本,值得试试。
做AI智能体开发的团队终于有了解决记忆错配问题的方案——Mem-π 让智能体学会“按需生成”而非“死板检索”,在复杂任务中效果显著,建议研究记忆增强的开发者点开看看。
做Agentic RL的团队终于有了自动化环境构建方案——EnvFactory只用85个环境就碾压了此前5倍数据量的方法,想省掉手动造环境成本的开发者可以直接用。
Gary Marcus 的这篇推文为持续多年的“纯 LLM 能否通向 AGI”争论画上了句号,做 AI 系统架构、智能体开发或关注 AI 落地的读者值得一看——它点出了当前 AI 工程化的核心现实:真正起作用的是混合栈,不是单一模型。
做 Agent 开发或工具链集成的团队值得关注——Google 在工具使用上的谨慎节奏可能影响你的技术选型,看完截图能提前判断是否值得跟进。