#智能体
Anthropic 的人亲自讲 Claude Managed Agents,10 月 12 日在纽约,做 Agent 开发的可以去现场学一手。
OpenAI 的 ChatGPT 和 Codex 负责人上播客了,聊了为啥模型选择器要砍掉、为啥 agents 会接管上网操作,观点挺直接的。
有人把智能体记忆做成了 Git 那样的提交和分支,用户改需求时只重做变化的部分,30 个测试全赢,编码场景省了 73.6% 的 token。
Ixigo 的旅行 AI 助手 Tara 听起来很省心,Tech in Asia 实测后发现订票还得自己动手不少,想用 AI 安排旅行的可以先看看这篇再决定。
Saravia 分享了他用自建界面替代终端来管理多个 coding agent 会话的思路,还提到 Codex Desktop 的优缺点,搞 agent 工作流的可以看看。
这周两家都憋了大招:OpenAI 的常驻智能体 dots 直接带云电脑,Anthropic 的 Sonnet 5.5 更快更便宜,FTC 还介入调查了
DeepSeek 的 Agent 桌面端把插件做成了核心架构,60% 用户都在装插件,这篇解释了他们为什么主动兼容 Claude Code Mods。
Brian Chesky 明确说不让 Meta Muse 这类外部 AI 智能体在 Airbnb 上订房,想用智能体订酒店的朋友可以先了解一下各平台态度。
Google 这篇论文有点反直觉:答案一致反而可能是错的。VeriHarness 用同款模型当验证器挑毛病,五个基准上都能涨分,数据也开源了。
LangChain 把自家编码 Agent 的账单连续两个月打下来了,三个做法都能直接抄:LangSmith 记账、gateway 设上限、OpenSWE 做模型路由。
Lovable 的 AI 编程工具疯狂建库,把 Supabase 吓得当 DDoS 防御,现在 60% 新库都是 AI 建的,挺有意思的案例。
装一个小工具就能让你常用的 Agent 借用 Codex 的 Computer Use,配个 Hook 白名单还能限制它碰哪些 App,我用 Opus 5.5 的可以试试。
Microsoft 这篇 ScholarEvolve 不改模型、只改 harness,就让 Qwen3.5-27B 在 AppWorld 上涨了 14 个点,思路很新颖。
群核科技的 Aholo Lux3D 三张照片就能出可编辑的 3D 模型,智能体调度加 Blender 收尾,做 3D 素材的可以试试。
AWS 开源了个 2B 小模型,专门替智能体做选择,115 毫秒出结果还带置信度,做路由和工具调用判断挺实用。
IBM 把自家编程智能体 Bob 做成了可私有化部署,内网隔离环境也能跑,还能自带 Nemotron 或 Claude 等模型,搞企业级开发的可以看看。
Meta、OpenAI、Uber 三家都让智能体先开口了,这篇分析真正难的不是回答,而是判断什么时候该闭嘴。
DeepSeek 给开源智能体框架 Harness v0.2 出了桌面版,Mac 和 Windows 都有,还能接别的 OpenAI 兼容模型,搞自动化任务的可以试试。
Sriram Krishnan 点评了 instinct、muse 这批个人智能体,说用户根本不在乎底层模型,拼的是产品细节,做产品的都该看看。
华为把 X-Router 开源了,跑 Agent 时简单任务走便宜小模型,复杂任务才上大模型,成本能砍一半左右,做 Agent 的可以试试。
这场 NYC 大会的名单全是金融机构 AI 负责人,JPMorgan、Two Sigma、Optiver 都来人,做金融 AI 的可以去聊实操问题。