Grok Bot 不再硬用自家模型了,写文案、画图会自动换 Claude 或 Midjourney,这种按任务挑模型的做法挺少见。
#智能体
Agent Arena 跑了 4700 多场真实会话测 Jev Router,结论挺直接:比 DeepSeek V4.1 Flash 贵 38%,但根据反馈换模型的能力接近 Claude Opus 5.5。
Perplexity 晒了个有意思的 demo:自家 Decider 决策模型接进 EVE 推理栈,直接速通《谁想成为百万富翁》答题,喜欢看模型实测的可以瞧瞧。
Notion 的 AI 负责人要讲怎么给自己的产品搭 evals,选模型别再只看跑分,做 agent 的可以关注这场 11 月 3 日的 Forge 活动。
代理自己注册用你的 API,权限算谁的?WorkOS 在 AI Engineer NYC 上讲怎么管身份和撤销,做 API 的都该看看。
Anthropic 出了新小模型 Claude Haiku 5.5,输入 0.1 美元每百万 Token,比上一代便宜 75%,还能调节性能档位,跑智能体和编码子任务很合适。
Cognition 给 Devin 配了云 Mac,能跑 xcodebuild 和 iOS 模拟器,iOS 开发的活儿可以直接丢给它了
NVIDIA 出了个 PivotOPD,专门解决智能体一开始走错就错到底的问题,让老师模型示范怎么纠偏,做 agent 的可以看看论文。
Nous Research 刚拿了 9000 万美元 B 轮,估值 15 亿美元,还把 Hermes 智能体开放给企业用户用了,开源背景出身走商业化路线,挺少见。
LangChain 在伦敦办 Interrupt 大会,Orange 和 OVO 会讲智能体生产环境的真实踩坑经验,还有 Deep Agents 和 Engine 的实操工作坊。
Matt Shumer 抛了个省钱思路:Opus/Sonnet 当大脑,Haiku 当干活的子智能体,搞智能体的可以试试。
写 Claude 智能体的可以升级 SDK 了,点击、打字这些循环不用再手写,SDK 直接帮你跑,省不少胶水代码。
同一模型跑 Claude Code、mini-SWE-agent、OpenCode 对比,结论很实用:精简提示词和工具能省最多 3 倍成本,写 Agent 的都该看看。
在 SambaCloud 上跑 MiniMax M3 的可以白捡一笔:长上下文缓存命中后 TTFT 快最多 4.7 倍,输入价格砍到 0.06 美元每百万 token,代码一行不用改。
CoreWeave 出了个 Agent Lens,专门查智能体哪些对话跑错了,还会把同类失败自动归组,做 agent 的可以看看。
Harrison Chase 发的,deepagents 现在能按 skill 动态加载工具,用 OpenAI 或 Anthropic 模型还不会破坏 prompt cache,做智能体的可以看看。
Anthropic 的 Haiku 5.5 来了,智力比一年前的 Haiku 涨了 26 分,价格还只有上代的十分之一,跑 agent 任务可以重点看看。
Anthropic 把最便宜的 Haiku 升到了 5.5,比 4.5 便宜约 75%,跑子智能体和高并发任务的人可以直接在 Bedrock 上用了。
a16z 投了 Preference Model,这家人专门给实验室做 ML 工程的 RL 环境,还把用了一年、跑过百万次评估的框架 Karotte 开源了,做 RL 训练的可以看看。
Anthropic 把最便宜的 Claude 砍到十分之一价格,跑批量和子智能体的成本直接降下来,做智能体的可以算算账了。
宝玉拆解了 Lauren 的 Cursor 用量数据:30天烧掉 1.5T Token,主力居然是 Opus 5.5。还讲了什么时候才敢学她不 Review PR。
微软给 Windows AI 画了张新蓝图:Autopilot 不只回答问题,还能自己规划步骤、操作文件和系统,人类只管关键节点拍板。
LangChain 给 Managed Deep Agents 更新到 v0.9,智能体能自己建提醒和循环任务,每个 run 还能单独换模型和 MCP 服务器,写 agent 的可以看看。
Anthropic 家最便宜最快的模型来了,比上一代省 75% 成本,还能调推理强度,跑智能体和电脑操作任务的可以看看。
Epoch AI 做了个叫 InnovationEval 的基准,专门测 AI 智能体能不能自己搞出像样的后训练创新,目前结果挺拉胯的,想追自动化研究进展的可以看看。
Meta 的 Muse 智能体要直接装进 Windows 了,还集成 MXC SDK,Perplexity 也有能离线跑的端侧工具,普通用户用智能体门槛更低了。