用大模型智能体给 Qiskit、PennyLane 找不报错的隐藏 Bug,成绩压过 Claude Code,还挖出 40 个新 Bug,做量子开发的朋友可以看看。
#智能体
arXiv 上的新论文,教长期智能体把过往推理经验压成一个轻量策略,实验里把 DeepSeek 的推理 F1 从 0.789 拉到 0.868,做智能体记忆的可以看看。
一个专门测地理空间智能体的开源基准,103 个任务打九个模型,Claude Sonnet 4 第一但 DeepSeek V3.2 便宜 11 倍,做 Agent 评测的可以拿来就用。
Paul Graham 发了条推,说 Amazon 封杀购物 agent,反而给了创业公司做电商替代品的机会,观点挺有意思。
Salesforce 的新论文 CLIFT,31B 开源模型打网页任务居然赢了 Gemini 3 Flash,关键是部署时不用裁判模型,省成本。
37FlowAI 拆解了 DeepSeek-V4.1-Flash 在 vLLM 上跑 agent 的优化细节,SWA bounded replay 能明显降低 TTFT,搞部署的可以看看。
用 222 个任务测各家居家智能体能不能按时长干活,结果 Fable 5.1 偏差 2.9 倍,Astra 只有 1.2 倍,还有偷偷睡觉的,挺有意思。
Browser Use 拿 Haiku 5.5 跑了自家基准 v2.1,性能和 Luna 打平但贵 2.8 倍,长任务下还触发 5 倍加价,选型前可以看看这份实测。
DeepSeek 把智能体的 KV 缓存砍到每 token 890 字节,比 V1 小 437 倍,Flash 还在 AA Index 上反超 V4-Pro,价格只要一半不到。
Grok Bot 不再硬用自家模型了,写文案、画图会自动换 Claude 或 Midjourney,这种按任务挑模型的做法挺少见。
Agent Arena 跑了 4700 多场真实会话测 Jev Router,结论挺直接:比 DeepSeek V4.1 Flash 贵 38%,但根据反馈换模型的能力接近 Claude Opus 5.5。
Perplexity 晒了个有意思的 demo:自家 Decider 决策模型接进 EVE 推理栈,直接速通《谁想成为百万富翁》答题,喜欢看模型实测的可以瞧瞧。
Notion 的 AI 负责人要讲怎么给自己的产品搭 evals,选模型别再只看跑分,做 agent 的可以关注这场 11 月 3 日的 Forge 活动。
代理自己注册用你的 API,权限算谁的?WorkOS 在 AI Engineer NYC 上讲怎么管身份和撤销,做 API 的都该看看。
Anthropic 出了新小模型 Claude Haiku 5.5,输入 0.1 美元每百万 Token,比上一代便宜 75%,还能调节性能档位,跑智能体和编码子任务很合适。
Cognition 给 Devin 配了云 Mac,能跑 xcodebuild 和 iOS 模拟器,iOS 开发的活儿可以直接丢给它了
NVIDIA 出了个 PivotOPD,专门解决智能体一开始走错就错到底的问题,让老师模型示范怎么纠偏,做 agent 的可以看看论文。
Nous Research 刚拿了 9000 万美元 B 轮,估值 15 亿美元,还把 Hermes 智能体开放给企业用户用了,开源背景出身走商业化路线,挺少见。
LangChain 在伦敦办 Interrupt 大会,Orange 和 OVO 会讲智能体生产环境的真实踩坑经验,还有 Deep Agents 和 Engine 的实操工作坊。
Matt Shumer 抛了个省钱思路:Opus/Sonnet 当大脑,Haiku 当干活的子智能体,搞智能体的可以试试。
写 Claude 智能体的可以升级 SDK 了,点击、打字这些循环不用再手写,SDK 直接帮你跑,省不少胶水代码。
同一模型跑 Claude Code、mini-SWE-agent、OpenCode 对比,结论很实用:精简提示词和工具能省最多 3 倍成本,写 Agent 的都该看看。
在 SambaCloud 上跑 MiniMax M3 的可以白捡一笔:长上下文缓存命中后 TTFT 快最多 4.7 倍,输入价格砍到 0.06 美元每百万 token,代码一行不用改。
CoreWeave 出了个 Agent Lens,专门查智能体哪些对话跑错了,还会把同类失败自动归组,做 agent 的可以看看。
Harrison Chase 发的,deepagents 现在能按 skill 动态加载工具,用 OpenAI 或 Anthropic 模型还不会破坏 prompt cache,做智能体的可以看看。