OVO Energy 要在 LangChain 伦敦大会上讲他们怎么用飞轮持续优化客服智能体,做客服 AI 的可以看看他们的落地思路。
#智能体
StepFun 把 Step 5 Preview 放上 OpenRouter 了,写代码跑 Agent 的朋友可以在 Cline、Kilocode 里免费用一周,顺便试试任务成本能省多少。
阿里云分享的客户案例:Ignite Vision 用 Qwen 从几百万 KOL 资料里挑达人,人工几小时的活变成几分钟,做投放的可以看看。
法国医疗公司 Vocca 拿了 2000 万美元 A 轮,它家的 AI 电话代理专接诊所来电,每月处理超 100 万通患者电话。
做 Manus 的 Butterfly Effect 拿了超过 5 亿美元融资,这家做能替你干活的智能体,规模在智能体赛道里相当少见。
宝玉分享的 Claude Code 实操套路:Fable 当 Tech Lead 派活给 Opus,执行完自动找 Fable 验收,省 Token 还省心。
TinyFish 的 CPO 亲讲他们团队怎么把 Qoder 塞进日常开发流程,速度提升是最大卖点,做工程的朋友可以看看别人怎么用。
有人做了个开源环境让 AI 智能体自己训练模型,Claude Opus 5 把 Qwen 的 SWE-bench 成绩刷到近三倍,还发现修 harness 比堆训练更管用。
一家泰国广告公司分享他们怎么用 WonderClip 干掉视频制作里的重复活儿,人只管创意把关,做视频的可以看看他们的流程。
有人拿 gpt-sol-6.1 和 opus-5.5 在多 Agent 调度里当主控对比,差距大到离谱,做编排的可以参考下。
新加坡的 Staple AI 在阿里云 Apsara 大会上讲他们怎么和 QwenWork 配合,把可信企业数据接到员工手边的 AI 里,做企业数据的人可以看看.
Mynet 的 CTO 讲了他们怎么用阿里云 PolarDB Serverless 跑 AI Agent 负载,不用提前买峰值容量,成本和速度都兼顾,做后端的可以看看。
泰国公司 T&B Media Global 在阿里云 Apsara 大会上讲了他们用 WonderClip 把视频创意生产四步合并成一个 Agent 工作流的做法。
Google Cloud 和 CoverGo 写给东南亚保险公司的白皮书,讲客户手里有了 AI 智能体之后,投保和理赔流程会怎么被改写。做保险科技或企业 AI 落地的可以看看。
12 个智能体里 6 个做出的气候模型比已发表的还好,连 ENSO 暖冷不对称的争议都摸到了边,这套无标准答案的评测方法也值得做 agent 评测的人参考。
用大模型智能体给 Qiskit、PennyLane 找不报错的隐藏 Bug,成绩压过 Claude Code,还挖出 40 个新 Bug,做量子开发的朋友可以看看。
arXiv 上的新论文,教长期智能体把过往推理经验压成一个轻量策略,实验里把 DeepSeek 的推理 F1 从 0.789 拉到 0.868,做智能体记忆的可以看看。
一个专门测地理空间智能体的开源基准,103 个任务打九个模型,Claude Sonnet 4 第一但 DeepSeek V3.2 便宜 11 倍,做 Agent 评测的可以拿来就用。
Paul Graham 发了条推,说 Amazon 封杀购物 agent,反而给了创业公司做电商替代品的机会,观点挺有意思。
Salesforce 的新论文 CLIFT,31B 开源模型打网页任务居然赢了 Gemini 3 Flash,关键是部署时不用裁判模型,省成本。
37FlowAI 拆解了 DeepSeek-V4.1-Flash 在 vLLM 上跑 agent 的优化细节,SWA bounded replay 能明显降低 TTFT,搞部署的可以看看。
用 222 个任务测各家居家智能体能不能按时长干活,结果 Fable 5.1 偏差 2.9 倍,Astra 只有 1.2 倍,还有偷偷睡觉的,挺有意思。
Browser Use 拿 Haiku 5.5 跑了自家基准 v2.1,性能和 Luna 打平但贵 2.8 倍,长任务下还触发 5 倍加价,选型前可以看看这份实测。