#智能体
Virgin Voyages 用 Genspark 两小时干完六周的活,WSJ 还写了完整案例,做营销的可以看看怎么用
Zip 把手搓的 LLM 调用和存储代码换成了 LangGraph,零代码接入 LangSmith 就能看全量 trace,做 agent 可观测性的可以参考。
Devin 现在夜里会自己整理记忆,删过期记录、挖掘你的工作偏好,Cognition 还顺手开源了 Agent Memory Repo 标准。
Cognition 发了篇讲 Devin 怎么存记忆、怎么 dreaming 的博客,做 agent 的可以看看他们怎么处理长期上下文。
Epoch AI 拿 OpenAI 自己公布的内部编程 Agent 使用数据做了趋势拟合,结论是开支每月翻倍,想知道 Agent 真实落地速度的可以看看。
GitHub 做了个专门测 AI 代码审查能力的开源基准 ReviewBench,用真实 PR 和生产对齐的指标打分,做代码审查工具的可以拿来自测。
LangChain 把自家智能体大会的录像全公开了,Harrison Chase 还专门讲为什么团队要自己掌控智能体逻辑,做 agent 的可以刷一遍。
原来 Claude Projects 的线程式交互是从 Slack 学来的,OpenAI 内部还靠 Slack 协调一切,这条观察挺有意思。
OpenAI 的 Codex Desktop + Astra 是我目前用过最强的电脑操作 Agent,作者把为什么要用 GUI 当通用接口讲得很透,做 Agent 的都该看看。
Mistral 给终端里的 Vibe 加了三个新功能,支持 GLM 5.3 模型,审批模式和子智能体管理也更顺手了,写命令行的可以看看。
Nous Research 把用户用 Hermes Agent 干的 326 件事整理成清单了,想做智能体的可以翻翻找灵感。
用 Claude Code 的可以试试,这个开源项目让你直接调用 Codex 那套电脑操控能力,写段 JS 就能点鼠标敲键盘,不用再切换工具。
LangChain 开了个智能体大会,Harrison Chase 讲怎么把智能掌控在自己团队手里,还顺手发布了一波新东西,做 Agent 开发的可以看看录像。
Lenny 采访了 ChatGPT 和 Codex 负责人,聊了模型选择器要取消、loops 只是过渡、以后都用 Dots 跟 AI 打交道,做 agent 的可以听听
Fireworks 现在能直接微调 DeepSeek V4.1 Flash 了,想做编程智能体或工具调用的可以看看,托管训练省不少事。
Cursor 更新了后台子代理机制,跑完的结果会自动回传给父代理,stream() 和 wait() 会等到所有子代理结束,并行跑任务更省心了。
Cursor 给 SDK 加了本地 TS 智能体的 steering 和 system prompts,subagent 结果还能本地回到 TS 或 Python,写工作流的可以看看。
微软发了篇论文叫 CorpusMap,提前把文档集合里的实体建好索引页,智能体检索时准确率涨最多 11.7 分,token 还省一半多。
Amazon 这批 COLM 论文一次覆盖智能体、解码控制和代码生成,做 RAG 或 Agent 开发的可以挑感兴趣的翻翻。
AWS 官方教程,教你把 Amazon Quick 的 agents 和知识库从开发账户自动发布到生产账户,全程可审计,适合管企业级部署的工程师。
Tibo 在 DevDay 上讲了 8 条干货:Notion 被 agent 流量打爆、插件能分 ChatGPT 12 亿用户的钱、Dots 干脆砍掉模型选择器,信息量很密。
DeepSeek V4 Flash 加自改 harness,花 4 美元搜索就在 Terminal-Bench 上追平 Codex,SWE-bench 还省了近四成开销,做智能体的都该看看。
AWS 官方教程,教你用 LangChain 搭 Bedrock 的智能体检索,还能看 trace 排查每步检索、对比两种路径的成本。
ContextQA 做了个叫 Ship 的 AI 测试员,Slack 或 Linear 里的 bug 它能自动复现、查原因,还能把线索丢给 Claude 或 Codex 去修,测试团队可以试试。