一线 agent 开发者聊会话管理怎么做,他们也是扒 codex 和 claude code 的方案来抄,图片处理可以看看 workbuddy 的思路。
#agent
如果你每天指挥一堆 agent 写代码,却隐隐觉得自己没在思考了,这篇讲 Taste and Judgment 的文章会给你一个不错的答案。
Garry Tan 点出一个有意思的角度:实验室自己的编程工具有烧 token 的动机,创业公司像 Grep 这种反而更省更可控。
Binds Reddy 说写代码现在一个聊天框加 agent 就够了,不用 IDE 和 CLI,技术圈以前还笑话这种方式。
Raft 把 agent 协作层开源了,AI 在里面是真同事:有名字有记忆能互相交接。TiDB CTO 一天烧 12 亿 token,十几个真人干 120 人的活,代码值得通读。
Google 这篇论文把 agent harness 蒸馏进模型,移除专用 harness 后成功率反而从 23.3% 涨到 44.3%,比带 harness 还高,做 agent 的都该看看。
想了解多模型 agent 如何协作?这篇文章讲了用 claude 当 leader,协调 codex、gemini 等成员写代码,还提到了冗余和选举机制,挺实用的。
Anthropic CEO Dario 发文,说递归式自我改进可能失控,还举了 OpenAI 的 agent 事故例子,建议放慢研发速度。
Xiaoyin Qu发布了AgentSky.dev,可以降低agent使用成本,和Claude Code、DeepSeek等主流agent相比,价格更亲民。
Check out the Pareto frontier for Agent Arena to see performance across different categories. It's a great way to compare agents!
推荐用 Atuin 审计 Agent 命令,能按 Agent 筛选历史,配合 Gitleaks 定时扫描,防止 Token 泄露,适合 YOLO 模式用户。
想把 LangChain agent 从本地搬到线上?这份 cookbook 手把手教你用 JS 做全栈,连 streaming UI 和子 agent 都配好了。
生产环境跑 agent 只看成功率不够,LangChain 提示要关注 agent 实际做了什么,推荐做完整轨迹追踪避免翻车。
datasette 插件生态又进一步——现在插件能直接修改菜单空状态,做数据应用的团队可以借此引导用户快速上手,值得试试。
做 agent 开发的团队可以直接用 AnySearch 的 MCP 服务扩展搜索能力,省去自建搜索模块的麻烦,建议试试。