微软基于 Qwen3.5-9B 出了个决策小模型,专管 Agent 流程里的判断打分,比 GPT-6 Sol 快 35 倍,输出还免费。
#Agent
这份月榜整理了 2026 年 9 月 GitHub 最火的十个开源项目,像 ponytail、阿里的 open-code-review 都能直接用到你自己的编码 Agent 流程里,挑两个装上试试。
Postman 讲了他们的 Agent Mode 怎么服务 4000 万开发者:怎么管工具、怎么控上下文,都是跑在 Amazon Bedrock 上的实战经验。
AWS 老大亲自讲云怎么为 Agent 改:30 秒开户、3 秒建库、沙箱权限,还有 2200 亿美元 CapEx 的去向,干货挺多。
Product Hunt CEO 每周看几百款产品上线,他对 2027 年的四个判断里,"手工软件"这个反 AI 赛道挺有意思。
作者 vista8 写了个现成 prompt,丢给 Agent 就能帮你装好乔木剪藏的浏览器扩展和 helper,还带 Obsidian 配置,直接复制就能用。
Novita Labs 在 SF Tech Week 办了场开源 AI Stack 活动,近千人报名,讲的就是模型之外推理和 Agent 那一整层怎么搭。
做长任务 Agent 的朋友看看这篇:TRACE 用 590 个真实压缩边界回放数据测了压缩时机怎么选,结论是历史行为预测力很弱,数据和方法都开源了。
a16z 的 Andrew Chen 长文聊 Agent 有没有网络效应,把 Agent 比成邮件客户端,还拆了获客、留存、变现三个维度,做 Agent 创业的都该看看。
JHU 和 CMU 让 4B 小模型自己改 agent 的 harness 代码,效果反超 35B 教师模型,做 agent 开发可以试试这思路。
Cursor 更新了后台子代理机制,跑完的结果会自动回传给父代理,stream() 和 wait() 会等到所有子代理结束,并行跑任务更省心了。
教你用 Magpie CLI 查各模型剩余额度,再按紧急程度自动派活给不同 sub agent,额度不够也不怕。
博主把 2026 年划给个人 Agent,点名 grok bot、Muse、Instinct、dots 这几个,还预测 2027 年是团队协作 Agent 的天下,思路挺清楚。
做法律工作的人可以看看,Legora 的 Agent 现在能学你们所里的审合同习惯,还自带 250 多个现成 Skills。
MIT开源的JAZ只用一个invoke函数就干了记忆库和优化管道的活,成本不到Letta一半,成绩还更高,做Agent的可以看看源码。
LiteLLM 新出的 Lens,能自动帮你查几万条 Agent 轨迹、聚类故障还带证据,数据存自家 ClickHouse,Codex 和 Claude Code 都能直接拉数据用。
一位每天处理大量 PR 的开发者拆解了 Lauren 不 Review 代码的三个前提:模型够强、Token 够多、自己把方向,还给了从聊天记录挖 Skill 的实操方法。
把 Agent 这些年的补丁史讲透了:检索、状态管理、重试、权限、验收,每次都是外挂,然后又被模型吸收进去。做 Agent 的值得对照看看自己的架构处在哪个阶段。
W&B 的人现场演示怎么把 agent 一次翻车的生产 trace 改成 eval 用例,修完还能跑基准验证,做 agent 评测的可以照抄这个流程。
用 OpenRouter 的人看过来,logs 页面的 sessions 标签能一次看到所有 agent 和模型的聊天记录,找历史对话不用挨个翻了。