#智能体
LlamaIndex 的 Logan 写了篇实操文:OCR 别再单次跑,改成布局感知、难元素路由、多轮自检的循环,能救回表格和图表。
arXiv 上新出的 ServeLearnBench,用 7718 个任务测 RAG、Mem0 这些框架能不能让智能体边服务边学习,结论是多数还不太行。
Nat Eliason 晒出他跑学校业务的一整套机器人工作流,邮件、会议纪要、写代码开 PR 全是自动的,想搭自己的智能体系统可以抄作业。
Claude 创始团队成员 Boris 分享了一条简单提示词,让 Opus 5.5 做出带水彩插图的播客互动网页,重点是自我验证那一步。
Garry Tan 分享了个很实在的玩法:让智能体写 markdown 技能再挂 cron 自动跑,加上学会做 eval 就能在自己领域里领先。
Every 团队把自己的工作流塞进一个 Claude 智能体,全公司通过 Slack 共用,还开放给了订阅者,做法挺值得参考。
Stanford 拿 5 个模型实测发现,多个智能体抢共享资源时互相覆盖,Opus 5 团队只拿到 30% 价值,单智能体能拿 64%,做多智能体系统前建议先看看。
Mandia 在 a16z 的访谈里讲了个有意思的思路:用一群智能体像心跳一样盯着你的网络,有变化就先攻击测试,赶在黑客前面。87% vs 23% 这组数字挺扎眼。
Mandiant 创始人二次创业,让一群 AI 智能体像攻击者一样不停轰炸客户网络,半年内在 Fortune 500 挖出 90 多个零日,聊法很实在。
AWS 出的手把手教程,教你用 OpenClaw 加 AgentCore 的 memory 功能做一个能记住你、越用越懂你的个人助手,适合动手党。
GitHub 基于上亿条真实 PR 做了个 ReviewBench,能测你的 AI 代码审查工具是不是只会刷评论,自己动手就能跑。
LangChain 出了门免费课程,教你怎么用 Deep Agents 写能跑长任务的智能体,想上手做复杂工作流的可以去刷。