Every 是一个专注于 AI 应用与智能体工作流的团队,其成员近期在多篇分享中提出了关于 AI 智能体与人类协作的深度洞察,包括工作流实践、评估标准化及智能体依赖人类等核心观点。
Every 近期进展
五种 Codex 工作流深度实践:Every 团队公开了五种基于 Codex 的 AI 工作流模式,涵盖代码生成、调试、重构等环节,强调流程化使用 AI 提升开发效率。原文链接
统一评估模式“Every Eval Every”:团队联合发布了一套 AI 评估统一标准,旨在建立社区共享的评估仓库,解决当前评估碎片化问题,推动结果可比性。原文链接
AI 越强人越忙,Every 员工翻倍:随着 AI 能力增强,Every 员工数量翻倍,大量精力用于“照料”智能体,揭示 AI 越强人类介入需求越高的悖论。原文链接
创始人预言 Claude Code 将成操作系统:Dan Shipper 一年前预测,AI 编程工具 Claude Code 会成为知识工作的新操作系统,该观点正逐渐被验证。原文链接
当前焦点与观察点
Every 团队的实践反映了当前 AI 领域的两个核心矛盾:一是智能体能力越强,人类照料成本越高,员工数量翻倍即为例证;二是评估标准化严重滞后,Every Eval Every 试图填补空白。Dan Shipper 反复强调“每个 AI 智能体都需要人类”,离人越远表现越差,这暗示了当前 AI 自主性的天花板。未来焦点在于如何平衡智能体自动化与人类监督,以及建立更可靠的评估体系。Every 的工作流与预言为行业提供了可参考的路径,但“AI 越强人越忙”的困境仍需系统性解决。