技巧精选

AI Agent Evals 实战 FAQ:先发现失败、再谈评估,700+ 工程师踩坑后的完整方法论

AI Agent Evals 实战 FAQ:先发现失败、再谈评估,700+ 工程师踩坑后的完整方法论 当前行业的主流叙事是:搭评估基础设施、接 LLM-as-a-Judge、看仪表盘分数。两位作者 ...

精选理由

两位作者教了700+工程师,他们发现多数团队从搭平台、接LLM judge、看分数开始,这是错的,应该先手动读100条真实trace,找到失败模式,评估器才会长出来。

当前行业的主流叙事是:搭评估基础设施、接 LLM-as-a-Judge、看仪表盘分数。两位作者 @HamelHusain @sh_reya 基于大量一线教学与实践,认为这条路径恰恰是错的,或者说是本末倒置的。他们的核心方法论可以压缩成一句话:先做错误分析,再谈评估体系。评估指标是从真实失败案例中“生长”出来的,不应该是预先设计出来的。meng shao @shao__meng AI Agent 评估,多数团队从搭平台、接 LLM judge、看分数开始 @HamelHusain 与 @sh_reya 在教了 700+ 工程师之后给出的答案是反的:先手动读 100 条真实 trace,找到失败模式,评估器才会长出来 评估的本质是理解系统在哪里影响了用户,这一步没有自动化捷径 x.com/i/article/2101… 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 588 📊 2 ⚡

原文 · shao__meng

AI Agent Evals 实战 FAQ:先发现失败、再谈评估,700+ 工程师踩坑后的完整方法论 当前行业的主流叙事是:搭评估基础设施、接 LLM-as-a-Judge、看仪表盘分数。两位作者 ...

AI Agent Evals 实战 FAQ:先发现失败、再谈评估,700+ 工程师踩坑后的完整方法论 当前行业的主流叙事是:搭评估基础设施、接 LLM-as-a-Judge、看仪表盘分数。两位作者 @HamelHusain @sh_reya 基于大量一线教学与实践,认为这条路径恰恰是错的,或者说是本末倒置的。 他们的核心方法论可以压缩成一句话: 先做错误分析,再谈评估体系。 评估指标是从真实失败案例中“生长”出来的,不应该是预先设计出来的。 meng shao @shao__meng AI Agent 评估,多数团队从搭平台、接 LLM judge、看分数开始 @HamelHusain 与 @sh_reya 在教了 700+ 工程师之后给出的答案是反的:先手动读 100 条真实 trace,找到失败模式,评估器才会长出来 评估的本质是理解系统在哪里影响了用户,这一步没有自动化捷径 x.com/i/article/2101… 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 588 📊 2 ⚡