AI Agent 评估多数团队从搭平台、接 LLM judge、看分数开始
AI Agent 评估,多数团队从搭平台、接 LLM judge、看分数开始 @HamelHusain 与 @sh_reya 在教了 700+ 工程师之后给出的答案是反的:先手动读 100 条真实 ...
教了700+工程师的Hamel Husain和sh_reya说,评估AI Agent要先手动读100条真实trace找失败模式,而不是先搭平台接LLM judge看分数。
AI Agent 评估多数团队从搭平台、接 LLM judge、看分数开始 @HamelHusain 与 @sh_reya 在教了 700+ 工程师之后给出的答案是反的:先手动读 100 条真实 trace,找到失败模式,评估器才会长出来 评估的本质是理解系统在哪里影响了用户,这一步没有自动化捷径
AI Agent 评估,多数团队从搭平台、接 LLM judge、看分数开始 @HamelHusain 与 @sh_reya 在教了 700+ 工程师之后给出的答案是反的:先手动读 100 条真实 ...
AI Agent 评估,多数团队从搭平台、接 LLM judge、看分数开始 @HamelHusain 与 @sh_reya 在教了 700+ 工程师之后给出的答案是反的:先手动读 100 条真实 trace,找到失败模式,评估器才会长出来 评估的本质是理解系统在哪里影响了用户,这一步没有自动化捷径 x.com/i/article/2101… 💬 1 🔄 0 ❤️ 3 👀 391 📊 2 ⚡