00:28OpenRouter@OpenRouterAIOri Eval 允许用户用自然语言描述 bug,并自动生成一个能证明该 bug 存在的失败 eval。修复 agent 后,该 eval 转为通过并保留在测试套件中,持续验证修复效果。用户可以将 Ori Eval 集成到 GitHub Actions,确保回归问题不会进入生产环境。AI产品Ori EvalGitHub Actions测试生成推荐理由:它能把一句 bug 描述变成自动测试,先失败后通过,挂到 CI 里就能挡住回归,挺省心的。原文稍后读已读值得跟进有用关注 Ori Eval
00:27OpenRouter@OpenRouterAIOpenRouter 发布 Ori Eval,一款用于模型选型的评估工具。开发者只需在编码智能体中执行 curl -fsSL openrouter.ai/skills/spawn-o… 命令,即可按指引启动评估流程。Ori Eval 会自动对比候选模型在具体任务上的输出质量,给出可量化的对比结果。目前该工具已开放使用,相关说明见 openrouter.ai/ori/eval。AI产品OpenRouterOri Eval模型评估推荐理由:OpenRouter 新出的 Ori Eval 能让你的 coding agent 自动跑模型评测,哪个模型最适合你的项目,跑一下就知道。原文稍后读已读值得跟进有用关注 OpenRouter
00:26OpenRouter@OpenRouterAIOpenRouter 发布 Ori Eval,简化编写首个模型评估的流程。它利用 OpenRouter API 对代码库中的每个任务运行测试并评估结果,官方提供 curl -fsSL openrouter.ai/skills/spawn-o… 命令快速上手。Ori Eval 强调没有万能模型,只有最适合特定任务的模型。AI产品Ori EvalOpenRouter模型评估推荐理由:OpenRouter 出了个 Ori Eval,用它的 API 就能针对你的代码任务跑模型对比,一条 curl 命令就上手,适合想挑模型的人。原文稍后读已读值得跟进有用关注 Ori Eval