Judge在AI领域是指自动化评估系统,用于客观衡量大语言模型生成内容的质量和性能。随着AI应用落地加速,Judge系统成为评估AI模型表现的关键工具,被广泛应用于内容生成、代码质量、多模态输出等多个场景。
Judge
general · 首次出现 2026-05-22 · 最近出现 2026-09-24 · 累计提及 149
综述
相关报道
10 条在档- 斯坦福 CS329Z 课程开讲:Engineering AI Agents 第一讲课件公开shao__meng
- 用 Jev-as-a-Judge 做智能体评估:低成本分流到前沿模型的组合玩法elvis
- AEWM 世界模型:让 LLM 智能体编辑任务状态而非模拟工具响应arXiv cs.LG
- LLM 能否生成阿拉伯古典 Maqama 文体?首个对照评估研究发布arXiv cs.AI
- Optimal Sequential Annotations for Off-Policy Evaluation:有限标注预算下的双稳健估计方法arXiv cs.LG
- RULER:用实例化评分细则奖励提升 SVG 生成arXiv: DeepSeek
- Jev-as-a-judge 上线 LangSmith,可低成本评分全部生产 traceHarrison Chase
- LangSmith 推出 Jev-as-a-judge,给生产 trace 全量打分LangChain
- AI Agent Evals 实战 FAQ:先发现失败、再谈评估,700+ 工程师踩坑后的完整方法论shao__meng
- EmbeddingGemma微调对比MPNet:岗位候选人语义匹配嵌入评估arXiv cs.AI