#LLM-as-a-judge
共 6 条 · 7 天 0 条 · 30 天 4 条
信息流里打上「LLM-as-a-judge」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月28日
9月26日
npj Digital Medicine 论文:用大模型当裁判评估临床生成式 AI
医疗 AI 输出质量很难逐条人工评审,这篇 npj Digital Medicine 论文讨论用大模型当裁判自动打分,做医疗评估的可以看看思路。
9月24日
9月23日
Optimal Sequential Annotations for Off-Policy Evaluation:有限标注预算下的双稳健估计方法
标注预算不够又想评估策略?这篇 arXiv 论文告诉你怎么分配人工标注最省钱,RMSE 能降一半以上。
8月12日
7月10日
论文09:45
非GPU AI加速器大模型推理局限性:华为Ascend上MoE与多模态服务的实地研究这篇论文实测了华为昇腾跑MoE和多模态大模型的工程代价——需要打12个补丁、关掉一堆特性才能不出错,想用非GPU加速器的团队先看看这个。