#评估指标
共 16 条 · 7 天 0 条 · 30 天 3 条
信息流里打上「评估指标」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月22日
9月14日
9月11日
9月9日
8月5日
7月28日
7月23日
EdgeBench 基准测试教程:分析 AI Agent 任务与评估指标
想看 AI Agent 怎么测?EdgeBench 教程一步步教你下载数据、跑排行榜、分析 scaling law,连代码都给了,直接跟就行。
7月15日
论文09:20
谁给评分者评分?面向自提升LLM智能体共进化评估指标与技能这篇论文解决了自进化AI的一个核心漏洞:没有可靠指标怎么办。他们让指标和技能一起进化,在多个基准上验证了有效性,还能防作弊。值得研究Agent自改进的人读一读。
7月14日
7月8日
6月11日
论文10:07
信息增益衡量多轮对话语义进展:无需LLM评判的新指标做对话系统评估的团队终于有了一个可复现、低成本的替代方案——无需调用大模型就能衡量对话的语义进展,建议做客服或问答系统的开发者试试这个指标。
6月2日
论文11:10
多视角目标关联中的指标错配:排名 vs 分配这篇论文点破了多视角目标关联领域的一个常见误区——用排名指标评估分配任务可能得出虚假结论。做多摄像头感知或目标关联的开发者,看完会重新审视自己的模型评估方式,建议点开了解如何用Sinkhorn归一化做压力测试。
5月29日
PlanAhead:计划表示方式如何影响LLM网页智能体表现
做LLM智能体开发的团队终于有了计划表示的系统性对比——选对计划形式能直接提升任务成功率,建议做Web Agent的开发者点开看看具体指标差异。
5月15日
LLM越狱攻击的随机性问题:CAS-eval与CAS-gen框架
做LLM安全评估的团队会发现现有ASR指标不可靠——论文用数据证明80%的ASR在连续测试中可能只剩50%,CAS-eval和CAS-gen直接解决了这个评估和生成的不一致问题,做红队测试的建议点开。
5月12日