AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:评估基准×
6月29日
08:15
08:15AK@_akhaliq
DiffusionBench是一个专门针对扩散变换器(Diffusion Transformers)的全面评估基准。它涵盖了生成质量、推理效率、模型鲁棒性等多个关键维度。该基准基于ImageNet等公开数据集提供了标准化测试协议。它为不同扩散变换器架构的性能比较建立了统一框架。
AI模型DiffusionBench扩散变换器评估基准图像生成

推荐理由:想了解不同扩散变换器到底谁更强?试试这个新基准DiffusionBench,评估维度很全,结果很直观。
原文
6月17日
01:59
01:59lmarena.ai@lmarena_ai
Agent Arena 在其官方博客中介绍了用于智能体评估的因果追踪方法论。该方法可帮助研究人员分析智能体决策背后的因果链路。Agent Arena 平台本身支持多种智能体基准测试。
AI模型Agent Arena智能体评估基准因果追踪

推荐理由:Agent Arena 的因果追踪方法能帮你搞懂智能体为什么那么做,比单纯看分数更有用。
原文
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
6月8日
16:42
16:42Hunyuan@TXhunyuan
精选72°
腾讯混元与上海交大、南洋理工等机构合作推出 MMAE,这是首个针对语音和音频编辑的综合评估基准。与单纯生成音频不同,MMAE 要求 AI 理解现有音频并根据自然语言指令精确修改,保留无关部分。基准包含 2000 个真实场景样本、17741 个细粒度评估项,覆盖声音、音乐、语音及其混合的 7 种模态设置。当前模型在精确匹配率(EMR)上低于 5%,揭示了可靠音频编辑的巨大差距。该基准已开源,包含论文、代码和演示。
论文音频编辑评估基准腾讯混元多模态开源

推荐理由:音频编辑是 AI 落地的重要场景,MMAE 基准揭示了现有模型的巨大短板,做音频 AI 或语音交互的开发者值得关注这个评估工具。
原文
精选全部日报登录