8月24日
09:33
8月19日
22:39
22:39Philipp Schmid@_philschmid
artificialanalysis.ai平台发布的模型测试数据显示,其模型在GLUE基准测试中获得高分;测试结果显示该模型本轮得分达154分;与此前测试相比,此次成绩体现模型性能提升。
推荐理由:artificialanalysis.ai发布了最新模型测试数据,能直接查看各模型在GLUE的分数,和之前版本比信息更全了。
8月5日
11:05
11:05官方账号arXiv cs.AI@Chao Peng, Ruida Hu, Ajitha Rajan, Tegawendé F Bissyandé, Jacques Klein, Cuiyun Gao
论文调研了197个真实TUI应用,发现仅12%的测试代码涉及界面,其中45%从不发送输入。作者将ratatui/Rust、bubbletea/Go、textual/Python、ink/TypeScript应用打包成无头基准,对比4个前沿LLM与随机探索。在相同时间预算下,随机探索是强基线,但每次交互LLM引导更高效,且能独特到达需要输入触发的故障。自动派生启动输入带来最大实际收益,使原本无法启动的应用得以运行。行覆盖率无法有效预测崩溃发现,说明它不宜作为测试有效性的代理指标。
事件专题

推荐理由:这篇论文把197个终端界面应用打包成基准,拿4个大模型和随机点击对比,发现随机探索还挺能打,但大模型单次操作效率更高。他们开源了tuicov和tuibot,想测TUI的可以试试。
7月31日
09:53
7月30日
11:04
11:04官方账号arXiv cs.AI@Weijie Wu, Junbo Li, Lin Li, Jun Fang, Qingyang Hong
MMAC基准包含5,638个音频片段,来自20多个数据源,覆盖6个能力类别和15个评估维度。它检查模型生成字幕是否提及目标维度信息以及内容与参考标签的一致性。评估了开源和商业音频大模型,结果显示不同维度下的信息覆盖度和描述可靠性差异明显。
推荐理由:想评估音频大模型的信息还原能力?MMAC有五千多段音频和十五个细粒度维度,比只看生成质量更靠谱。
7月26日
02:54
7月23日
14:23
7月20日
09:17
09:17官方账号arXiv cs.AI@Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani, Mitch Weiss
新基准BusinessCaseBench涵盖18个学科数百个商业案例问题,每个问题配有专家编写的评分标准。前沿AI模型在该基准上已获得高分,且同一模型家族在两年内能力大幅提升。结果显示AI在分析性知识工作上的表现已经很高且快速进步。
推荐理由:想看看AI能不能做商业案例分析?这个新基准直接给模型打分,结果挺有参考价值。
7月14日
06:45
02:35
02:35官方账号Fei-Fei Li@drfeifei
斯坦福大学启动第二届 BEHAVIOR 机器人挑战赛,聚焦日常生活中的长周期复杂任务。去年获胜方案在真实场景中完整任务成功率仅12.4%。本届新增更多任务类型,改进评估方法并降低使用门槛。提交截止日期为2026年10月16日,奖金池总额11000美元。
推荐理由:斯坦福的机器人挑战赛又来了,去年最佳方案成功率才12%,说明这事真难。今年任务更多、评测更靠谱,想测测你家机器人的真实水平就参加。
7月8日
7月3日
00:25
00:25lmarena.ai@lmarena_ai
Claude Sonnet 5 (Thinking) 在 Text Arena 中整体文本排名第32位。在专家级提示(Expert-level prompts)上,Sonnet 5 超越了上一代版本4.6。在数学、写作、文学与语言、生命/物理/社会科学类别中表现稳定,但大多数其他类别的排名出现下降。
事件专题

推荐理由:想对比 Claude Sonnet 5 和 4.6 的文本能力?这份分析告诉你它在专家级提示上更强,但其他类别反而差了。
6月23日
13:19
13:19官方账号arXiv cs.LG@Nathan Senyard, Salem Hamdani, Astrid Zhang, Derek Wang, Evan Shelhamer, Mathias Lécuyer, Joséphine Gantois
Hedgementation 是一个面向国家尺度、10m² 空间分辨率的树篱映射遥感基准。它整合了多个遥感数据产品与法国树篱清单的标注,用于评估机器学习模型。基准测试了三个基线模型在空间距离和气候区域上的泛化能力,并涵盖监督和自监督学习方法。代码已开源在 GitHub。
推荐理由:想测试遥感模型对细节的抓取能力?这个基准用了法国全国树篱数据,10米分辨率,还能跨气候区泛化。
6月19日
6月18日
05:24
05:24官方账号OpenAI@OpenAI
OpenAI发布LifeSciBench,一个专门用于衡量AI在真实生命科学研究中表现的基准。该基准由173位生物技术和制药领域科学家参与开发,包含750个专家编写的任务,覆盖7个生物研究工作流。LifeSciBench旨在系统评估AI模型在文献分析、实验设计等科研环节的实用性,并指导后续改进。
事件专题

推荐理由:OpenAI联合173位科学家搞了个LifeSciBench,750个专家级任务覆盖7个生物研究流程,想测AI在生命科学里到底好不好用,科研人员可以用它来选模型。