8月25日
22:28
10:46
10:46官方账号arXiv cs.AI@Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua Zhao
EarthVerse基准测试通过405个可复现任务评估科学智能体,基于199个记录事件和19种灾害类型。评估25个模型和智能体系统,平均答案单元准确率为84.65%,最高Strict@95为34.81%。测试显示当前智能体常在单个步骤完成,但缺乏跨证据、尺度、单元、计算和物理解释的一致性链。EarthVerse为测量动态地球系统中端到端科学可靠性提供可复现基础。
推荐理由:EarthVerse基准测试为评估科学智能体提供了全面的方法,揭示了当前智能体在跨证据和尺度上的不足,值得专业人士关注。
01:37
8月24日
22:43
8月23日
01:18
01:18elvis@omarsar0
精选
本文探讨了AI智能体当前存在的问题,如幻觉、成本效率低下等,提出了解决方案。通过将上下文获取视为主动推理,提出了一种名为“最优提问”的方法,并在25至300个候选者的二进制和多路任务上进行了基准测试。

推荐理由:这篇论文提出了AI智能体上下文获取的新方法,值得一读。它通过最优提问,提高了智能体的性能和效率,与现有方法相比有显著不同。
8月22日
02:33
8月21日
21:38
16:07
16:07官方一手pandaily@contact@pandaily.com (Pandaily)
78°
开源开发者新基准Qwen3.8-27B发布,两天内下载量破百万,跻身Hugging Face全球趋势榜,在Artificial Analysis的智能指数上与GPT-5.6 Luna和DeepSeek V4 Flash并列,昵称'本地Opus 4.6',将前沿能力压缩至27亿参数模型,4位量化后适配24GB GPU。新发布模型均以超越Qwen3.8-27B为标准。
事件专题

推荐理由:开源开发者有了新基准,Qwen3.8-27B横扫消费级硬件,比肩GPT-5.6 Luna和DeepSeek V4 Flash,参数量27亿,4位量化后适配24GB GPU,超越它才是新标准!
11:05
11:05官方账号arXiv cs.AI@Christos Koutsiaris
Daedalus-150M模型采用卷积-注意力混合架构,在CPU上实现高效推理;在59.9B tokens上从头训练,五任务基准测试得分47.31,优于GPT-2 124M等模型;与全注意力模型相比,在速度上具有显著优势,同时保持相似的质量指标。
推荐理由:Daedalus-150M模型在CPU上实现了高效推理,与同类全注意力模型相比,在速度上具有显著优势,同时保持了相似的质量指标,值得一试。
10:48
10:35
10:35官方账号arXiv cs.AI@Yejin Bang, Kirsty Fielding, Brandan Oliver, Brian Birke, Nabeel Seedat, Andrew M. Bean
合同审查是法律工作中依赖大量文本处理的领域之一,ContractScrub作为首个评估合同审查能力的基准,包含多种错误类型的合同,如定义术语误用、不正确的引用和不一致的语言。前沿模型在相关基准上表现出色,但在ContractScrub上表现不佳,仅有一个模型达到0.75的宏观平均召回率,突显了当前模型的实际限制和特定领域基准的重要性。
推荐理由:ContractScrub基准为评估合同审查能力提供了首个标准,揭示了前沿模型在特定任务上的局限性,值得法律和AI领域专业人士关注。
10:32
10:32官方账号arXiv cs.LG@Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na
AI4AI-Bench发布,包含10个训练算法家族的10个研究仓库。测试中,智能体在4小时内重写训练算法,然后重新运行并评分。平均得分0.166,最佳系统达到0.250。测试显示,大多数智能体未改变模型学习方式,而改变模型学习的少数智能体平均得分为0.226。
推荐理由:AI4AI-Bench为LLM智能体算法设计提供了一个基准测试,展示了智能体在改进训练算法方面的潜力,值得研究者和开发者关注。
05:35
05:35Browser Use@browser_use
Opus 5 和 GPT-5.6 Sol 在浏览器使用基准测试中表现接近。该基准由数百名用户参与,将真实用户任务转化为测试。测试采用原子化、可验证且明确的评估标准。这是目前最好的浏览器智能体基准测试。
推荐理由:Opus 5 和 GPT-5.6 Sol 在一个新浏览器基准上打平了,这个基准是真实用户任务,评估标准很细,看看谁更会上网吧。
8月20日
10:15
10:15官方一手arXiv: OpenAI@Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques
72°
SPADE利用30B参数模型实现自学习,构建自适应合成执行环境作为训练场景;让单一大语言模型同时承担环境设计与推理任务,提升数学、科学等领域表现;在八项推理与工具使用基准测试中,SPADE使模型平均提升5.3个百分点。
推荐理由:你可以试试SPADE,它是让大语言模型自己学建环境,在数学题这些领域比固定环境方法强5.3%呢。
8月19日
03:00
8月18日
8月14日
23:46
02:45
02:45lmarena.ai@lmarena_ai
LMArena 官方发布了 Code Arena 的 WebDev 子榜与 Text Arena 的完整排行榜。两份榜单均托管在 arena.ai 的 leaderboard 页面下。该榜单基于用户对战投票,反映模型在网页开发与文本任务上的能力对比。具体模型排名可在对应页面查看。
推荐理由:LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。
01:47
01:47lmarena.ai@lmarena_ai
Code Arena 推出 WebDev 排行榜,用于展示各模型在网页开发任务上的表现。WebDev 排行榜已通过 arena.ai 向公众开放,支持查看完整排名。Code Arena 的 WebDev 榜单为开发者在挑选模型时提供了直接对比。
推荐理由:Code Arena 搞了个 WebDev 排行榜,做网页开发选模型时可以参考排名,不用自己瞎试了。
8月13日
18:15
18:15OpenRouter@OpenRouterAI
DeepSeek V4 Pro 0813已在OpenRouter平台上线。相比V4 Pro Preview,新版在DeepSWE基准上得分62.7,提升49.9分;CyberGym得分83.3,提升30.6分;NL2Repo得分61.5,提升23.0分;Terminal Bench 2.1得分87.9,提升15.8分。更多服务提供商即将接入该模型。
推荐理由:DeepSeek把V4 Pro的智能体能力一口气拉高了,DeepSWE涨了快50分,写代码和操作终端都更顶了,现在就能在OpenRouter上直接用。
18:13
18:02