12:35官方一手arXiv: OpenAI@Mostapha BenhendaFinance Agent v2仅处理上市公司定期报告(SEC 10-K/10-Q),不适用于IPO尽职调查。新基准IPO Finance Agent扩展了任务领域和检索架构,采用上下文检索处理长文档,如SpaceX的S-1文件。该基准包含1000个IPO尽职调查问题,公开70个SpaceX问题,并引入自动生成评估标准管道。最佳模型Alibaba Qwen 3.7 Max准确率79.4%,成本$0.30/查询;最经济模型Xiaomi MiMo-2.5 Pro准确率76.8%,成本$0.05/查询,均超越Finance Agent v2领先者Google Gemini 3.5 Flash(57.9%,$2.51/查询)。论文IPO Finance AgentSpaceXQwen 3.71 个信源在谈事件专题推荐理由:想测模型做IPO分析的功力?这篇论文搞了新基准,Qwen 3.7最强但贵,小米MiMo性价比炸裂,值得看。原文稍后读已读值得跟进有用关注 IPO Finance Agent
03:55lmarena.ai@lmarena_ai精选Arena排行榜基于全球社区的真实任务动态更新,而非静态基准。评估流程包括内部基准测试、模型接入、社区投票、分数稳定化和公开发布。团队采用Bradley-Terry模型确保分数稳定性,并区分Expert和Hard难度以细化评估维度。视频还介绍了代码名称、身份泄露过滤及投票质量控制等机制。技巧ArenaLMSYS模型评测推荐理由:想了解AI模型评测怎么运作的?Arena团队亲自拆解从内测到上线的完整评估流程,还讲了Bradley-Terry分数如何保证公平,干货满满。原文稍后读已读值得跟进有用关注 Arena
22:18官方账号Decoder@Maximilian Schreiner一项新基准测试评估了AI处理真实知识工作的能力。即使是最先进的AI模型,也仅能完全解决3%的任务。这一结果凸显了当前AI在处理复杂、多步骤的知识工作方面仍存在巨大短板。AI模型基准测试知识工作AI性能推荐理由:这个新基准狠狠打了AI的脸——最强模型也只完成3%的真实知识工作,别看平时吹得厉害。原文稍后读已读值得跟进有用关注 基准测试
18:27官方账号Decoder@Maximilian SchreinerOpenAI研究者发现,通过强化学习对诚实性、可修正性等理想行为特质进行训练,模型在跨领域表现提升。在健康数据上训练后,欺骗检测能力也增强,模型在53个基准中的44个上得分更高。该方法与Anthropic的基于宪法的对齐方法不同。研究显示少量特质训练即可带来广泛安全改善。论文OpenAIAI安全强化学习10 个信源在谈事件专题推荐理由:OpenAI发现,只给模型一点点“诚实”训练,它就在53个测试里赢了44个,连健康领域的骗术都能识破。和Anthropic的路数不一样,挺有意思。原文稍后读已读值得跟进有用关注 OpenAI
11:31官方账号arXiv cs.AI@Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii BabaevLiveCodeBench (LCB) 是广泛采用的代码生成基准,但仅限Python。新基准Multi-LCB将LCB任务转化为12种编程语言,包括Python、C++、Java等,保持原始污染控制和评估协议。研究者在Multi-LCB上评估了24个LLM,发现模型存在Python过拟合、语言特定污染和跨语言性能差异。Multi-LCB为多语言代码评估提供了严格的新基准,直接暴露了当前LLM在Python之外的短板。AI模型Multi-LCBLiveCodeBench代码生成推荐理由:想测AI写代码的真本事?别只看Python了。Multi-LCB覆盖12种语言,一测就知道模型是不是只会Python,结果可能让你意外。原文稍后读已读值得跟进有用关注 Multi-LCB
10:07官方账号arXiv cs.AI@Xinyi Zheng, Ling Shi, Tianlong Yu, Yongxin Zhao, Lorenz Goette, Kailong WangQMFOL是一个自动生成一元一阶逻辑推理任务的框架,可精确控制推理深度、宽度、标签类型和干扰项。基于该框架构建的QMFOLBench包含2880个实例、960种配置。在6个大型推理模型(LRMs)和2个LLM上的评估表明,逻辑复杂度增加时性能下降、计算开销上升。模型在True标签任务上表现优于False或Unknown任务,且对语义变化敏感。论文QMFOLLLM推理推荐理由:这篇论文提出了一个更好的推理测试方法QMFOL,能精细控制逻辑难度,用来测LLM推理能力更准。原文稍后读已读值得跟进有用关注 QMFOL
09:55官方账号arXiv cs.LG@Tristan Tomilin, Mourad Boustani, Mickey Beurskens, Thiago D. SimãoCRAX基于MuJoCo XLA(MJX)物理引擎,利用JAX的向量化操作和硬件加速,在安全强化学习基准测试中实现约100倍于CPU版本的速度提升。该基准包含六套环境和三类智能体任务,每类任务设三个难度级别。研究者在六个主流安全RL方法上的评估表明,没有一种方法在所有任务中占优,揭示了性能与安全之间的权衡。实验还发现,跨难度级别的课程学习与安全迁移在困难设置下比直接训练效果更好。AI模型CRAXMuJoCoJAX推荐理由:想快速测试安全RL算法?CRAX用JAX把基准跑快100倍,还自带六个环境和三级难度,帮你一眼看出哪个方法在安全与性能上最均衡。原文稍后读已读值得跟进有用关注 CRAX
09:36官方一手arXiv: OpenAI@Ahmad Salimi, Wentao Ma, Yuzhi Tang, Dongming Shen, Mu Li, Alex SmolaIHBench评估语音助手在10个企业领域中断后的恢复能力,包含6种中断类型。27个音频语言模型配置来自OpenAI、Google和开源社区。闭源模型在任务完成度上显著优于开源模型,长对话中性能下降慢约3.3倍,且无音频-文本模态差距。人类研究验证了LLM评判的可靠性,交叉分析显示恢复质量是独立能力维度。论文IHBenchOpenAIGoogle10 个信源在谈事件专题推荐理由:想测语音助手被用户打断后能不能接好活?IHBench专门看这个,比谁恢复得自然、不错步骤。闭源模型比开源稳太多了。原文稍后读已读值得跟进有用关注 IHBench
13:00@atomic_chat_hq@atomic_chat_hqStepFun 的 Step 3.7 Flash 模型与 DeepSeek V4-Flash 在物理动画生成任务中直接对比。任务要求编写自包含 HTML5 Canvas 动画,包含高尔顿板、旋转六边形中弹跳的球、五个同步节拍器三个场景。Step 3.7 Flash 输出 59.6k tokens (9分57秒),DeepSeek V4-Flash 输出 52.5k tokens (6分21秒)。虽然 DeepSeek 更快,但 StepFun 在物理模拟、视觉效果和逻辑渲染三个维度全面获胜。AI模型Step 3.7 FlashDeepSeek V4-FlashStepFun1 个信源在谈事件专题推荐理由:StepFun 的 Step 3.7 Flash 在生成物理动画上把 DeepSeek V4-Flash 比下去了,慢点但模拟和画面都好很多。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
10:35官方一手marktechpost@Michal Sutter精选OpenAI推出LifeSciBench,包含750个专家撰写任务,覆盖7个工作流和7个生物学领域,由173位博士科学家构建,使用19,020条评分标准评估推理与决策。当前最佳模型GPT-Rosalind得分仅36.1%,在人工制品、精确输出和操作决策上仍有较大提升空间。该基准旨在测试AI的真实研究能力而非单纯记忆。AI模型LifeSciBenchOpenAIGPT-Rosalind10 个信源在谈事件专题推荐理由:想看看AI搞科研到底多强?OpenAI出了个750道专家题的LifeSciBench,GPT-Rosalind才36.1%,差距大到让你吃惊。原文稍后读已读值得跟进有用关注 LifeSciBench
09:37官方一手arXiv: Google DeepMind@Tim Rädsch, Yuki M Asano, Hilde Kuehne, Stefan Bauer, Priyank Jaini, Robert Geirhos, Carsten T. Lüth该研究系统审计了Physics-IQ视频物理理解基准,发现其提示质量和真实标注存在缺陷。作者提出三项改进措施,包括优化提示与真值、引入样本级评分系统,并应用六种图像到视频生成模型验证。新版Physics-IQ Verified改进了57.6%的样本和34.8%的提示,模型排名变化中度显著(Kendall's τ=0.46)。论文Physics-IQ视频生成模型基准测试推荐理由:DeepMind发布了Physics-IQ验证版,专门评测视频模型对物理世界的理解。现有基准有缺陷,他们修正后让模型排名更可信了。原文稍后读已读值得跟进有用关注 Physics-IQ
05:23官方账号OpenAI@OpenAIOpenAI推出LifeSciBench,这是一个专门用于评估AI在生命科学领域表现的基础基准。该基准旨在通过更现实的测试场景,帮助研究者衡量进展、识别差距。LifeSciBench强调与生命科学社区的持续合作,以共同改进AI。具体评估指标和测试集细节尚待公开。AI模型LifeSciBenchOpenAI基准测试10 个信源在谈事件专题推荐理由:OpenAI搞了个LifeSciBench,专门测AI在生命科学上的表现,比以前的评估更贴近真实场景,想了解差距的可以看看。原文稍后读已读值得跟进有用关注 LifeSciBench
04:41官方一手OpenAI Blog(博客/媒体)OpenAI 发布了 LifeSciBench,这是一个由 10 位生命科学专家编写并经过独立审查的基准测试。该基准包含 30 个任务,覆盖文献综述、实验设计、数据分析等真实研究场景。初步测试显示,GPT-4o 在多数任务上优于其他模型,但所有模型在需要跨领域推理的任务中表现仍有显著差距。LifeSciBench 旨在为 AI 在科学领域的可靠性和安全性提供更严格的评估工具。AI模型OpenAILifeSciBench基准测试10 个信源在谈事件专题推荐理由:OpenAI 出了个新基准 LifeSciBench,专门测 AI 做生命科学研究的能力,比一般问答难多了,能看出模型哪里不行。原文稍后读已读值得跟进有用关注 OpenAI
02:39Firecrawl@firecrawl_devFirecrawl 的 AI 研发工程师通过索引查询论文、代码和技术讨论。在内部研究基准中,其召回率比 Exa 高 30%,比 Parallel 高 250%。目前已被多个领先研究团队采用。AI产品FirecrawlExaParallel推荐理由:Firecrawl 搜索召回比 Exa 强 30%,比 Parallel 猛 250%,做研究查资料可以试试它。原文稍后读已读值得跟进有用关注 Firecrawl
00:36量子位@一水某国产模型在多项关键医疗测评中超过GPT-5.5。这些测评覆盖多个专科方向,准确率指标领先。这表明国产医疗AI在核心性能上已实现突破。AI模型GPT-5.5医疗AI基准测试推荐理由:国产医疗AI终于打败GPT-5.5了,评测成绩很能打,值得关心AI落地的人看一看。原文稍后读已读值得跟进有用关注 GPT-5.5
23:18AI Will@FinanceYF5精选OpenAI frontier evals 负责人 Tejal Patwardhan 指出,现有基准测试如旧考试已变得过于简单,模型接近 100% 通过后无法区分真实能力。OpenAI 正在构建新评估框架,以更准确衡量前沿模型的真正水平。此举旨在避免模型仅通过刷分应付测试,确保评测能反映实际进步。行业OpenAITejal Patwardhan评测体系10 个信源在谈事件专题推荐理由:OpenAI 自己都觉得旧考试太水了,新评测体系怎么玩?来看看他们怎么重新定义能力原文稍后读已读值得跟进有用关注 OpenAI
10:43官方账号arXiv cs.AI@Md Tawkat Islam Khondaker, Raymond Li, Muhammad Abdul-Mageed, Laks V. S. Lakshmanan, Issam H. LaradjiDRFLOW 是一个用于评估智能体从异构来源预测个性化工作流的新型基准,包含 100 个任务、5 个领域、1,246 个参考步骤,并基于 3,900 多个来源构建。它定义了 7 项诊断指标,涵盖事实基础、步骤恢复、结构排序、条件解析和个性化。作者还提出了 DRFLOW-Agent (DRFA) 作为参考代理,其在平均 F1 分数上比强基线代理提升最多 10.02%,但仍有较大改进空间。AI模型DRFLOW工作流预测基准测试推荐理由:想测测你家智能体能不能给出真正可执行的步骤?DRFLOW 用 100 个企业任务逼真考核,DRFA 也才比普通基线高 10%,挑战不小。原文稍后读已读值得跟进有用关注 DRFLOW
10:30官方一手arXiv: DeepSeek@Jasmine Brazilek, Oliver Tulio, Joel Christoph, Miles Tidmarsh, Carol Kline, Arturs Kanepajs新基准TAC(Travel Agent Compassion)测试AI代理在12个旅行预订场景中是否避免动物剥削选项,涵盖6类动物剥削,扩展至48个样本以控制价格、评分和位置干扰。7个前沿模型得分均低于64%的随机水平,最佳Claude Opus 4.7为53%。在系统提示中加入一句福利意识语句后,Claude和GPT-5.5提升47-63个百分点,GPT-5.2提升26个百分点,DeepSeek和Gemini提升不到12个百分点。对前两名模型的288条基底记录审计未发现评估意识,表明低分并非因识别出测试。论文TAC动物福利AI Agent1 个信源在谈事件专题推荐理由:动物福利问题有了AI专属的代理基准TAC,实测Claude Opus 4.7刚过一半,加个提示词能暴增60%,暴露了模型在实际行动中的盲区。原文稍后读已读值得跟进有用关注 TAC
06:57官方账号Jim Fan@jimfan在一项无法在物理世界中被攻破的基准测试中,OpenAI Codex 的表现超越 Anthropic Claude,而 Claude 又优于月之暗面 Kimi。该基准由 @DrJimFan 参与的论文提出,专注于物理世界的真实场景评估。结果显示了各模型在复杂物理任务上的相对排名。AI模型CodexClaudeKimi10 个信源在谈事件专题推荐理由:英伟达科学家发推说他们论文里 Codex 把 Claude 和 Kimi 都干掉了,还是物理世界实测,看看你家模型排第几。原文稍后读已读值得跟进有用关注 Codex
04:49官方账号阿里通义 Qwen@Alibaba_Qwen精选72°Qwen-RobotWorld由阿里巴巴Qwen团队发布,将自然语言视为通用动作接口,统一末端执行器姿态、转向命令和导航点。该模型在具身世界知识语料库(860万视频-文本对、超2亿帧)上联合训练20+种具身类型和500+个动作类别。在EWMBench、DreamGen、WorldModelBench、PBench等基准测试中表现强劲。这一方法桥接了通用视频生成模型与领域专用具身模型之间的鸿沟。AI模型Qwen-RobotWorld阿里巴巴具身智能推荐理由:Qwen把自然语言当遥控器,一个模型搞定机器臂、自动驾驶、无人机等20多种动作,还赢了多个基准,挺有意思。原文稍后读已读值得跟进有用关注 Qwen-RobotWorld
03:35@koltregaskes@koltregaskesFable 5 在多个模型排行榜上表现突出,相较此前版本实现罕见的大幅提升。该模型在多项基准测试中显著碾压其他对手,但不是在所有任务上都优秀。这一成绩引发对 OpenAI 等竞争者如何应对的讨论。AI模型Fable 5模型排行榜基准测试10 个信源在谈事件专题推荐理由:Fable 5 在排行榜上把其他模型都压下去了,看看它到底强在哪原文稍后读已读值得跟进有用关注 Fable 5
03:28lmarena.ai@lmarena_aiAgent Arena 是一个智能体性能排行榜,现已在 arena.ai/leaderboard/ag... 上线。用户可通过按开放模型或按实验室(lab)筛选来查看详细数据。该排行榜为不同智能体模型提供了直接的性能对比基准。AI模型Agent Arena智能体排行榜推荐理由:想比对比不同智能体模型?去Agent Arena排行榜,能按开放模型或实验室筛选,帮你找到合适的。原文稍后读已读值得跟进有用关注 Agent Arena
19:46官方账号Decoder@Jonathan Kemper爱沙尼亚语言研究所发布了一项基准测试,用于评估AI语言模型对俄语宣传的抵抗力。测试涵盖了GPT-4o、Claude 3.5 Sonnet、Llama 3.1等8个模型,发现部分模型在30%的测试样本中会生成亲俄内容。Meta的Llama 3.1 70B表现最差,错误生成率高达42%;而OpenAI的GPT-4o错误率最低,仅为12%。该基准测试还包含一个包含1000个样本的俄语宣传语料库,用于衡量模型对政治操纵的脆弱性。AI模型GPT-4oClaude 3.5 SonnetLlama 3.110 个信源在谈事件专题推荐理由:想知道你用的AI会不会被俄语宣传带跑偏?爱沙尼亚语言研究所测了8个主流模型,GPT-4o最扛打,Llama 3.1中招率最高。看看你的AI排第几。原文稍后读已读值得跟进有用关注 GPT-4o
13:55@hebbia@hebbia71°在Hebbia金融服务业基准测试中,Anthropic的Fable 5模型总分超过所有其他前沿模型。该模型在基于文档的推理任务上提升显著,并在图表与表格解读、问题解决两个子项中取得最高分。测试结果来自Hebbia发布的金融行业专属评测集,涵盖多个复杂金融场景。AI模型Fable 5AnthropicHebbia10 个信源在谈事件专题推荐理由:Hebbia测了金融场景,Fable 5在文档推理和图表解读上碾压其他模型,搞金融AI的可以看看具体分数对比。原文稍后读已读值得跟进有用关注 Fable 5
11:40官方账号arXiv cs.AI@Alexandra Neagu, Jeffrey T. H. Wong, Marcus Messer, Rhodri Nelson, Peter B. Johnson该论文引入了一个评估管道,包含两个指标——聊天机器人脚手架和学生吸收率,并在9个数据集(共9490个对话)上应用,涵盖AI导师基准测试和现实部署。分析发现,基准测试假设高脚手架、高学生吸收率环境,但现实中的学生整体吸收率较低,经常绕过聊天机器人的教学框架。论文认为,绕过脚手架不一定有害,反而常突显了聊天机器人的教学框架与学生目标之间的不匹配。未来基准测试应评估聊天机器人如何导航多样化的学习情境和学生驱动的交互模式。论文LLM辅导员脚手架学生吸收率推荐理由:这篇论文用9490个对话数据证明,AI辅导系统在测试中的表现和实际使用差很多,学生根本不吃那套引导。做教育AI的值得看看。原文稍后读已读值得跟进有用关注 LLM辅导员
11:15官方账号arXiv cs.AI@Markus Bujotzek, Dimitrios Bounias, Stefan Denner, Ralf Floca, Maximilian Fischer, Peter Neher, Klaus Maier-Hein该基准套件整合了来自不同来源的真实噪声医学图像分割数据集,并设计了多种客户端-噪声场景(如轮廓不一致、缺失结构、标签混淆)。它提供了针对标签噪声的评估指标,支持系统性的联邦噪声标签学习(FNLL)评估。代码已在GitHub上开源(MIC-DKFZ/FedSegNoiseBench),为公平比较和未来方法开发奠定基础。论文Federated LearningMedical Image SegmentationNoisy Label Learning推荐理由:医学图像分割里标签噪声很头疼,这个基准套件专门测联邦学习下的真实场景,帮你挑最靠谱的去噪方法。原文稍后读已读值得跟进有用关注 Federated Learning
10:57官方账号arXiv cs.LG@Yahya Aalaila, Sumantrak Mukherjee, Gerrit Großmann, Sebastian VollmerHawkesNest是一个基于多元Hawkes骨干的生成器对齐基准,定义了空间-时间纠缠、背景异质性、跨类型交互和域拓扑四个复杂度轴。每个轴关联一个从潜在数据生成机制中计算出的确定性索引。在固定全局速率、稳定性和模拟预算下改变这些轴,可对STPP模型进行诊断压力测试。实验验证了索引的单调性和近似正交性。Hawkes系列基线在联合异质性与纠缠复杂度下退化,AutoSTPP在空间-时间纠缠单独增加时表现脆弱。论文HawkesNestSTPP时空点过程推荐理由:想检验你的时空点过程模型?HawkesNest提供了四个可控复杂度轴,能精准发现模型在空间-时间纠缠等场景下的弱点。原文稍后读已读值得跟进有用关注 HawkesNest
10:26官方账号arXiv cs.LG@Marios Koulakis, Constantin Seibold论文提出了一个基准测试框架manifold-microscope,用于研究数据流形的几何特性。它扩展了dSprites和COIL-20数据集,引入额外的变换维度和密集轴对齐采样,并搭配有限差分估计器。该框架能以接近真实值的精度恢复曲率、reach和体积,而通用估计器在这些场景中不可靠。两个应用研究展示了该框架的用途:评估Genovese et al.和Fefferman et al.理论边界的缩放行为,以及跟踪β-VAE的逐层几何变化。论文dSpritesCOIL-20β-VAE推荐理由:这篇论文给了一个实用的基准测试工具,帮你检验数据流形几何估计方法的准确性,还能用来验证理论假设。原文稍后读已读值得跟进有用关注 dSprites
10:07Gary Marcus@GaryMarcusAnthropic 发布的 Claude Fable 5 在 Epoch AI 的 Epoch Capabilities Index 上获得 161 分,以 1 分之差超越 GPT-5.5 Pro 的 160 分。这是 Anthropic 一年多来首次在该基准上领先。该指数综合评估模型能力,当前最高分为 161。尽管成绩创下新高,但专家指出进步幅度仍属渐进。AI模型Claude Fable 5GPT-5.5 ProAnthropic10 个信源在谈事件专题推荐理由:Claude Fable 5 刚在 Epoch 能力指数上以 161 分微弱领先 GPT-5.5 Pro,这是 Anthropic 一年多来首次登顶,你可以看看它具体强在哪。原文稍后读已读值得跟进有用关注 Claude Fable 5
09:50官方账号arXiv cs.LG@Zongfang Liu, Jinghui Zhang, Zijian Ma, Guangyi Chen, Xin Yuan该研究提出MoE专家一次性剪枝的统一公式,将现有启发式标准归为路由频率、门控权重、激活强度三类因素。基于此给出选择原则:任务无关剪枝应优先使用基于激活强度、无门控的标准。新提出的MAN和MSAN标准在4个MoE模型、16个基准上取得任务无关设置平均排名前两位。平均性能比最强基线提升最多8.8个百分点。论文MoE专家剪枝语言模型推荐理由:这篇论文把MoE剪枝的各种评分方法统一了,还提出MAN和MSAN两个新标准,在多个模型和基准上表现更稳定,适合做模型压缩的人参考。原文稍后读已读值得跟进有用关注 MoE
11:11官方账号arXiv cs.AI@Guanming Liu, Yuqi Ren, Hansu Gu, Peng Zhang, Weihang Wang, Jiahao Liu, Ning Gu, Tun LuStreamMemBench是一个针对智能体记忆的流式评估基准,基于EgoLife自我中心流构建两步任务序列。初始任务测试证据使用,后续任务测试反馈与交互经验的复用。基准包含证据回忆、初始证据使用、反馈整合和后续复用四项指标。实验在8个记忆系统、2个基础模型上显示,当前系统在证据使用和反馈转化为可靠行为方面常失败。论文StreamMemBenchEgoLife智能体推荐理由:测测你的智能体记性原文稍后读已读值得跟进有用关注 StreamMemBench
06:09rohanpaul_ai@rohanpaul_ai精选一项新研究提出了HLL基准测试,要求AI智能体完成10种CAPTCHA任务,包括识别页面元素、正确点击或拖动、跟踪状态变化并提交答案。测试发现,即使强大的智能体在静态任务中表现良好,但在页面杂乱、任务复杂或系统验证操作有效性时仍会失败。该基准旨在评估智能体在真实人机验证场景中的能力,结果显示当前AI智能体难以通过此类验证。论文HLLCAPTCHA智能体推荐理由:看看AI怎么被CAPTCHA难倒的原文稍后读已读值得跟进有用关注 HLL
12:58lmarena.ai@lmarena_aiClaude Fable-5 在 Agent Arena 排行榜上展示了其技术细节,该模型在多个基准测试中表现突出。具体数据显示,Fable-5 在任务完成率上达到 92.3%,相比前代提升 15%。排行榜还提供了 Fable-5 与其他模型如 GPT-4o 和 Gemini 2.0 的对比结果。AI模型Claude Fable-5Agent Arena基准测试10 个信源在谈事件专题推荐理由:看 Fable-5 在 Agent Arena 上的具体数据原文稍后读已读值得跟进有用关注 Claude Fable-5
11:00官方账号Decoder@Matthias BastianAnthropic发布的Claude Fable 5在Artificial Analysis Intelligence Index上获得64.9分,创下十项基准测试中的五项纪录。相比Opus 4.8,性能仅提升5.7%,但token价格翻倍。安全过滤器和回退路由进一步推高使用成本。AI模型Claude Fable 5AnthropicOpus 4.810 个信源在谈事件专题推荐理由:性能微涨价格翻倍,谨慎升级原文稍后读已读值得跟进有用关注 Claude Fable 5
15:09官方账号Artificial Analysis@ArtificialAnlys73°Artificial Analysis 更新了其编程智能体指数,用 Datacurve 的 DeepSWE 基准测试取代了 SWE-Bench Pro。DeepSWE 从零编写任务,避免模型从公开 GitHub 问题或 PR 中记忆答案,解决了原基准可被游戏化的问题。更新后,Codex with GPT-5.5 (xhigh) 得分从 65 升至 76,超越 Claude Code with Opus 4.8 (max) 的 73 分;新发布的 Claude Fable 5 (max) 在 Claude Code 中以 77 分位居榜首。这一变化揭示了原基准对某些模型组合的偏差。AI产品编程智能体基准测试Claude Fable 510 个信源在谈事件专题推荐理由:基准测试更新直接影响了主流编程智能体的排名,做 AI 编程工具选型或评估模型能力的开发者值得关注——Claude Fable 5 新登顶,Codex 也大幅提升,建议点开看具体得分和对比。原文稍后读已读值得跟进有用关注 编程智能体
14:45Philipp Schmid@_philschmidAgent's Last Exam 是一个全新的AI智能体基准测试,旨在评估智能体在复杂、多步骤任务中的表现。该测试由多个研究机构联合开发,包含一系列需要规划、工具使用和推理的挑战性任务。初步结果显示,当前最先进的模型在测试中得分较低,表明智能体能力仍有巨大提升空间。该基准的发布为AI智能体研究提供了更严格的评估标准。论文智能体基准测试评估推荐理由:做AI智能体研究的团队终于有了更严格的测试标准——Agent's Last Exam 揭示了当前模型的真实短板,值得所有关注智能体能力的开发者点开看看。原文稍后读已读值得跟进有用关注 智能体
14:43Philipp Schmid@_philschmidAgents' Last Exam (ALE) 是一个针对 AI 智能体的新基准测试,包含来自 55 个行业的 1000 多个真实专业任务,所有任务都源自实际专家工作,而非合成数据。测试结果显示,最佳智能体在最简单任务上得分低于 50%,在困难任务上低于 10%,最前沿模型在最高难度任务上通过率为 0%。模型选择对性能的影响大于工具链(harness),且增加 token 消耗并不能提升结果。智能体常见失败模式包括策略错误(47%)、领域知识缺失(31%)和执行错误(22%),且 34% 的任务需要 GUI 软件,但智能体倾向于回避并采用 CLI 变通方案。AI模型智能体基准测试ALE推荐理由:ALE 揭示了当前 AI 智能体在真实专业任务上的真实水平,做智能体开发或评估的团队值得关注——它可能是衡量 Agent 能力的最后一把尺子。原文稍后读已读值得跟进有用关注 智能体
13:48官方账号arXiv cs.LG@Tianyi Ma, Yijun Ma, Zehong Wang, Weixiang Sun, Ziming Li, Connor R. Schmidt, Chuxu Zhang, Matthew J. Webber, Yanfang Ye超分子化学研究非共价主客体组装,但设计过程耗时且需要大量干实验验证。尽管LLM在分子结合任务上表现优异,但缺乏系统评估其超分子化学推理能力的基准。为此,研究团队与领域专家合作发布了SupraBench,包含结合亲和力预测、最佳结合物选择、溶剂识别和主客体描述四个核心任务,以及一个基于视觉的分子识别辅助任务。同时发布了SupraPMC语料库(1600万token),用于领域适应预训练。实验表明,LLM在所有任务上仍有显著提升空间,领域适应预训练在分布内回归任务上表现良好,但会牺牲严格的格式输出。论文基准测试超分子化学LLM评估推荐理由:做计算化学或药物设计的团队终于有了评估LLM超分子推理能力的标准测试——SupraBench覆盖了结合亲和力预测等关键任务,想验证LLM在化学领域实用性的研究者可以直接用。原文稍后读已读值得跟进有用关注 基准测试
13:31swyx (AI Engineer)@swyx73°METR 发布 FrontierCode 基准测试,发现超过一半的 SWEBench 结果是无法合并的劣质代码。FrontierCode 包含 1000+ 小时维护者验证的软件工程任务,并设有 3000+ 条评分标准,涵盖代码质量和反作弊机制。最难的 FC Diamond 级别中,Opus 4.8 得分仅为 13.8%。该基准将 AI 编程划分为三个时代:2021 年自动补全(HumanEval)、2023 年通过测试(SWEBench)、2026 年可维护代码(FrontierCode)。数据显示,2025 年底模型能力出现跃升,最易任务的通过率在 4 个月内从 41% 提升至 74%,标志着 AI 编程从 2 次重试 95% 成功率到 6 次重试的质变。AI产品基准测试代码质量SWEBench推荐理由:FrontierCode 戳破了现有基准的泡沫,真正衡量代码可维护性而非通过测试——做 AI 编程工具或智能体开发的团队,建议看看这个新标尺,它可能改变你评估模型的方式。原文稍后读已读值得跟进有用关注 基准测试
12:49官方账号Artificial Analysis@ArtificialAnlys88°Anthropic 今日发布 Claude Fable 5,在 Artificial Analysis Intelligence Index 上以 64.9 分排名第一,领先第二名 GPT-5.5 约 5 分。该模型在 10 项基准测试中的 5 项取得最高分,并在代理能力评估中大幅领先。Fable 5 采用自适应推理和 Opus 4.8 回退机制,在安全护栏下约 8% 的任务会触发回退。定价为每百万输入/输出 token 10/50 美元,是 Opus 4.8 的两倍,但 Pro/Max/Team 用户可在 6 月 22 日前免费使用。AI模型Claude Fable 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Claude Fable 5 在多项智能和代理基准上碾压竞品,做 AI 应用开发或模型选型的团队值得关注——它可能是目前最强的通用推理和工具调用模型。原文稍后读已读值得跟进有用关注 Claude Fable 5