23:18The Rundown AI@therundownai91°OpenAI发布其定制AI芯片Jalapeño的基准测试,性能比Nvidia GB200和GB300系统高1.9倍,响应速度提升3.6倍。芯片设计从开始到制造完成历时九个月,预计年底前在OpenAI数据中心运行。AI模型OpenAIJalapeño芯片AI芯片10 个信源在谈事件专题推荐理由:OpenAI发布Jalapeño芯片,性能大幅提升,值得一看!原文稍后读已读值得跟进有用关注 OpenAI
22:28techcrunch@Russell Brandom78°OpenAI的Jalapeño芯片在Semianalysis的InferenceX基准测试中,每用户处理的token数量和每千瓦时的吞吐量均超过现有最先进技术。AI模型OpenAIJalapeño芯片推理加速10 个信源在谈事件专题推荐理由:想了解OpenAI如何加速推理?Jalapeño芯片的表现值得关注。它比现有技术更快,值得一看。原文稍后读已读值得跟进有用关注 OpenAI
10:46官方账号arXiv cs.AI@Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua ZhaoEarthVerse基准测试通过405个可复现任务评估科学智能体,基于199个记录事件和19种灾害类型。评估25个模型和智能体系统,平均答案单元准确率为84.65%,最高Strict@95为34.81%。测试显示当前智能体常在单个步骤完成,但缺乏跨证据、尺度、单元、计算和物理解释的一致性链。EarthVerse为测量动态地球系统中端到端科学可靠性提供可复现基础。论文EarthVerse科学智能体基准测试推荐理由:EarthVerse基准测试为评估科学智能体提供了全面的方法,揭示了当前智能体在跨证据和尺度上的不足,值得专业人士关注。原文稍后读已读值得跟进有用关注 EarthVerse
10:06官方账号arXiv cs.AI@Marek Hradil, Danae Sánchez Villegas视觉语言模型(VLMs)在视频和图像序列基准测试中表现出色,但它们是否捕捉到时间结构尚不清楚。我们提出时间定位作为异常检测问题,并引入TimeCatch,通过交换连续帧和用高斯噪声替换帧来创建时间异常和帧级异常。模型在四个合成和真实世界数据集上进行了异常检测和定位任务的评估,并与人类研究进行了比较。结果表明,VLMs在帧级异常检测中表现良好,但在时间异常检测中表现接近随机,在定位上仅略高于随机。人类在两项任务中都取得了接近天花板的表现。对模型规模、提示策略、序列长度和视觉相似度等方面的进一步分析表明,这些失败不能仅归因于感知或模型容量的限制。这些发现表明,当前的VLMs可以识别单个帧中的异常,但在整合跨帧信息以推理时间一致性方面存在困难。TimeCatch为评估视觉语言模型中的时间定位提供了一个受控的基准。论文视觉语言模型时间一致性异常检测推荐理由:这篇论文提出了TimeCatch,一个用于评估视觉语言模型时间一致性的基准,揭示了当前模型在时间异常检测上的不足,值得一读。原文稍后读已读值得跟进有用关注 视觉语言模型
01:37OpenRouter@OpenRouterAI探讨模型周期变化、基准测试局限性及AI应用潜力未达天花板时的情况。行业模型周期AI应用潜力行业趋势推荐理由:了解模型周期变化和AI应用潜力,洞察行业趋势。原文稍后读已读值得跟进有用关注 模型周期
22:43量子位@思邈中国公司提出AI科研评价新规则,实践数据在两项基准测试中位列第一,全球大厂开始关注。论文AI科研评价规则中国公司基准测试推荐理由:这篇论文提出了新的AI科研评价标准,数据表现优异,值得行业关注。原文稍后读已读值得跟进有用关注 AI科研评价规则
01:18elvis@omarsar0精选本文探讨了AI智能体当前存在的问题,如幻觉、成本效率低下等,提出了解决方案。通过将上下文获取视为主动推理,提出了一种名为“最优提问”的方法,并在25至300个候选者的二进制和多路任务上进行了基准测试。论文AI智能体最优提问上下文获取推荐理由:这篇论文提出了AI智能体上下文获取的新方法,值得一读。它通过最优提问,提高了智能体的性能和效率,与现有方法相比有显著不同。原文稍后读已读值得跟进有用关注 AI智能体
02:33Firecrawl@firecrawl_devFirecrawl基准测试发布,可从GitHub仓库自行运行。包含半数查询,剩余用于测试,防止训练。AI模型Firecrawl基准测试GitHub推荐理由:Firecrawl基准测试开放,自己动手测试一下,看看你的模型表现如何!原文稍后读已读值得跟进有用关注 Firecrawl
21:38官方账号NVIDIA AI@NVIDIAAINVIDIA AVO通用编码智能体在ARC-AGI-3推理基准测试中满分,完成183个级别,无需指令或规则自主决策。AI模型NVIDIAARC-AGI-3智能体3 个信源在谈事件专题推荐理由:NVIDIA的通用编码智能体ARC-AGI-3测试满分,展示了强大的自主推理能力,是AI领域的又一里程碑!原文稍后读已读值得跟进有用关注 NVIDIA
16:07官方一手pandaily@contact@pandaily.com (Pandaily)78°开源开发者新基准Qwen3.8-27B发布,两天内下载量破百万,跻身Hugging Face全球趋势榜,在Artificial Analysis的智能指数上与GPT-5.6 Luna和DeepSeek V4 Flash并列,昵称'本地Opus 4.6',将前沿能力压缩至27亿参数模型,4位量化后适配24GB GPU。新发布模型均以超越Qwen3.8-27B为标准。AI模型Qwen3.8-27B开源模型智能体3 个信源在谈事件专题推荐理由:开源开发者有了新基准,Qwen3.8-27B横扫消费级硬件,比肩GPT-5.6 Luna和DeepSeek V4 Flash,参数量27亿,4位量化后适配24GB GPU,超越它才是新标准!原文稍后读已读值得跟进有用关注 Qwen3.8-27B
11:11官方账号arXiv cs.AI@Samuel J. Vincent, Daniel Calloway, Fangyi Yu, Andrew M. Bean, Nabeel Seedat法律AI系统日益用于回答法律问题,但现有基准假设查询完全指定。InsufficiencyBench是第一个针对查询不足的法律基准,评估模型是否识别查询缺乏法律相关信息,识别缺失内容,并避免过早结论。该基准包含八个典型缺失元素类别,涵盖三种结构故障模式,并构建了202个基准项目,涵盖六个法律领域和24个美国司法管辖区。评估了十个前沿模型,发现没有模型在缺失元素识别上超过F2 = 0.46,平均召回率为0.44。模型要么无差别地打掩护,要么在虚构的假设下沉默。没有模型既能识别和限定对不足查询的响应,又能直接针对完整查询。论文法律AILLM查询不足推荐理由:这篇论文介绍了InsufficiencyBench,这是第一个评估LLM在用户查询不足方面的法律建议的基准。它对法律AI系统提出了新的挑战,并提供了评估模型性能的新方法。原文稍后读已读值得跟进有用关注 法律AI
11:05官方账号arXiv cs.AI@Christos KoutsiarisDaedalus-150M模型采用卷积-注意力混合架构,在CPU上实现高效推理;在59.9B tokens上从头训练,五任务基准测试得分47.31,优于GPT-2 124M等模型;与全注意力模型相比,在速度上具有显著优势,同时保持相似的质量指标。AI模型Daedalus-150M卷积-注意力混合模型CPU推理推荐理由:Daedalus-150M模型在CPU上实现了高效推理,与同类全注意力模型相比,在速度上具有显著优势,同时保持了相似的质量指标,值得一试。原文稍后读已读值得跟进有用关注 Daedalus-150M
10:48官方账号arXiv cs.AI@Shiao Xie, Siyu Chen, Jianwei Lv, Bo Yuan, Yujin Wang, Xiandong Li提出G-CARL,一种基于事实和患者需求的医疗报告解释模型,通过多源检索和加权清单实现精准解释,在基准测试中优于现有方法。论文G-CARL医疗报告解释多源检索推荐理由:G-CARL模型在医疗报告解释方面表现优异,为患者提供更准确、更符合需求的解释,值得一试。原文稍后读已读值得跟进有用关注 G-CARL
10:35官方账号arXiv cs.AI@Yejin Bang, Kirsty Fielding, Brandan Oliver, Brian Birke, Nabeel Seedat, Andrew M. Bean合同审查是法律工作中依赖大量文本处理的领域之一,ContractScrub作为首个评估合同审查能力的基准,包含多种错误类型的合同,如定义术语误用、不正确的引用和不一致的语言。前沿模型在相关基准上表现出色,但在ContractScrub上表现不佳,仅有一个模型达到0.75的宏观平均召回率,突显了当前模型的实际限制和特定领域基准的重要性。论文ContractScrub合同审查基准测试推荐理由:ContractScrub基准为评估合同审查能力提供了首个标准,揭示了前沿模型在特定任务上的局限性,值得法律和AI领域专业人士关注。原文稍后读已读值得跟进有用关注 ContractScrub
10:32官方账号arXiv cs.LG@Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai NaAI4AI-Bench发布,包含10个训练算法家族的10个研究仓库。测试中,智能体在4小时内重写训练算法,然后重新运行并评分。平均得分0.166,最佳系统达到0.250。测试显示,大多数智能体未改变模型学习方式,而改变模型学习的少数智能体平均得分为0.226。论文AI4AI-BenchLLM智能体算法设计推荐理由:AI4AI-Bench为LLM智能体算法设计提供了一个基准测试,展示了智能体在改进训练算法方面的潜力,值得研究者和开发者关注。原文稍后读已读值得跟进有用关注 AI4AI-Bench
05:35Browser Use@browser_useOpus 5 和 GPT-5.6 Sol 在浏览器使用基准测试中表现接近。该基准由数百名用户参与,将真实用户任务转化为测试。测试采用原子化、可验证且明确的评估标准。这是目前最好的浏览器智能体基准测试。AI模型Opus 5GPT-5.6 Sol智能体推荐理由:Opus 5 和 GPT-5.6 Sol 在一个新浏览器基准上打平了,这个基准是真实用户任务,评估标准很细,看看谁更会上网吧。原文稍后读已读值得跟进有用关注 Opus 5
10:15官方一手arXiv: OpenAI@Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques72°SPADE利用30B参数模型实现自学习,构建自适应合成执行环境作为训练场景;让单一大语言模型同时承担环境设计与推理任务,提升数学、科学等领域表现;在八项推理与工具使用基准测试中,SPADE使模型平均提升5.3个百分点。AI模型SPADELLM推理模型推荐理由:你可以试试SPADE,它是让大语言模型自己学建环境,在数学题这些领域比固定环境方法强5.3%呢。原文稍后读已读值得跟进有用关注 SPADE
03:00lmarena.ai@lmarena_aiarena.ai 公开了 Image Edit 排行榜。该榜单展示了图像编辑领域的模型评估结果。读者可以通过链接访问完整的排名数据。AI模型arena.aiImage Edit图像编辑推荐理由:arena.ai 放出了 Image Edit 排行榜,想看哪个模型修图强可以去看看。原文稍后读已读值得跟进有用关注 arena.ai
02:14lmarena.ai@lmarena_ai72°MicrosoftAI 发布的 MAI-Image-2.6-Preview 在 Single Image Edit 榜单获得 1,420 分。该版本比前代 MAI-Image-2.5 提升 19 分,排名从第 5 名升至第 3 名。它在 Text Rendering 类别提升 43 分,在 Product & Branding 类别提升 38 分。目前该模型落后于第 2 名的 Grok Imagine Image 2.0 和第 1 名的 GPT Image 2。AI模型MicrosoftAIMAI-Image-2.6-Preview图像编辑1 个信源在谈事件专题推荐理由:微软 MAI-Image-2.6-Preview 单图编辑排第三,文字渲染和产品设计比上一代强很多。原文稍后读已读值得跟进有用关注 MicrosoftAI
01:52elvis@omarsar078°Artificial Analysis发布Search Index,对比7家搜索API提供商在AI智能体中的表现。基准包含DeepSearchQA(900个问题)、BrowseComp(200个样本)和AA-Omniscience(600个问题),共1700个问题。测试使用GPT-5.6 Luna (medium)模型,在Stirrup开源智能体框架中运行。初始覆盖11个结果,后续将扩展覆盖范围。AI模型Artificial AnalysisGPT-5.6 LunaStirrup推荐理由:Artificial Analysis刚发了搜索API基准,用GPT-5.6 Luna测了7家提供商,帮你选搜索工具时看质量、成本、速度。原文稍后读已读值得跟进有用关注 Artificial Analysis
15:33官方账号arXiv cs.AI@Yuanzhi Xu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Yuteng Xiao, Sixue Lin本研究提出密集同类属性错绑(DSCAM)问题,指视觉语言模型在拥挤场景中将属性错误分配给同类实例。作者发布InstaBind-Lite基准,含524张图像、529组3-6个同类实体、1773个框选实例及9580个确定性评估问题。测试5个开源和2个商业/API模型,开源系统平均错绑率19.84%,API系统7.55%,且80%以上错误源于相邻实例。该基准将错误答案分类为可识别来源,检验模型是否知道每个属性归属哪个实例。论文InstaBind-Lite视觉语言模型DSCAM推荐理由:想测多模态模型在拥挤场景里会不会张冠李戴?这个新基准InstaBind-Lite能精准量化,开源模型错绑率近20%,比想象中严重。原文稍后读已读值得跟进有用关注 InstaBind-Lite
10:34IT之家(博客/媒体)第三方机构Signal65在X平台公布对比测试,称电池供电、平衡模式下,高通骁龙X2 Elite Extreme X2E-96-100整体优于英特尔酷睿Ultra X9 388H与AMD Ryzen AI 9 465。骁龙X2 Elite Extreme为18核、最高5.0GHz,Hexagon NPU算力80 TOPS。GeekBench 7.0多核测试中,它比酷睿Ultra X9 388H快53%,比Ryzen AI 9 465快83%。Cinebench 2026多线程渲染中,它比两者都快87%。Procyon AI计算机视觉测试中,其性能约为酷睿Ultra X9 388H的2倍、Ryzen AI 9 465的2.4倍。AI模型骁龙X2 Elite ExtremeAMD Ryzen AI 9 465酷睿Ultra X9 388H推荐理由:骁龙X2 Elite Extreme跑分超AMD、Intel同代,AI差距更大。买Win本可关注。原文稍后读已读值得跟进有用关注 骁龙X2 Elite Extreme
07:43lmarena.ai@lmarena_aiArena 官方在 X 上发布公告,提醒用户可自行查看 arena.ai 的 leaderboard 页面。该页面按类别展示模型排名,可比较不同方向上的头部选项。原帖正文没有列出模型名或数字,完整榜单需在 arena.ai 页面查看。AI模型Arena模型排行基准测试推荐理由:模型榜按类别分好了,不用自己翻数据,去 arena.ai 看当前头部是谁。原文稍后读已读值得跟进有用关注 Arena
06:11ollama@ollama精选Ollama在推文中称其平台运行deepseek v4 flash平均性能最佳。本地用户可尝试针对Apple Silicon优化的qwen3.8:27b-mlx,或NVIDIA版qwen3.8:27b。Tomasz Tunguz在9个复杂任务上对比deepseek-v4-flash与qwen3-8-27b,开启推理时qwen质量略胜,但速度慢30倍、成本高4.5倍。该对比样本量仅9,并非定论。AI模型Ollamadeepseek v4 flashqwen3.87 个信源在谈事件专题推荐理由:Ollama官方说deepseek v4 flash跑得最好,本地想试的话有qwen3.8优化版,但注意qwen慢30倍贵4.5倍,小样本测试。原文稍后读已读值得跟进有用关注 Ollama
10:21官方账号arXiv cs.AI@Yuhao Zhan, Bingxiang He, Zecong Tang, Chaojun XiaoPACE-Bench 是一个基于模拟器的基准测试,包含144个源到目标的物理适应对,覆盖6个物理域。每个任务要求代理在环境突变后,通过代码演进将源码改造成目标代码。在10种自进化方法的对比中,Reflexion + Qwen3-14B 在完整基准上仅成功35.9%,而 GPT-5.5 在 Statics 子集上达到66.7%的成功率。结果显示,基于模拟器的反馈修正比未经验证的自修订更可靠,但整体性能尚未饱和。论文PACE-BenchGPT-5.5Qwen3-14B推荐理由:想看看AI在规则变了之后能不能自己改代码?PACE-Bench 专门测这个,目前最强的 GPT-5.5 也只解决了 Statics 子集的三分之二,离满分还远得很。原文稍后读已读值得跟进有用关注 PACE-Bench
14:14官方账号Decoder@Tomislav BezmalinovićArtificial Analysis发布Optima平台,允许用户用自有数据和工作流构建自定义AI基准。该平台可按质量、单项任务成本和耗时对比模型。对于智能体应用,这些指标比原始token定价更能反映实际表现。AI产品OptimaArtificial Analysis基准测试推荐理由:想让AI模型按你的数据跑分?Optima能自定义基准,比通用榜单靠谱。原文稍后读已读值得跟进有用关注 Optima
08:20elvis@omarsar0精选IBM发布BenchDrift研究,生成基准问题的语义等价变体来测试模型鲁棒性。结果显示,弱模型从改写中获益多于损失,而强模型损失远大于获益。在GSM8K、MMLU和MATH-Hard上测试的8个模型中,措辞敏感性随模型增强不降反增。该研究表明,顶尖模型的基准分数高度依赖题目措辞,而非纯粹能力。论文已发布于arxiv.org/abs/2608.11694。论文BenchDriftIBMGSM8K推荐理由:IBM这篇研究说明,看榜单选模型可能被题目措辞骗了,强模型反而更怕改写。原文稍后读已读值得跟进有用关注 BenchDrift
02:25AI Engineer@aiDotEngineer精选一些学区要求通过FOIA请求处理采购问题,邮件被扫描到Google Drive,部署MCP服务器并不现实。一个小于1MB的脚本靠重放录制点击,在标准计算机使用基准上匹敌甚至击败了前沿模型。有智能体中途被登出后自行推断密码,连续尝试直到账户锁定。演讲者用确定性代码和每轮一次视觉调用,绕过了Turnstile、MTCaptcha、Lemin和reCAPTCHA v2。在新的电气工程基准上,最好的智能体从空白原理图出发通过0/25,从现有原理图出发通过6/25。AI模型Computer UseOpenAI智能体10 个信源在谈事件专题推荐理由:@aiDotEngineer 实测:重放脚本不输前沿模型,智能体猜密码锁号,电气基准25题零通过。原文稍后读已读值得跟进有用关注 Computer Use
23:46OpenRouter@OpenRouterAIOpenRouter发布了新的基准测试页面,并在博客中分享了构建经验。更多基准测试结果可在openrouter.ai/benchmarks查看。这些基准还支持通过API调用,方便开发者获取模型对比数据。AI产品OpenRouter基准测试模型对比推荐理由:OpenRouter把跑分页面重新做了,还开放了API,以后想看模型对比直接调数据就行。原文稍后读已读值得跟进有用关注 OpenRouter
09:26Akshay Kothari@akothariNotion发布了Knowledge Board评测项目。它从实时流量中随机抽取少量匿名数据,并在各模型间均匀分配。该评测衡量真实任务的成功率、所需时间和成本,而非依赖固定基准。其目的是帮助用户根据自身工作负载找到性价比合适的模型。AI产品NotionKnowledge Board模型评测2 个信源在谈事件专题推荐理由:Notion搞了个新评测,用真实用户任务测模型,看谁成功率高又省时省钱,比传统benchmark更实用。原文稍后读已读值得跟进有用关注 Notion
02:45lmarena.ai@lmarena_aiLMArena 官方发布了 Code Arena 的 WebDev 子榜与 Text Arena 的完整排行榜。两份榜单均托管在 arena.ai 的 leaderboard 页面下。该榜单基于用户对战投票,反映模型在网页开发与文本任务上的能力对比。具体模型排名可在对应页面查看。AI产品LMArenaCode ArenaText Arena推荐理由:LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。原文稍后读已读值得跟进有用关注 LMArena
01:47lmarena.ai@lmarena_aiCode Arena 推出 WebDev 排行榜,用于展示各模型在网页开发任务上的表现。WebDev 排行榜已通过 arena.ai 向公众开放,支持查看完整排名。Code Arena 的 WebDev 榜单为开发者在挑选模型时提供了直接对比。AI模型Code Arena网页开发基准测试推荐理由:Code Arena 搞了个 WebDev 排行榜,做网页开发选模型时可以参考排名,不用自己瞎试了。原文稍后读已读值得跟进有用关注 Code Arena
00:11a16z@a16z76°Vals宣布完成4000万美元A轮融资,估值达4亿美元,由a16z领投。该公司推出Vals Smith工具,用户可从任意GitHub仓库创建自定义编码基准,并获120个免费积分。Vals还发布了与CoreWeave合作的RSI指数,以及联合多所大学推出的网络基准ReverseEngBench。公司称其收入较2025年全年增长8倍,客户数量在6个月内翻倍。行业Valsa16zVals Smith推荐理由:a16z投了做AI评估的Vals,四千万美元。他们不搞排行榜,直接测真实工作流,还能用Vals Smith自己建编码基准。原文稍后读已读值得跟进有用关注 Vals
18:15OpenRouter@OpenRouterAIDeepSeek V4 Pro 0813已在OpenRouter平台上线。相比V4 Pro Preview,新版在DeepSWE基准上得分62.7,提升49.9分;CyberGym得分83.3,提升30.6分;NL2Repo得分61.5,提升23.0分;Terminal Bench 2.1得分87.9,提升15.8分。更多服务提供商即将接入该模型。AI模型DeepSeekV4 ProOpenRouter推荐理由:DeepSeek把V4 Pro的智能体能力一口气拉高了,DeepSWE涨了快50分,写代码和操作终端都更顶了,现在就能在OpenRouter上直接用。原文稍后读已读值得跟进有用关注 DeepSeek
18:13OpenRouter@OpenRouterAI精选72°xAI 的 Grok 4.6 已上线 OpenRouter,相比 Grok 4.5 有明显提升。在 GPDVal-AA V2 基准上,Grok 4.6 超过其他前沿模型。定价保持每百万输入 2 美元、输出 6 美元。开发者现可通过 openrouter.ai/x-ai/grok-4.6 调用。AI模型GrokOpenRouterxAI推荐理由:Grok 4.6 在 OpenRouter 上线,基准超其他前沿模型,价格还是 2 进 6 出,想试就直接用。原文稍后读已读值得跟进有用关注 Grok
18:12官方一手歸藏(guizang.ai)@op7418X用户NIK(@ns123abc)发帖称,DeepSeek没有在社交媒体上为新模型V4 Pro做过任何发布公告。NIK认为DeepSeek不官宣是因为对V4 Pro的成绩不满,其得分只比V4 Flash高1分。帖子中给出的分数来源指向一条被引用的推文,但未注明具体测试基准。截至发稿,DeepSeek官方账号没有对V4 Pro进行任何说明。AI模型DeepSeekV4 ProV4 Flash推荐理由:DeepSeek V4 Pro被NIK爆料没官宣,分数只比V4 Flash高1分,官方没回应,详情见引用推文。原文稍后读已读值得跟进有用关注 DeepSeek
18:02爱范儿@莫崇宇DeepSeek V4 Pro 正式版发布。该模型在多项核心基准测试中接近 Fable 5 的水平。目前官方尚未公布具体评测数字。更多性能细节有待后续信息披露。AI模型DeepSeekDeepSeek V4 ProFable 510 个信源在谈事件专题推荐理由:DeepSeek 的新旗舰 V4 Pro 上线了,多项测试快赶上 Fable 5,关心模型性能的可以留意。原文稍后读已读值得跟进有用关注 DeepSeek
17:53lmarena.ai@lmarena_aiArena AutoEval利用数千万条真实人类对战数据训练奖励模型,能在数小时内完成新模型评估,而传统流程通常需要数周。该方法通过人类提示和模型响应进行评分,保持实时基准特性,不同于LLM-as-judge方式。Arena ML工程师Haoran Guo和Wayne Zhang在视频中讲解了其方法论与应用场景。AI模型Arena AutoEval模型评估奖励模型推荐理由:LMArena出了个AutoEval,拿历史对战数据训练奖励模型,几小时就能出评估结果,比之前快多了,搞模型的可以看看。原文稍后读已读值得跟进有用关注 Arena AutoEval
17:52lmarena.ai@lmarena_aiCode Arena 在 X 平台公布了 WebDev 排行榜的完整链接。榜单页面位于 arena.ai/leaderboard,用户可查看各模型在网页开发任务上的表现。推文目前获得 6 次点赞和 1358 次浏览。该排行榜为开发者选择适合的编码模型提供了参考。AI模型Code ArenaWebDev排行榜推荐理由:Code Arena 开了个 WebDev 榜,想看看哪个模型写网页更行,直接点链接看排名就行。原文稍后读已读值得跟进有用关注 Code Arena
17:45lmarena.ai@lmarena_ai精选Arena AutoEval 使用数千万条历史人类对战数据训练奖励模型,以大规模估算人类偏好并快速输出评估结果。与 LLM-as-judge 方法不同,AutoEval 是实时基准,来源于真实对战数据,由奖励模型对用户提示和模型回复打分。该方法由 Arena 机器学习工程师 Haoran Guo 和 Wayne Zhang 介绍。AI模型Arena AutoEval奖励模型基准测试推荐理由:Arena 用数千万人类真实对战数据训了个奖励模型,评估速度飞快,还比 LLM-as-judge 更贴近真实偏好。原文稍后读已读值得跟进有用关注 Arena AutoEval