01:18elvis@omarsar0精选本文探讨了AI智能体当前存在的问题,如幻觉、成本效率低下等,提出了解决方案。通过将上下文获取视为主动推理,提出了一种名为“最优提问”的方法,并在25至300个候选者的二进制和多路任务上进行了基准测试。论文AI智能体最优提问上下文获取推荐理由:这篇论文提出了AI智能体上下文获取的新方法,值得一读。它通过最优提问,提高了智能体的性能和效率,与现有方法相比有显著不同。原文稍后读已读值得跟进有用关注 AI智能体
02:33Firecrawl@firecrawl_devFirecrawl基准测试发布,可从GitHub仓库自行运行。包含半数查询,剩余用于测试,防止训练。AI模型Firecrawl基准测试GitHub推荐理由:Firecrawl基准测试开放,自己动手测试一下,看看你的模型表现如何!原文稍后读已读值得跟进有用关注 Firecrawl
21:38官方账号NVIDIA AI@NVIDIAAINVIDIA AVO通用编码智能体在ARC-AGI-3推理基准测试中满分,完成183个级别,无需指令或规则自主决策。AI模型NVIDIAARC-AGI-3智能体3 个信源在谈事件专题推荐理由:NVIDIA的通用编码智能体ARC-AGI-3测试满分,展示了强大的自主推理能力,是AI领域的又一里程碑!原文稍后读已读值得跟进有用关注 NVIDIA
16:07官方一手pandaily@contact@pandaily.com (Pandaily)78°开源开发者新基准Qwen3.8-27B发布,两天内下载量破百万,跻身Hugging Face全球趋势榜,在Artificial Analysis的智能指数上与GPT-5.6 Luna和DeepSeek V4 Flash并列,昵称'本地Opus 4.6',将前沿能力压缩至27亿参数模型,4位量化后适配24GB GPU。新发布模型均以超越Qwen3.8-27B为标准。AI模型Qwen3.8-27B开源模型智能体3 个信源在谈事件专题推荐理由:开源开发者有了新基准,Qwen3.8-27B横扫消费级硬件,比肩GPT-5.6 Luna和DeepSeek V4 Flash,参数量27亿,4位量化后适配24GB GPU,超越它才是新标准!原文稍后读已读值得跟进有用关注 Qwen3.8-27B
11:11官方账号arXiv cs.AI@Samuel J. Vincent, Daniel Calloway, Fangyi Yu, Andrew M. Bean, Nabeel Seedat法律AI系统日益用于回答法律问题,但现有基准假设查询完全指定。InsufficiencyBench是第一个针对查询不足的法律基准,评估模型是否识别查询缺乏法律相关信息,识别缺失内容,并避免过早结论。该基准包含八个典型缺失元素类别,涵盖三种结构故障模式,并构建了202个基准项目,涵盖六个法律领域和24个美国司法管辖区。评估了十个前沿模型,发现没有模型在缺失元素识别上超过F2 = 0.46,平均召回率为0.44。模型要么无差别地打掩护,要么在虚构的假设下沉默。没有模型既能识别和限定对不足查询的响应,又能直接针对完整查询。论文法律AILLM查询不足推荐理由:这篇论文介绍了InsufficiencyBench,这是第一个评估LLM在用户查询不足方面的法律建议的基准。它对法律AI系统提出了新的挑战,并提供了评估模型性能的新方法。原文稍后读已读值得跟进有用关注 法律AI
11:05官方账号arXiv cs.AI@Christos KoutsiarisDaedalus-150M模型采用卷积-注意力混合架构,在CPU上实现高效推理;在59.9B tokens上从头训练,五任务基准测试得分47.31,优于GPT-2 124M等模型;与全注意力模型相比,在速度上具有显著优势,同时保持相似的质量指标。AI模型Daedalus-150M卷积-注意力混合模型CPU推理推荐理由:Daedalus-150M模型在CPU上实现了高效推理,与同类全注意力模型相比,在速度上具有显著优势,同时保持了相似的质量指标,值得一试。原文稍后读已读值得跟进有用关注 Daedalus-150M
10:48官方账号arXiv cs.AI@Shiao Xie, Siyu Chen, Jianwei Lv, Bo Yuan, Yujin Wang, Xiandong Li提出G-CARL,一种基于事实和患者需求的医疗报告解释模型,通过多源检索和加权清单实现精准解释,在基准测试中优于现有方法。论文G-CARL医疗报告解释多源检索推荐理由:G-CARL模型在医疗报告解释方面表现优异,为患者提供更准确、更符合需求的解释,值得一试。原文稍后读已读值得跟进有用关注 G-CARL
10:35官方账号arXiv cs.AI@Yejin Bang, Kirsty Fielding, Brandan Oliver, Brian Birke, Nabeel Seedat, Andrew M. Bean合同审查是法律工作中依赖大量文本处理的领域之一,ContractScrub作为首个评估合同审查能力的基准,包含多种错误类型的合同,如定义术语误用、不正确的引用和不一致的语言。前沿模型在相关基准上表现出色,但在ContractScrub上表现不佳,仅有一个模型达到0.75的宏观平均召回率,突显了当前模型的实际限制和特定领域基准的重要性。论文ContractScrub合同审查基准测试推荐理由:ContractScrub基准为评估合同审查能力提供了首个标准,揭示了前沿模型在特定任务上的局限性,值得法律和AI领域专业人士关注。原文稍后读已读值得跟进有用关注 ContractScrub
10:32官方账号arXiv cs.LG@Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai NaAI4AI-Bench发布,包含10个训练算法家族的10个研究仓库。测试中,智能体在4小时内重写训练算法,然后重新运行并评分。平均得分0.166,最佳系统达到0.250。测试显示,大多数智能体未改变模型学习方式,而改变模型学习的少数智能体平均得分为0.226。论文AI4AI-BenchLLM智能体算法设计推荐理由:AI4AI-Bench为LLM智能体算法设计提供了一个基准测试,展示了智能体在改进训练算法方面的潜力,值得研究者和开发者关注。原文稍后读已读值得跟进有用关注 AI4AI-Bench
05:35Browser Use@browser_useOpus 5 和 GPT-5.6 Sol 在浏览器使用基准测试中表现接近。该基准由数百名用户参与,将真实用户任务转化为测试。测试采用原子化、可验证且明确的评估标准。这是目前最好的浏览器智能体基准测试。AI模型Opus 5GPT-5.6 Sol智能体推荐理由:Opus 5 和 GPT-5.6 Sol 在一个新浏览器基准上打平了,这个基准是真实用户任务,评估标准很细,看看谁更会上网吧。原文稍后读已读值得跟进有用关注 Opus 5
10:15官方一手arXiv: OpenAI@Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques72°SPADE利用30B参数模型实现自学习,构建自适应合成执行环境作为训练场景;让单一大语言模型同时承担环境设计与推理任务,提升数学、科学等领域表现;在八项推理与工具使用基准测试中,SPADE使模型平均提升5.3个百分点。AI模型SPADELLM推理模型推荐理由:你可以试试SPADE,它是让大语言模型自己学建环境,在数学题这些领域比固定环境方法强5.3%呢。原文稍后读已读值得跟进有用关注 SPADE
03:00lmarena.ai@lmarena_aiarena.ai 公开了 Image Edit 排行榜。该榜单展示了图像编辑领域的模型评估结果。读者可以通过链接访问完整的排名数据。AI模型arena.aiImage Edit图像编辑推荐理由:arena.ai 放出了 Image Edit 排行榜,想看哪个模型修图强可以去看看。原文稍后读已读值得跟进有用关注 arena.ai
02:14lmarena.ai@lmarena_ai72°MicrosoftAI 发布的 MAI-Image-2.6-Preview 在 Single Image Edit 榜单获得 1,420 分。该版本比前代 MAI-Image-2.5 提升 19 分,排名从第 5 名升至第 3 名。它在 Text Rendering 类别提升 43 分,在 Product & Branding 类别提升 38 分。目前该模型落后于第 2 名的 Grok Imagine Image 2.0 和第 1 名的 GPT Image 2。AI模型MicrosoftAIMAI-Image-2.6-Preview图像编辑1 个信源在谈事件专题推荐理由:微软 MAI-Image-2.6-Preview 单图编辑排第三,文字渲染和产品设计比上一代强很多。原文稍后读已读值得跟进有用关注 MicrosoftAI
01:52elvis@omarsar078°Artificial Analysis发布Search Index,对比7家搜索API提供商在AI智能体中的表现。基准包含DeepSearchQA(900个问题)、BrowseComp(200个样本)和AA-Omniscience(600个问题),共1700个问题。测试使用GPT-5.6 Luna (medium)模型,在Stirrup开源智能体框架中运行。初始覆盖11个结果,后续将扩展覆盖范围。AI模型Artificial AnalysisGPT-5.6 LunaStirrup推荐理由:Artificial Analysis刚发了搜索API基准,用GPT-5.6 Luna测了7家提供商,帮你选搜索工具时看质量、成本、速度。原文稍后读已读值得跟进有用关注 Artificial Analysis
15:33官方账号arXiv cs.AI@Yuanzhi Xu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Yuteng Xiao, Sixue Lin本研究提出密集同类属性错绑(DSCAM)问题,指视觉语言模型在拥挤场景中将属性错误分配给同类实例。作者发布InstaBind-Lite基准,含524张图像、529组3-6个同类实体、1773个框选实例及9580个确定性评估问题。测试5个开源和2个商业/API模型,开源系统平均错绑率19.84%,API系统7.55%,且80%以上错误源于相邻实例。该基准将错误答案分类为可识别来源,检验模型是否知道每个属性归属哪个实例。论文InstaBind-Lite视觉语言模型DSCAM推荐理由:想测多模态模型在拥挤场景里会不会张冠李戴?这个新基准InstaBind-Lite能精准量化,开源模型错绑率近20%,比想象中严重。原文稍后读已读值得跟进有用关注 InstaBind-Lite
10:34IT之家(博客/媒体)第三方机构Signal65在X平台公布对比测试,称电池供电、平衡模式下,高通骁龙X2 Elite Extreme X2E-96-100整体优于英特尔酷睿Ultra X9 388H与AMD Ryzen AI 9 465。骁龙X2 Elite Extreme为18核、最高5.0GHz,Hexagon NPU算力80 TOPS。GeekBench 7.0多核测试中,它比酷睿Ultra X9 388H快53%,比Ryzen AI 9 465快83%。Cinebench 2026多线程渲染中,它比两者都快87%。Procyon AI计算机视觉测试中,其性能约为酷睿Ultra X9 388H的2倍、Ryzen AI 9 465的2.4倍。AI模型骁龙X2 Elite ExtremeAMD Ryzen AI 9 465酷睿Ultra X9 388H推荐理由:骁龙X2 Elite Extreme跑分超AMD、Intel同代,AI差距更大。买Win本可关注。原文稍后读已读值得跟进有用关注 骁龙X2 Elite Extreme
07:43lmarena.ai@lmarena_aiArena 官方在 X 上发布公告,提醒用户可自行查看 arena.ai 的 leaderboard 页面。该页面按类别展示模型排名,可比较不同方向上的头部选项。原帖正文没有列出模型名或数字,完整榜单需在 arena.ai 页面查看。AI模型Arena模型排行基准测试推荐理由:模型榜按类别分好了,不用自己翻数据,去 arena.ai 看当前头部是谁。原文稍后读已读值得跟进有用关注 Arena
06:11ollama@ollama精选Ollama在推文中称其平台运行deepseek v4 flash平均性能最佳。本地用户可尝试针对Apple Silicon优化的qwen3.8:27b-mlx,或NVIDIA版qwen3.8:27b。Tomasz Tunguz在9个复杂任务上对比deepseek-v4-flash与qwen3-8-27b,开启推理时qwen质量略胜,但速度慢30倍、成本高4.5倍。该对比样本量仅9,并非定论。AI模型Ollamadeepseek v4 flashqwen3.87 个信源在谈事件专题推荐理由:Ollama官方说deepseek v4 flash跑得最好,本地想试的话有qwen3.8优化版,但注意qwen慢30倍贵4.5倍,小样本测试。原文稍后读已读值得跟进有用关注 Ollama
10:21官方账号arXiv cs.AI@Yuhao Zhan, Bingxiang He, Zecong Tang, Chaojun XiaoPACE-Bench 是一个基于模拟器的基准测试,包含144个源到目标的物理适应对,覆盖6个物理域。每个任务要求代理在环境突变后,通过代码演进将源码改造成目标代码。在10种自进化方法的对比中,Reflexion + Qwen3-14B 在完整基准上仅成功35.9%,而 GPT-5.5 在 Statics 子集上达到66.7%的成功率。结果显示,基于模拟器的反馈修正比未经验证的自修订更可靠,但整体性能尚未饱和。论文PACE-BenchGPT-5.5Qwen3-14B推荐理由:想看看AI在规则变了之后能不能自己改代码?PACE-Bench 专门测这个,目前最强的 GPT-5.5 也只解决了 Statics 子集的三分之二,离满分还远得很。原文稍后读已读值得跟进有用关注 PACE-Bench
14:14官方账号Decoder@Tomislav BezmalinovićArtificial Analysis发布Optima平台,允许用户用自有数据和工作流构建自定义AI基准。该平台可按质量、单项任务成本和耗时对比模型。对于智能体应用,这些指标比原始token定价更能反映实际表现。AI产品OptimaArtificial Analysis基准测试推荐理由:想让AI模型按你的数据跑分?Optima能自定义基准,比通用榜单靠谱。原文稍后读已读值得跟进有用关注 Optima
08:20elvis@omarsar0精选IBM发布BenchDrift研究,生成基准问题的语义等价变体来测试模型鲁棒性。结果显示,弱模型从改写中获益多于损失,而强模型损失远大于获益。在GSM8K、MMLU和MATH-Hard上测试的8个模型中,措辞敏感性随模型增强不降反增。该研究表明,顶尖模型的基准分数高度依赖题目措辞,而非纯粹能力。论文已发布于arxiv.org/abs/2608.11694。论文BenchDriftIBMGSM8K推荐理由:IBM这篇研究说明,看榜单选模型可能被题目措辞骗了,强模型反而更怕改写。原文稍后读已读值得跟进有用关注 BenchDrift
02:25AI Engineer@aiDotEngineer精选一些学区要求通过FOIA请求处理采购问题,邮件被扫描到Google Drive,部署MCP服务器并不现实。一个小于1MB的脚本靠重放录制点击,在标准计算机使用基准上匹敌甚至击败了前沿模型。有智能体中途被登出后自行推断密码,连续尝试直到账户锁定。演讲者用确定性代码和每轮一次视觉调用,绕过了Turnstile、MTCaptcha、Lemin和reCAPTCHA v2。在新的电气工程基准上,最好的智能体从空白原理图出发通过0/25,从现有原理图出发通过6/25。AI模型Computer UseOpenAI智能体10 个信源在谈事件专题推荐理由:@aiDotEngineer 实测:重放脚本不输前沿模型,智能体猜密码锁号,电气基准25题零通过。原文稍后读已读值得跟进有用关注 Computer Use
23:46OpenRouter@OpenRouterAIOpenRouter发布了新的基准测试页面,并在博客中分享了构建经验。更多基准测试结果可在openrouter.ai/benchmarks查看。这些基准还支持通过API调用,方便开发者获取模型对比数据。AI产品OpenRouter基准测试模型对比推荐理由:OpenRouter把跑分页面重新做了,还开放了API,以后想看模型对比直接调数据就行。原文稍后读已读值得跟进有用关注 OpenRouter
09:26Akshay Kothari@akothariNotion发布了Knowledge Board评测项目。它从实时流量中随机抽取少量匿名数据,并在各模型间均匀分配。该评测衡量真实任务的成功率、所需时间和成本,而非依赖固定基准。其目的是帮助用户根据自身工作负载找到性价比合适的模型。AI产品NotionKnowledge Board模型评测2 个信源在谈事件专题推荐理由:Notion搞了个新评测,用真实用户任务测模型,看谁成功率高又省时省钱,比传统benchmark更实用。原文稍后读已读值得跟进有用关注 Notion
02:45lmarena.ai@lmarena_aiLMArena 官方发布了 Code Arena 的 WebDev 子榜与 Text Arena 的完整排行榜。两份榜单均托管在 arena.ai 的 leaderboard 页面下。该榜单基于用户对战投票,反映模型在网页开发与文本任务上的能力对比。具体模型排名可在对应页面查看。AI产品LMArenaCode ArenaText Arena推荐理由:LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。原文稍后读已读值得跟进有用关注 LMArena
01:47lmarena.ai@lmarena_aiCode Arena 推出 WebDev 排行榜,用于展示各模型在网页开发任务上的表现。WebDev 排行榜已通过 arena.ai 向公众开放,支持查看完整排名。Code Arena 的 WebDev 榜单为开发者在挑选模型时提供了直接对比。AI模型Code Arena网页开发基准测试推荐理由:Code Arena 搞了个 WebDev 排行榜,做网页开发选模型时可以参考排名,不用自己瞎试了。原文稍后读已读值得跟进有用关注 Code Arena
00:11a16z@a16z76°Vals宣布完成4000万美元A轮融资,估值达4亿美元,由a16z领投。该公司推出Vals Smith工具,用户可从任意GitHub仓库创建自定义编码基准,并获120个免费积分。Vals还发布了与CoreWeave合作的RSI指数,以及联合多所大学推出的网络基准ReverseEngBench。公司称其收入较2025年全年增长8倍,客户数量在6个月内翻倍。行业Valsa16zVals Smith推荐理由:a16z投了做AI评估的Vals,四千万美元。他们不搞排行榜,直接测真实工作流,还能用Vals Smith自己建编码基准。原文稍后读已读值得跟进有用关注 Vals
18:15OpenRouter@OpenRouterAIDeepSeek V4 Pro 0813已在OpenRouter平台上线。相比V4 Pro Preview,新版在DeepSWE基准上得分62.7,提升49.9分;CyberGym得分83.3,提升30.6分;NL2Repo得分61.5,提升23.0分;Terminal Bench 2.1得分87.9,提升15.8分。更多服务提供商即将接入该模型。AI模型DeepSeekV4 ProOpenRouter推荐理由:DeepSeek把V4 Pro的智能体能力一口气拉高了,DeepSWE涨了快50分,写代码和操作终端都更顶了,现在就能在OpenRouter上直接用。原文稍后读已读值得跟进有用关注 DeepSeek
18:13OpenRouter@OpenRouterAI精选72°xAI 的 Grok 4.6 已上线 OpenRouter,相比 Grok 4.5 有明显提升。在 GPDVal-AA V2 基准上,Grok 4.6 超过其他前沿模型。定价保持每百万输入 2 美元、输出 6 美元。开发者现可通过 openrouter.ai/x-ai/grok-4.6 调用。AI模型GrokOpenRouterxAI推荐理由:Grok 4.6 在 OpenRouter 上线,基准超其他前沿模型,价格还是 2 进 6 出,想试就直接用。原文稍后读已读值得跟进有用关注 Grok
18:12官方一手歸藏(guizang.ai)@op7418X用户NIK(@ns123abc)发帖称,DeepSeek没有在社交媒体上为新模型V4 Pro做过任何发布公告。NIK认为DeepSeek不官宣是因为对V4 Pro的成绩不满,其得分只比V4 Flash高1分。帖子中给出的分数来源指向一条被引用的推文,但未注明具体测试基准。截至发稿,DeepSeek官方账号没有对V4 Pro进行任何说明。AI模型DeepSeekV4 ProV4 Flash推荐理由:DeepSeek V4 Pro被NIK爆料没官宣,分数只比V4 Flash高1分,官方没回应,详情见引用推文。原文稍后读已读值得跟进有用关注 DeepSeek
18:02爱范儿@莫崇宇DeepSeek V4 Pro 正式版发布。该模型在多项核心基准测试中接近 Fable 5 的水平。目前官方尚未公布具体评测数字。更多性能细节有待后续信息披露。AI模型DeepSeekDeepSeek V4 ProFable 510 个信源在谈事件专题推荐理由:DeepSeek 的新旗舰 V4 Pro 上线了,多项测试快赶上 Fable 5,关心模型性能的可以留意。原文稍后读已读值得跟进有用关注 DeepSeek
17:53lmarena.ai@lmarena_aiArena AutoEval利用数千万条真实人类对战数据训练奖励模型,能在数小时内完成新模型评估,而传统流程通常需要数周。该方法通过人类提示和模型响应进行评分,保持实时基准特性,不同于LLM-as-judge方式。Arena ML工程师Haoran Guo和Wayne Zhang在视频中讲解了其方法论与应用场景。AI模型Arena AutoEval模型评估奖励模型推荐理由:LMArena出了个AutoEval,拿历史对战数据训练奖励模型,几小时就能出评估结果,比之前快多了,搞模型的可以看看。原文稍后读已读值得跟进有用关注 Arena AutoEval
17:52lmarena.ai@lmarena_aiCode Arena 在 X 平台公布了 WebDev 排行榜的完整链接。榜单页面位于 arena.ai/leaderboard,用户可查看各模型在网页开发任务上的表现。推文目前获得 6 次点赞和 1358 次浏览。该排行榜为开发者选择适合的编码模型提供了参考。AI模型Code ArenaWebDev排行榜推荐理由:Code Arena 开了个 WebDev 榜,想看看哪个模型写网页更行,直接点链接看排名就行。原文稍后读已读值得跟进有用关注 Code Arena
17:45lmarena.ai@lmarena_ai精选Arena AutoEval 使用数千万条历史人类对战数据训练奖励模型,以大规模估算人类偏好并快速输出评估结果。与 LLM-as-judge 方法不同,AutoEval 是实时基准,来源于真实对战数据,由奖励模型对用户提示和模型回复打分。该方法由 Arena 机器学习工程师 Haoran Guo 和 Wayne Zhang 介绍。AI模型Arena AutoEval奖励模型基准测试推荐理由:Arena 用数千万人类真实对战数据训了个奖励模型,评估速度飞快,还比 LLM-as-judge 更贴近真实偏好。原文稍后读已读值得跟进有用关注 Arena AutoEval
17:43官方账号arXiv cs.AI@Jin Lu, Xuening Han, Yang Zhong, Lin Tan, Kevin Luo, Andrew Gacek, Neha RungtaVICBench 面向代码漏洞检测,包含 100 个经人工专家与智能体工作流双重验证的漏洞引入提交,对应 100 个 CVE,覆盖 88 个项目的 Python、Java、C++ 代码。该基准涵盖 48 种 CWE 类型,修复补丁平均 38.6 行,漏洞引入提交平均 252.5 行,复杂度高于此前数据集。评测中,现有最先进的 V-SZZ 和 LLM4SZZ 算法 F1 值仅为 33.3%-40.1%,表明自动化检测仍需大量人工介入。VICBench 能更可靠地评估漏洞检测方法的真实表现。论文VICBenchCVE漏洞检测推荐理由:VICBench 搞了个 100 个真实漏洞提交的基准,覆盖 Python/Java/C++,平均改动比旧数据集大不少,测漏洞检测用它更靠谱。原文稍后读已读值得跟进有用关注 VICBench
03:27官方一手歸藏(guizang.ai)@op741871°DeepSeek V4 Pro 正式版 0813 已发布。从流传的测试成绩来看,DeepSeek V4 Pro 依然相当爆炸。目前官方尚未公布 DeepSeek V4 Pro 的具体基准得分。社区对 DeepSeek V4 Pro 的讨论热度很高。AI模型DeepSeekV4 Pro基准测试推荐理由:DeepSeek 又发新版本了,V4 Pro 0813 的社区测试成绩看着很猛,想感受下有多强就点进来吧。原文稍后读已读值得跟进有用关注 DeepSeek
00:57Jerry Liu@jerryjliu073°LlamaParse 团队发布 36 页 ArXiv 论文,介绍企业文档抽取基准 ExtractBench。该基准用 370 份企业文档、4869 页、67 种文档类型评估 14 套抽取系统。核心发现是:超过 50 页的长文档会让商业 VLM 召回率跌到 35% 以下,原因是静默截断表格行。ExtractBench 用价值准确率、空间溯源和单页成本等指标做确定性评测,不依赖 LLM 裁判。同时发布的 LlamaParse Agentic Plus 在榜单上取得 95.6% 价值准确率,成本不到最接近竞品的三分之一。论文ExtractBenchLlamaParseAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse 发布 ExtractBench:长文档让商业模型召回崩到 35%;自家 Agentic Plus 95.6% 登顶,成本更低。原文稍后读已读值得跟进有用关注 ExtractBench
00:27lmarena.ai@lmarena_ai79°xAI 推出 Grok 4.6,在 LMArena 的 WebDev 基准上以 1618 分排名第7。相较 Grok 4.5 的 1553 分(第13名)提升明显,且定价保持不变。目前 Grok 4.6 与 GPT-5.6 Sol xHigh(1622 分)和 Claude Fable 5(1627 分)仅差 4 到 9 分,三者同处第5至第7区间。AI模型Grok 4.6xAILMArena推荐理由:xAI 把 Grok 4.6 放出来了,网页开发能力直接冲到 LMArena 第7,跟 GPT-5.6 和 Claude 最新版就几分之差,这代提升挺猛。原文稍后读已读值得跟进有用关注 Grok 4.6
19:32The Rundown AI@therundownaiAnthropic近日发布了一项新研究,聚焦于提升Claude模型在复杂任务中的表现。该研究引入了新的训练方法,使Claude在推理和代码生成任务上取得了显著进步。在多个基准测试中,Claude的得分超越了前代版本,接近GPT-4的水平。研究团队还公开了部分技术细节,为后续模型优化提供了方向。论文AnthropicClaude推理模型10 个信源在谈事件专题推荐理由:Anthropic发了新研究,Claude在推理和代码上又强了,接近GPT-4,想了解细节的可以看看。原文稍后读已读值得跟进有用关注 Anthropic
18:22官方账号arXiv cs.LG@Shiqi Huang, Jiani He, Dingyan Shang, Yihua Xu, Jize Li, Yan Lyu, Lashimi Muraleedharan NairDACRI 研究提出 CriticalSCM-Bench v1,一个带因果真值的合成基准,用于评估供应链干预策略。相比全信息静态基准,LambdaMART 在中位归一化净值上提升 5.7% 至 16.2%,在半导体和关键材料场景有统计支持,但在数字基础设施上不如领域常量缓冲策略。部分和延迟信息下,LambdaMART 保留全信息价值的 33% 至 75%。压力测试显示干预保真度、时机、成本和未见过中断会改变策略排序,关键材料的外推保留最弱。540 次生成中的受保护解释研究在确定性验证和模板回退后保留了所有固定干预决策,但措辞不稳定。论文DACRI供应链因果推断推荐理由:这篇论文用合成基准测了不同干预策略在供应链里的实际效果,LambdaMART 在某些场景确实更优,但数字基础设施上简单策略反而更强,值得做决策的人看看。原文稍后读已读值得跟进有用关注 DACRI