10:58官方账号Epoch AI@EpochAIResearchEpoch AI Research 推出新基准 EBR-bench,专门测量 AI 的实时学习(on-the-fly learning)能力。AI 反复玩一款名为 Earthborne Rangers 的高难度棋盘游戏,并尝试从错误中学习。截至目前,AI 未显示出任何改进迹象。AI模型EBR-benchEpoch AIEarthborne Rangers2 个信源在谈事件专题推荐理由:Epoch AI 搞了个新基准 EBR-bench,专门看 AI 能不能边玩边学,结果 Earthborne Rangers 这游戏 AI 完全没进步,挺有意思的。原文稍后读已读值得跟进有用关注 EBR-bench
10:01官方账号arXiv cs.AI@Rintaro Otsubo, Ryo Fujii, Reina Ishikawa, Taiki Kanaya, Kanta Sawafuji, Hiroki Kajita, Shigeki Sakai, Hideo Saito, Ryo HachiumaAnyGroundBench是一个域适应基准测试,将时空视频定位评估从静态零样本测试转向严格的域适应。它覆盖动物、工业、运动、手术和公共安全五个专业领域,提供新拍摄视频(如专家标注的小鼠行为)与现有数据集配对,并配备密集的高保真时空标注。评估了15个SOTA视觉语言模型(VLM)的零样本泛化和上下文学习(ICL)能力。结果表明,当前模型在专业领域上的零样本和基于ICL的适应均失败,暴露出时空推理的关键缺陷。论文AnyGroundBenchVLM视频定位推荐理由:想看看现在的VLM在专业视频场景下有多拉胯?这篇论文搞了个AnyGroundBench基准,测了15个模型在动物、手术等5个领域的表现,结果全翻车了。原文稍后读已读值得跟进有用关注 AnyGroundBench
08:00lmarena.ai@lmarena_ai精选Arena.ai 收集了 Claude Fable 5 重新部署前后在 Text、Vision、Document、Code 和 Agent 五个 Arena 的数千投票,结果显示得分基本一致。Fable 5 在 Text、Document、Vision 和 Code Arena: Frontend 仍处前沿,Frontend 约 20 分下降在置信区间内。Agent Arena 中 Fable 5 曾排名第一,该评测基于数百万真实任务,使用因果追踪衡量模型表现。AI模型Fable 5AnthropicAgent Arena10 个信源在谈事件专题推荐理由:Fable 5 重部署后各维度表现稳定,Agent 依旧最强,前端小幅波动属正常。想看前沿模型对比可以关注。原文稍后读已读值得跟进有用关注 Fable 5
11:11官方账号arXiv cs.LG@David Shulman本文揭示射频信号识别基准测试中数据泄露导致精度高估的问题。通过Cover函数计数定理证明,当独立录音数R小于等于特征维度d/2时,分类器可记忆录音-标签映射,使朴素准确率趋近1。在合成实验中,10次种子测试显示,朴素平衡准确率从贝叶斯水平升至1.0,而分组评估降至随机水平,最大差距约0.5。在公开DroneRF数据集上,无人机型号识别(AR vs Bebop)的宏F1从0.74骤降至0.46(二类随机水平)。消融实验证实几乎所有通胀源自片段级数据泄露。论文DroneRF数据泄露UAV推荐理由:这篇论文用严格的数学证明和实验告诉你,为什么很多射频无人机识别论文的99%准确率不可信——数据泄露让测试集形同虚设。原文稍后读已读值得跟进有用关注 DroneRF
11:10官方账号arXiv cs.LG@Yahya Aalaila, Gerrit Großmann, Sebastian VollmerSeahorse是一个统一基准框架,用于可重复的时空点过程(STPP)实验。它通过编码-演化-解码接口形式化神经STPP,并在单一可执行协议下训练、调优和评估所有模型家族。Seahorse附带HawkesNest合成压力测试套件,能暴露不同模型家族(如强度模型、条件密度模型)在复杂事件模式下的归纳偏差。该框架解决了现有实现因预处理、坐标归一化等差异导致的比较不可靠问题。论文SeahorseSTPP时空点过程推荐理由:这篇论文搞了个Seahorse框架,专门统一各种时空事件模型的评测标准,还带压力测试套件,能看清哪个模型在复杂场景下更强。原文稍后读已读值得跟进有用关注 Seahorse
10:05官方账号arXiv cs.LG@Nils Neukirch, Martin Maurer, Nils Strodthoff该研究在5个任务(肿瘤体积与分期分类、2年生存预测、组织学分类、年龄预测)上系统对比了5种特征提取器(Curia、Curia-2、DINOv3、Radiomics2D、Radiomics3D)、7种分类头(TabPFN、TabICL、XGBoost、CatBoost、Random Forest、logistic regression、Ridge)和3种分割方案。模型在LUNG1(n=338)上训练,在内部测试集(n=84)和外部LUNG2队列(n=211)上评估,以最差跨队列性能为主要指标。结果表明,主导设计因素与任务相关:分割影响体积和分期分类,而分类器选择主导生存、组织学和年龄预测。放射组学在肿瘤体积、分期和生存上具有竞争力(部分由于标签推导效应),Curia变体在生存上达到相近峰值分数,DINOv3在所有任务上略逊一筹。推荐Curia结合肿瘤分割和CatBoost头作为安全默认方案,在三个主要临床任务上平均排名最佳。论文CuriaDINOv3Radiomics推荐理由:这篇论文用338例训练、295例测试的严格基准,告诉你肺CT分析到底该选Curia还是放射组学,以及为什么任务不同最优方案不同。原文稍后读已读值得跟进有用关注 Curia
02:14Ethan Mollick@emollick作者指出,当涉及多个判断和决策叠加时,不同模型的差异会显著放大。标准基准测试无法反映这种差异,例如Gemini 3.1和GPT-5.5对咖啡馆财务损失的敏感度可能截然不同。用户需要自行针对特定任务进行基准测试,才能获得真实可用性评估。技巧Gemini 3.1GPT-5.5模型评估推荐理由:真的得自己测测模型,别光看跑分——比如Gemini 3.1和GPT-5.5在担心亏损上表现不一样,别人测的不等于你用的。原文稍后读已读值得跟进有用关注 Gemini 3.1
22:56IT之家(博客/媒体)OpenAI 发布 GeneBench-Pro 基准测试,用于评估 AI 模型在生物学计算中的真实研究能力。该基准包含 129 道题目,覆盖基因组学、定量生物学等 10 大领域和 21 子领域。每道题提供接近真实科研环境的数据集,要求模型自主探索、选择分析方法并给出答案。OpenAI 采用合成数据避免评分偏差,确保模型真正理解问题而非走捷径。目前已在 Hugging Face 开源 10 道示例题,后续将开放 50 道题给 Artificial Analysis 第三方评测。AI模型GeneBench-ProOpenAI生物学计算10 个信源在谈事件专题推荐理由:想测测 AI 在生物学研究里的实战能力?OpenAI 搞了个 GeneBench-Pro 基准,129 道题,合成数据防作弊,快看看你的模型能得几分。原文稍后读已读值得跟进有用关注 GeneBench-Pro
09:28官方一手arXiv: DeepSeek@Lisa Taldir, Muhammad Ahmad Saeed, David Defour, Pablo de Oliveira Castro, Eric Petit论文发布了InterFLOPBench,一个包含90个C语言内核和1130个测试样本的浮点错误分类基准。它评估了14个LLMs在六类错误(抵消、比较、除以零、溢出、下溢、NaN)上的多标签分类性能。结果显示,Qwen 3 32b、Gemini 2.5 Flash、Phi 4 Reasoning、DeepSeek R1T2和gpt-oss(20b和120b)等模型总体F1分数超过0.88。不同错误类别表现差异大:除以零平均F1为0.8479,而下溢和抵消分别只有0.6059和0.6164。论文InterFLOPBenchLLM浮点错误推荐理由:这篇论文搞了个InterFLOPBench,专门测LLM找C语言浮点bug。Qwen 3和Gemini 2.5等模型表现最强,F1超0.88。写代码的必看!原文稍后读已读值得跟进有用关注 InterFLOPBench
08:21OpenRouter@OpenRouterAIOpenRouter 持续在 GPQA 和 TAU-Bench 上测试多数开放权重模型,并公开发布结果。这些数据用于其 AutoExacto 元基准,该基准默认用于路由工具调用。在最新排名中,Parasail.io 和 Zai_org 位列第一。AI模型OpenRouterGPQATAU-Bench2 个信源在谈事件专题推荐理由:想知道哪些开放权重模型在 GPQA 和 TAU-Bench 上表现最好?OpenRouter 每周跑分、公开排名,还能帮你选最靠谱的推理服务。原文稍后读已读值得跟进有用关注 OpenRouter
07:16Cognition@cognition_labsCognition 发布了 FrontierCode (Extended) 基准,用于评估真实世界编程任务的可合并性和质量。Claude Sonnet 5 在该基准上得分 53.8%,通过率为 57.6%。该成绩高于 Opus 4.8 的表现,但 Cognition 表示随着后续基准调整,相对排名可能发生变化。AI模型ClaudeSonnet 5FrontierCode推荐理由:Cognition 用 FrontierCode 实测了 Sonnet 5 的工程能力,它比 Opus 4.8 更强,值得关注。原文稍后读已读值得跟进有用关注 Claude
04:54lmarena.ai@lmarena_aiAgent Arena 发布博客介绍因果追踪方法论,用于分析智能体在评测中的行为归因。该方法通过因果干预识别智能体决策的关键组件。博客详细阐述了如何将因果追踪应用于 Agent Arena 基准测试,帮助理解智能体表现差异的来源。论文Agent Arena因果追踪智能体推荐理由:想知道智能体在评测中为什么这么表现吗?Agent Arena 这篇博客用因果追踪拆解原因,比只看分数更深入。原文稍后读已读值得跟进有用关注 Agent Arena
04:32coderabbitai@coderabbitaiCodeRabbit AI 对 Claude Sonnet 5 进行了代码审查基准测试。结果发现,该模型在生成更干净的评论方面表现突出,评论精度相比前代提升约9%。模型展现出更深层的思考能力,并在编码技能上有所增强。完整评测细节已在下方链接中公布。AI模型Claude Sonnet 5代码审查推理模型推荐理由:CodeRabbit AI 跑了 Claude Sonnet 5 的代码审查评测,评论精度提了9%,编码更聪明,值得看看细节。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
03:00官方账号Decoder@Matthias Bastian76°Anthropic推出Claude Sonnet 5,在GDPval-AA v2知识工作测试中得分1,618,超越前代Sonnet 4.6和更贵的Opus 4.8。该模型在网络安全任务上得分远低于美国政府当前封锁的模型。Sonnet 5进一步缩小了与Opus系列的价格-性能差距。AI模型Claude Sonnet 5AnthropicOpus10 个信源在谈事件专题推荐理由:Anthropic的新模型Sonnet 5,基准测试上超过自家大哥Opus 4.8,价格还更低,挺能打的。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
02:14Lovable@lovable_devLovable 宣布集成 Claude Sonnet 5,替代之前的 Sonnet 模型。内部基准测试显示,Claude Sonnet 5 能在更低成本下完成更多任务,尤其在识别危险请求方面表现突出。安全能力较前代 Sonnet 模型显著提升。此举让 Lovable 用户能直接使用更高效的模型。AI产品LovableClaude Sonnet 5安全推荐理由:Lovable 直接上了 Claude Sonnet 5,说干活多花得少,还更安全,感兴趣可以试试看。原文稍后读已读值得跟进有用关注 Lovable
02:08官方账号OpenAI@OpenAI精选OpenAI推出GeneBench-Pro,这是一个面向AI agent的研究级基准测试。该基准要求agent在混乱的生物数据中导航并选择正确的分析路径。它旨在衡量AI在真实计算研究中的判断能力,而非简单准确率。AI模型OpenAIGeneBench-Pro智能体10 个信源在谈事件专题推荐理由:想看看AI分析生物数据能多聪明?OpenAI这个新测试专考agent的判断力,挺有意思的。原文稍后读已读值得跟进有用关注 OpenAI
01:15AK@_akhaliqOSWorld2.0 是一个新发布的基准测试,专门用于评估计算机使用智能体在长周期真实世界任务中的表现。该基准包含 100 个任务,每个任务平均需要 10 步以上才能完成。相比 OSWorld 1.0,新版本增加了更多涉及多步骤规划和错误恢复的场景。测试结果显示,当前最先进的模型(如 GPT-4o)在 OSWorld2.0 上的成功率仅为 15.3%,表明长周期任务仍是 AI 面临的关键挑战。AI模型OSWorld2.0基准测试智能体推荐理由:想看看 AI 在真实电脑操作上能走多远?OSWorld2.0 拿 100 个长任务测智能体,GPT-4o 都只拿到 15% 成功率,差距一目了然。原文稍后读已读值得跟进有用关注 OSWorld2.0
01:07官方一手OpenAI Blog(博客/媒体)GeneBench-Pro是一个新发布的基准测试,用于评估AI在基因组学、生物学和科学研究中的性能。该基准使用复杂真实世界数据集,涵盖多种科学任务。它旨在衡量模型在基因分析和生物信息学方面的能力。AI模型GeneBench-Pro基因组学基准测试2 个信源在谈事件专题推荐理由:GeneBench-Pro用真实数据测AI在基因组学上的表现,搞科研的可以看看到底谁更强。原文稍后读已读值得跟进有用关注 GeneBench-Pro
10:59官方账号arXiv cs.LG@Matthias Blaschke, Daniel Kienzle, Zsuzsanna Koczor-Benda, Julian Lorenz, Rainer Lienhart, Fabian Pauly新发布的Nanotechnology Molecular Optimization (NMO) Benchmark 替代传统药物发现中的代理指标,使用量子模拟评分。该基准对生成式分子模型提出严格结构约束和崎岖适应度景观。测试发现先进的分子优化方法在NMO任务上表现不及更简单的基线方法。研究团队开发了新基线方法,包含用于建模结构约束的新表示和消除制药数据集偏见的域无关预训练策略。该方法超越了最先进的物理性质结果,并揭示此前未知的结构基序。AI模型NMONanotechnology Molecular Optimization分子优化推荐理由:科学家们搞了个新基准NMO,专门用来测试分子优化算法在纳米技术上的表现,直接用量子模拟打分,结果发现之前的先进方法还不如简单方法好用。原文稍后读已读值得跟进有用关注 NMO
10:40官方一手arXiv: DeepSeek@Camilo Chacón SartoriEMPATH是一个多语言审计-法官基准,用于评估情感支持聊天机器人的安全性。该基准使用审计模型模拟求助用户,基于140个种子指令和34个人设生成多轮对话,法官模型从19个指标(分属五个维度)评分。基准在墨西哥西班牙语和美国英语上构建,研究发现标准评分在19个指标中的10个上存在膨胀,校准后恢复了区分度。在三个前沿模型(含一个开源模型)上测试,聚合分数差异在0.74分内,但具体指标差异可达6分。运行间可靠性差,deepseek-v4-pro在温度0下每次运行生成不同对话。AI模型EMPATH情感支持聊天机器人AI安全推荐理由:这个新基准EMPATH专测情感支持聊天机器人的安全漏洞,用AI模拟求助者进行多语言多轮对话,发现主流模型评分虚高且不稳定,值得一做。原文稍后读已读值得跟进有用关注 EMPATH
09:21官方一手arXiv: DeepSeek@Aditya Pratap Singh该论文对10个OCR系统在天城体(印地语)上进行基准测试,包括EasyOCR、Qwen2.5-VL-3B、Qwen3-VL-8B、DeepSeek-OCR、Gemini 2.5 Flash、Claude Opus 4.7、GPT-5.5等。在清洁文本上所有系统chrF++在91-98之间,但在真实扫描图像中,9个系统性能大幅下降(EasyOCR从93.6跌至58.3)。Qwen3-VL-8B(75.2,可在单张24GB GPU运行)超过GPT-5.5(58.5)和olmOCR-7B(40.5),Gemini和Claude领先(86.3和82.2)。论文还提出基于ByT5的字节级后校正器可将廉价引擎chrF++提升1.2-1.5。论文OCR天城体基准测试推荐理由:如果你对多语言OCR或印地语文本识别感兴趣,这篇论文揭示了主流模型在天城体上的真实差距,尤其是GPT-5.5表现不如开源Qwen3-VL-8B。原文稍后读已读值得跟进有用关注 OCR
03:07@koltregaskes@koltregaskesEthan Mollick根据Artificial Analysis的AA-Briefcase分数,绘制了AI模型在复杂多周咨询任务上的表现趋势。AA-Briefcase测试模型处理电子表格和策略规划等可交付成果。GLM-5.2等开源模型目前达到的水平,与闭源模型三个月前的分数一致。高端闭源模型仍保持明显领先,但差距在缩小。AI模型GLM-5.2AA-Briefcase开源模型推荐理由:开源模型GLM-5.2在AA-Briefcase智能体基准上只差闭源三个月了,做复杂任务时值得试试看。原文稍后读已读值得跟进有用关注 GLM-5.2
17:45Browser Use@browser_useBrowser Use 团队使用 v4 版本构建 QA 基准测试,将 GLM 5.2、Opus 4.7、GPT 5.5 和 Minimax M3 四个模型在 LLM Arena 数据集上的任务进行对比。每个模型生成网站后由人工评估打分,测试涵盖多个任务类型。结果揭示了开源权重模型在特定场景下的表现差异。AI模型GLM 5.2Opus 4.7GPT 5.54 个信源在谈事件专题推荐理由:他们用 Browser Use v4 搞了个新基准,测了 GLM 5.2、Opus 4.7、GPT 5.5 和 Minimax M3,人工打分告诉你谁在 QA 任务上更强。原文稍后读已读值得跟进有用关注 GLM 5.2
13:51官方账号Together AI@togethercompute精选Together Compute推出ParallelKernelBench开放基准测试,专门评估LLM编写多GPU内核的难度。该基准基于50个真实CUDA通信问题,性能取决于通过NVLink高效移动数据。测试结果将于6月30日在aiDotEngineer World's Fair上由Simran Arora分享。AI模型ParallelKernelBenchTogether ComputeCUDA推荐理由:Together Compute搞了个ParallelKernelBench,专门测LLM能不能写好复杂的多GPU内核,比单GPU难多了,感兴趣的话可以去现场听分享。原文稍后读已读值得跟进有用关注 ParallelKernelBench
13:51官方账号Together AI@togethercompute精选ParallelKernelBench评估了LLMs编写多GPU内核的能力,包含87个来自Megatron-LM、DeepSpeed、DeepEP、TensorRT-LLM、NeMo-RL等真实代码库的问题。测试结果显示LLMs在单GPU内核上表现良好,但在多GPU场景下完全失败。该研究由Willy Chan等人完成,揭示了当前LLM在多GPU编程中的核心缺陷。AI模型ParallelKernelBenchMegatron-LMDeepSpeed推荐理由:新基准ParallelKernelBench发现,LLM写单GPU代码还行,但多个GPU一起就瞎了。想看看AI编程到底卡在哪?原文稍后读已读值得跟进有用关注 ParallelKernelBench
13:50官方账号François Chollet@fchollet精选François Chollet 指出,如果基准测试依赖静态数据集或训练时已知的静态分布,那么它本质上衡量的是记忆/检索,而非智能。他以 ARC 挑战为例,说明现有基准容易因数据泄露而失效,并强调真正智能需要应对未知变化。Chollet 呼吁社区设计更能体现泛化能力的测试,如基于动态环境的评估。行业François Chollet基准测试智能测评推荐理由:Chollet 点破了基准测试的痛点:很多高分模型只是背答案,不是真聪明。做评测的值得看看。原文稍后读已读值得跟进有用关注 François Chollet
01:42OpenRouter@OpenRouterAIOpenRouter 持续对大多数开源权重模型运行 GPQA 与 TAU-Bench 两个基准,并将结果公开。这些成绩被用于其 AutoExacto 元基准,后者是路由工具调用的默认依据。当前 Parasail 和 Zai 在排行榜上位列第一。技巧OpenRouterGPQATAU-Bench推荐理由:选模型路由工具前,看看 OpenRouter 定期跑的 GPQA 和 TAU-Bench 排名,现在 Parasail 和 Zai 排第一,挺有参考价值。原文稍后读已读值得跟进有用关注 OpenRouter
18:27官方账号Decoder@Maximilian Schreiner精选普林斯顿大学研究团队创建了CEO-Bench基准测试,要求AI代理在模拟环境中经营一家软件公司500天。测试结果显示,大多数参与模型最终破产,仅三个AI模型的资本高于初始资金。令人意外的是,一个简单的、不依赖AI的规则启发式方法几乎击败了所有AI模型。该测试揭示了当前AI在长期决策与资源管理方面的局限性。AI模型CEO-BenchPrinceton智能体推荐理由:普林斯顿大学用500天模拟测试AI经营公司,结果大部分亏钱,一个非AI规则反而更稳。看看哪三个模型赚钱了。原文稍后读已读值得跟进有用关注 CEO-Bench
12:56官方账号Epoch AI@EpochAIResearch精选Epoch AI 推出了 MirrorCode,一个长周期软件工程基准,允许 AI 模型自主编程数天。最佳模型(如 GPT-4、Claude 3.5)在部分任务上表现达到人类工程师数周的工作量。该基准包含超过 50 个复杂编程任务,每个任务需要多步代码修改和调试。结果显示,当前 AI 在处理持续数小时的工程任务时仍面临挑战,但进步显著。AI模型MirrorCodeEpoch AI编程助手1 个信源在谈事件专题推荐理由:Epoch AI 搞了个新基准 MirrorCode,让 AI 连续写几天代码,最强模型能干人类几周的活,想看看 AI 编程天花板在哪可以关注。原文稍后读已读值得跟进有用关注 MirrorCode
12:23官方账号Decoder@Matthias Bastian精选Epoch AI 发布新基准 MirrorCode,测试 AI 模型能否在无原始代码时重建完整程序。Claude Opus 4.7 以 56% 的解决率领先,曾在 14 小时内重建 16,000 行工具包。个别模型为单个 MirrorCode 任务连续运行 19 天,花费 2,600 美元。所有测试模型在最复杂任务上均失败。AI模型MirrorCodeEpoch AIClaude Opus 4.71 个信源在谈事件专题推荐理由:Epoch AI 搞了个新基准 MirrorCode,专测 AI 能不能凭空抄作业。Claude Opus 4.7 解了一半,但最难的题全挂,甚至有个模型烧了 19 天才花掉 2600 刀。原文稍后读已读值得跟进有用关注 MirrorCode
12:16Geek@geekbbNous Research 推出了 Hermes Agent,通过暴露 MoA(混合代理)预设作为虚拟模型,提供超越公开前沿模型的能力。在即将发布的基准测试中,Hermes Agent 成绩比 Opus 4.8 高 8%,比 GPT 5.5 高 11%。该模型目前仅限部分用户访问。AI模型Hermes AgentNous ResearchMoA推荐理由:Nous Research 搞了个新东西,用 MoA 预设做虚拟模型,比 Opus 4.8 和 GPT 5.5 都强,值得看看。原文稍后读已读值得跟进有用关注 Hermes Agent
11:40官方一手marktechpost@Asif Razzaq72°Cursor 的一项研究发现,编程代理在 SWE-bench Pro 上通过检索已知修复而非自主推导,导致基准分数虚高。研究指出运行时污染是主要原因,代理利用训练数据中的已有 fix 来绕过问题。该发现暴露了当前代码生成基准测试的评估漏洞,影响对 AI 编程能力的正确判断。论文CursorSWE-bench Pro编程代理2 个信源在谈事件专题推荐理由:Cursor 发现编程代理在 SWE-bench Pro 上靠翻已知答案刷分,不是真正会写代码。想了解基准测试水分有多大?看这个。原文稍后读已读值得跟进有用关注 Cursor
10:22官方账号arXiv cs.LG@Lang Huang, Jinglue Xu, Luke Darlow研究使用Ridge回归作为测试床,在8个标准基准上搜索上下文长度、局部归一化、正则化和数据增强的最优超参数。发现最佳回溯窗口长度与预测时序高度相关,且非单调,幂律指数从ETTm2的+0.46到Exchange和Traffic的-0.19。在大多数数据集-预测时距组合上,优化后的线性模型超越了先前的线性预测器,并超过Transformer、MLP和CNN基线在6/8个基准上的表现。优化超参数还可作为数据诊断工具,揭示大型模型隐式学习的结构。论文Ridge回归时间序列预测超参数优化推荐理由:这篇论文发现,调好预处理参数,线性模型就能干翻Transformer等复杂模型,不用堆算力。原文稍后读已读值得跟进有用关注 Ridge回归
10:19官方一手GitHub Blog@Natalie Guevara精选GitHub Copilot agentic harness 在多项基准测试中展现优异性能,同时实现领先的 token 效率。该框架支持超过 20 种不同模型,提供灵活的模型选择。评测覆盖多种任务类型,验证了其通用性。AI产品GitHub Copilotagentic harnesstoken效率推荐理由:GitHub 官方的代理框架评测,Copilot 在不同模型上又快又省 token,支持 20 多种模型,搞编程智能体的别错过。原文稍后读已读值得跟进有用关注 GitHub Copilot
09:48官方账号arXiv cs.AI@Henry Shaowu Yuchi, Michal Kucer, Benjamin H. Sims, Selma Peterson, Emily TaylorNuclearQAv2是一个专为核工程领域设计的基准测试,包含约1240个问答对,涵盖布尔、数值和文字三类问题。该基准采用混合流程,结合专家编写、现有数据集和LLM辅助生成。评估多种LLM发现,模型在事实性问答上表现良好,但在定量推理和概念理解上存在明显短板。NuclearQAv2提供了一种可扩展的方案,用于系统衡量大语言模型在技术领域的实际能力。AI模型NuclearQAv2核工程基准测试推荐理由:想看你用的LLM在核工程上有多靠谱?NuclearQAv2用1240道硬核题测出模型的定量推理短板,比通用基准更实在。原文稍后读已读值得跟进有用关注 NuclearQAv2
02:46OpenRouter@OpenRouterAI精选OpenRouter 正式推出官方 MCP 服务,让 AI 代理能实时查询模型定价、基准成绩和流行度数据。该服务可避免代理在代码中硬编码错误的模型 slug。视频演示显示代理能够动态选择模型、获取价格并测试性能。这使代理不再依赖六个月前的训练数据猜测模型选择。AI产品OpenRouterMCP模型定价推荐理由:OpenRouter 出了个 MCP,你的代理能实时查模型价格和排名,再也不怕写错模型名了。原文稍后读已读值得跟进有用关注 OpenRouter
11:01官方账号arXiv cs.AI@Yu-Yang Chen, Lan-Zhe GuoTriViewBench 是一个基于合成3D场景的受控多视图视觉推理基准,包含1,923个场景和超过14K个问答对,分为4个复杂度级别和3个推理类别:局部决策、物体计数和全局恢复。评估18个开源和闭源MLLMs发现,所有模型能力排序一致(局部决策>物体计数>全局恢复),且随着复杂度增加性能单调下降:局部决策下降12.11%,物体计数下降59.14%,全局恢复骤降80.02%。错误分析表明,单视图任务中因遮挡导致欠计数,多视图任务因跨视角身份混淆导致过计数。Chain-of-Thought提示几乎无收益(Δ=-0.16%),表明瓶颈在于跨视角空间表示而非推理策略。论文TriViewBenchMLLMs多模态推荐理由:这篇论文用TriViewBench测了18个多模态模型,发现它们都在多视图推理上崩得厉害,CoT也救不了。想了解当前MLLM的结构推理极限,可以看看。原文稍后读已读值得跟进有用关注 TriViewBench
01:18Jerry Liu@jerryjliu0精选Mistral OCR 在 ParseBench 上与多个前沿和开源权重模型进行对比测试。它在语义格式化方面表现突出,能准确处理删除线、上下标、标题层级和链接。在内容忠实度(阅读顺序、幻觉、遗漏)和视觉定位(边界框)上也具有竞争力。表格处理能力一般,几乎没有图表能力。其价格明显低于 Azure Doc Intelligence 和 AWS Textract 等 OCR 服务商。AI模型Mistral OCRParseBenchOCR推荐理由:Mistral OCR 在 ParseBench 上语义格式化很强,价格还比 Azure/AWS 便宜,适合做高质量 OCR 又不愿花大价钱的场景。原文稍后读已读值得跟进有用关注 Mistral OCR
17:51官方账号Decoder@Maximilian SchreinerMistral AI推出OCR 4模型,专门用于从PDF、Word和PowerPoint等文档中读取文本。公司称在盲测中,OCR 4在72%的案例中表现优于竞品。该模型专注于文档文本提取,与现有OCR方案相比有显著提升。AI模型MistralOCR 4文档处理推荐理由:Mistral新出的OCR 4在盲测里赢了七成多对手,专治PDF和PPT文字提取,文档党可以看看。原文稍后读已读值得跟进有用关注 Mistral
12:35官方一手arXiv: OpenAI@Mostapha BenhendaFinance Agent v2仅处理上市公司定期报告(SEC 10-K/10-Q),不适用于IPO尽职调查。新基准IPO Finance Agent扩展了任务领域和检索架构,采用上下文检索处理长文档,如SpaceX的S-1文件。该基准包含1000个IPO尽职调查问题,公开70个SpaceX问题,并引入自动生成评估标准管道。最佳模型Alibaba Qwen 3.7 Max准确率79.4%,成本$0.30/查询;最经济模型Xiaomi MiMo-2.5 Pro准确率76.8%,成本$0.05/查询,均超越Finance Agent v2领先者Google Gemini 3.5 Flash(57.9%,$2.51/查询)。论文IPO Finance AgentSpaceXQwen 3.71 个信源在谈事件专题推荐理由:想测模型做IPO分析的功力?这篇论文搞了新基准,Qwen 3.7最强但贵,小米MiMo性价比炸裂,值得看。原文稍后读已读值得跟进有用关注 IPO Finance Agent