09:33Suhail@SuhailAI提升AI(推理系统、训练模型等)是唯一合理的基准。其他工作都是下游的,可能很快就会被颠覆。论文AI提升AI推理系统训练模型推荐理由:Suhail提出了AI提升AI的基准,这个观点值得思考,它可能颠覆我们对AI发展的看法。原文稍后读已读值得跟进有用关注 AI提升AI
22:39Philipp Schmid@_philschmidartificialanalysis.ai平台发布的模型测试数据显示,其模型在GLUE基准测试中获得高分;测试结果显示该模型本轮得分达154分;与此前测试相比,此次成绩体现模型性能提升。AI模型artificialanalysisGLUE模型测试推荐理由:artificialanalysis.ai发布了最新模型测试数据,能直接查看各模型在GLUE的分数,和之前版本比信息更全了。原文稍后读已读值得跟进有用关注 artificialanalysis
06:11lmarena.ai@lmarena_ai精选LMArena的Agent Leaderboard基于170万+次真实Agent Mode会话分析,新增按任务类型筛选功能,用户可按Code、Work、Chat三类对比模型性能。排行榜同时展示每个模型完成单次任务的实际成本,并标出各性能水平下最省钱的Pareto前沿选项。这一更新让模型选择不再只看分数,还能结合具体场景和花费做决策。AI产品Agent LeaderboardLMArena智能体推荐理由:选模型前先看看这个排行榜,现在能按写代码、干活、聊天分开比,还直接告诉你每单花多少钱,省得自己瞎试。原文稍后读已读值得跟进有用关注 Agent Leaderboard
10:24官方账号arXiv cs.AI@Sasan Mansouri, Daniel Saad, Mark Wahrenburg, Manu Weissel, Fabian WoebbekingFinRank基准包含1185个手工问答对,覆盖22家公司的10-K和10-Q文件,每项记录附有参考答案、gold支持段落和人工筛选的困难负样本。在合并证据语料上,7B指令微调嵌入模型的Recall@10仅为44.8%。亚十亿参数编码器相比BM25最高提升3.5个点,而金融适配嵌入模型比BM25低9.7个点。将随机负样本替换为困难负样本后,成对准确率下降13.0至20.5个百分点。该基准分别评测段落检索、重排序和困难负样本判别任务。论文FinRankSEC filings金融问答推荐理由:FinRank是个新出的金融问答基准,专门考你从SEC文件里找证据的能力。实测连7B模型都只有44.8%的召回率,难度很够。原文稍后读已读值得跟进有用关注 FinRank
07:09elvis@omarsar0精选新研究发布DataSpace基准,用于评估数据智能体在异构数据工作区生成可验证表格结果的能力。该基准包含410个跨语言任务,覆盖7439个工件,总数据量15.01GB,涉及CSV、JSON、SQLite、Markdown、PDF和视频等格式。在六个前沿多模态模型和五个常用智能体框架的测试中,最佳准确率为66.34%。固定模型主干时,更换框架可使准确率变动15.36个百分点。多模态证据整合和连接操作在六个骨干模型上均降低了准确率。论文DataSpace智能体多模态2 个信源在谈事件专题推荐理由:想知道数据智能体怎么选?DataSpace测了6个模型和5个框架,换框架能让准确率差15个点,值得看。原文稍后读已读值得跟进有用关注 DataSpace
11:05官方账号arXiv cs.AI@Chao Peng, Ruida Hu, Ajitha Rajan, Tegawendé F Bissyandé, Jacques Klein, Cuiyun Gao论文调研了197个真实TUI应用,发现仅12%的测试代码涉及界面,其中45%从不发送输入。作者将ratatui/Rust、bubbletea/Go、textual/Python、ink/TypeScript应用打包成无头基准,对比4个前沿LLM与随机探索。在相同时间预算下,随机探索是强基线,但每次交互LLM引导更高效,且能独特到达需要输入触发的故障。自动派生启动输入带来最大实际收益,使原本无法启动的应用得以运行。行覆盖率无法有效预测崩溃发现,说明它不宜作为测试有效性的代理指标。论文LLMTUI软件测试1 个信源在谈事件专题推荐理由:这篇论文把197个终端界面应用打包成基准,拿4个大模型和随机点击对比,发现随机探索还挺能打,但大模型单次操作效率更高。他们开源了tuicov和tuibot,想测TUI的可以试试。原文稍后读已读值得跟进有用关注 LLM
09:39官方账号arXiv cs.AI@Simiao Ren该研究提出CallScreenBench基准,用来评估手机端侧模型代接未知来电的表现。评测从五个质量维度打分,不合并为单一总分。研究用6个0.6B到4B参数的端侧模型,在4-bit量化下做测试,发现能力越高回答质量越好,但来电分流质量并不随之提升。修正脚本化退化基线后,11/15个模型对的分流差异在预注册操作点归零。一个只会挂断和复述对方的智能体也能拿到完美消息保真分数。论文CallScreenBench端侧模型智能体推荐理由:别只看模型跑分,这篇论文拆穿了端侧模型的电话代接短板,还附了踩坑评测方法,做手机智能体的值得读。原文稍后读已读值得跟进有用关注 CallScreenBench
10:09官方账号arXiv cs.AI@Gaetano Perrone, Simon Pietro RomanoARB基准由1,800篇人类源文本构建,覆盖XSum、WritingPrompts和OpenWebText三个数据集,并使用Llama-3.2-3B、Qwen2.5-7B、Mistral-7B和Gemma-2-9B四个开源模型生成重写变体。在1%假阳性率下,FastDetectGPT和Binoculars-falcon-7b对直接生成文本的召回率分别为91.2%和93.5%,但对人类文本经LLM改写后的召回率骤降至30.8%和15.1%。RADAR同样从66.8%跌至12.2%,而BERT-Defense和RoBERTa-Defense在所有场景下召回率均低于3%。结果表明,传统基准上的检测性能无法迁移到LLM改写的人类文本场景。论文ARBFastDetectGPTBinoculars推荐理由:这篇论文告诉你,现在AI检测器遇到‘人类写、AI改’就失灵,直接生成能抓到九成,改写后只剩三成,做防御的得看看。原文稍后读已读值得跟进有用关注 ARB
01:26官方账号LangChain@LangChainAILangChain 推出 ReviewBench,一个专注于代码审查场景的新基准。该基准从真实 PR 审查意见出发,将审查中发现的问题整理成具体任务,并转化为基于 Harbor 框架的可复现实验。其目标是模拟开发者在实际代码审查中遇到的典型问题,帮助评估模型在审查场景中的表现。AI模型ReviewBenchLangChainHarbor推荐理由:LangChain 做了个叫 ReviewBench 的基准,专门测代码审查能力,数据来自真实 PR 评论,还能用 Harbor 复现。原文稍后读已读值得跟进有用关注 ReviewBench
09:53官方一手arXiv: DeepSeek@Ioakeim Perros, Cleopatra Papadopoulou, Ayoub Kirouane, Christos PetrocheilosMORFES是一个面向现代希腊语屈折能力评估的基准,包含500个专家验证的条目,侧重低频词元以考察规则应用而非记忆。论文对LLaMA到Qwen3、DeepSeek-R1、Magistral、Kimi K2等开放权重模型进行了评测。研究者自研的Sophea-Genesis-1模型在屈折形态任务上领先,同时通用能力与同等规模模型相当。数据与模型权重均在Hugging Face公开。论文MORFESSophea-Genesis-1现代希腊语推荐理由:专门测希腊语变格的基准,500道题验证模型是不是真懂语法规则,Sophea-Genesis-1拿了头名,权重还开源了。原文稍后读已读值得跟进有用关注 MORFES
11:04官方账号arXiv cs.AI@Weijie Wu, Junbo Li, Lin Li, Jun Fang, Qingyang HongMMAC基准包含5,638个音频片段,来自20多个数据源,覆盖6个能力类别和15个评估维度。它检查模型生成字幕是否提及目标维度信息以及内容与参考标签的一致性。评估了开源和商业音频大模型,结果显示不同维度下的信息覆盖度和描述可靠性差异明显。AI模型MMACAudioLLMs音频字幕推荐理由:想评估音频大模型的信息还原能力?MMAC有五千多段音频和十五个细粒度维度,比只看生成质量更靠谱。原文稍后读已读值得跟进有用关注 MMAC
02:28官方一手@OpenAIDevs@OpenAIDevs精选GPT-Transcribe 在 Context Aware ASR 基准上,语义准确率从无自由格式上下文时的 41.6% 提升至 45.2%。在 Common Voice 的 22 种语言上,GPT-Transcribe 转录错误率为 19.27%,而 Whisper(whisper-1)为 40.37%。在 Real-World Audio Recording 基准的 9 种语言上,GPT-Transcribe 错误率为 8.98%,Whisper 为 15.21%。AI模型GPT-TranscribeWhisperASR推荐理由:OpenAI 发的 GPT-Transcribe 在音频转录上比 Whisper 错误率低一半,多语言场景提升明显。原文稍后读已读值得跟进有用关注 GPT-Transcribe
12:11官方账号arXiv cs.AI@Hang Ni, Weijia Zhang, Fan Liu, Mengqian Lu, Hao LiuSIREN-Bench基准包含600个问答实例、19个任务,覆盖4个独立预警流程和1个端到端预警链。现有天气智能体框架在SIREN-Bench上表现出显著能力差距。研究者提出SIREN,一种结合历史案例检索、技能蒸馏和预测建模的经验驱动智能体框架。实验显示SIREN在独立预警流程和端到端预警链上均超越基线。该框架利用异构天气证据和工具集成环境,提升预警自动化水平。论文SIREN极端天气LLM Agent推荐理由:想了解LLM智能体在极端天气预警中怎么用?这篇论文建了个600题的基准,还搞了个历史案例驱动的框架,比现有方案强不少。原文稍后读已读值得跟进有用关注 SIREN
02:54elvis@omarsar0精选LLaDA2.2-flash在智能体基准τ²-Bench上取得592.80分,高于Ling-2.6-flash的334.90分。其快速模式更是达到705.30分。该结果展示了LLaDA2.2-flash在agentic任务上的优势。AI模型LLaDA2.2-flashLing-2.6-flashτ²-Bench推荐理由:LLaDA2.2-flash在智能体基准上把Ling-2.6-flash甩开一截,快速模式甚至冲到705分,做Agent研究的可以看看。原文稍后读已读值得跟进有用关注 LLaDA2.2-flash
14:23官方账号Latent Space (swyx)(博客/媒体)Poolside 联合 CEO 透露,其小团队的研究人员建立了一个模型工厂,成功训练出 118B 参数的 MOE 模型 Laguna S。该模型在基准测试中击败了 Thinky 约 1T 参数的开放权重模型。这一成果展示了高效小团队在模型开发上的竞争力。Poolside 表示这只是开始,未来将有更多进展。AI模型PoolsideLaguna SThinky8 个信源在谈事件专题推荐理由:Poolside 用 118B 的 MOE 模型 Laguna S 干翻了 Thinky 的 1T 模型,小团队也能造出顶尖模型,值得一看。原文稍后读已读值得跟进有用关注 Poolside
09:17官方账号arXiv cs.AI@Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani, Mitch Weiss新基准BusinessCaseBench涵盖18个学科数百个商业案例问题,每个问题配有专家编写的评分标准。前沿AI模型在该基准上已获得高分,且同一模型家族在两年内能力大幅提升。结果显示AI在分析性知识工作上的表现已经很高且快速进步。AI模型BusinessCaseBenchLLM基准推荐理由:想看看AI能不能做商业案例分析?这个新基准直接给模型打分,结果挺有参考价值。原文稍后读已读值得跟进有用关注 BusinessCaseBench
06:05官方账号Allen AI (Ai2)@allen_aiAllen AI 构建的 SciArena 基准测试用于评估 AI 模型处理科学文献问题的能力,评判者均为研究人员。该基准将于 7 月 15 日退役,最终数据包括约 1700 名用户投出的约 3900 次投票。结果揭示了模型在科学问答、文献理解等任务上的表现对比。具体排名和用户偏好信息已在推文线程中公布。AI模型SciArenaAllen AI科学文献推荐理由:Allen AI 用研究者投票测了 AI 的科学文献能力,1700 人投了 3900 票,想看看哪个模型更靠谱?这里直接给结果。原文稍后读已读值得跟进有用关注 SciArena
06:45官方一手marktechpost@Michal Sutter精选MORPHEUS 是 Skyfall AI 推出的持久化企业模拟平台,专为持续强化学习设计。它运行永不重置的世界,采用参数化制度转变和六指标评估协议。PPO、HER、EWC、LCM 等算法在该基准上均远低于理论上界。该基准旨在解决结构化非平稳性下的学习挑战。AI模型MORPHEUSSkyfall AI持续强化学习推荐理由:Skyfall AI 新出的 MORPHEUS 基准专门测持续强化学习,PPO 等主流算法都远没到上限,搞 RL 的值得看看。原文稍后读已读值得跟进有用关注 MORPHEUS
02:35官方账号Fei-Fei Li@drfeifei斯坦福大学启动第二届 BEHAVIOR 机器人挑战赛,聚焦日常生活中的长周期复杂任务。去年获胜方案在真实场景中完整任务成功率仅12.4%。本届新增更多任务类型,改进评估方法并降低使用门槛。提交截止日期为2026年10月16日,奖金池总额11000美元。AI模型BEHAVIOR Challenge斯坦福机器人推荐理由:斯坦福的机器人挑战赛又来了,去年最佳方案成功率才12%,说明这事真难。今年任务更多、评测更靠谱,想测测你家机器人的真实水平就参加。原文稍后读已读值得跟进有用关注 BEHAVIOR Challenge
02:27lmarena.ai@lmarena_aiAgent Arena是一个评估模型在真实世界、长期智能体任务上的排行榜。该排行榜基于全球用户贡献的百万级任务数据。模型需使用网络搜索、文件系统和终端工具完成复杂工作流。性能评估采用因果追踪方法,测量各模型相对于平均模型的表现。AI模型Agent Arena智能体模型评估推荐理由:Agent Arena用百万真实任务测模型自主能力,看看谁在复杂工作流里最靠谱。原文稍后读已读值得跟进有用关注 Agent Arena
09:40官方账号arXiv cs.AI@Shilin Ou, Yifan Xu, Luyao ZhangSolarChain-Eval是一个受物理约束的基准,用于评估去中心化能源市场中的可信经济智能体。它将市场治理建模为Gymnasium兼容的马尔可夫决策过程,智能体每小时做出决策。基准从市场效用、物理安全、滑点、行动平滑度、空间公平性和可审计性六个维度评估策略。实验显示,RL智能体可提升市场效用但产生不安全行为,移除物理惩罚后智能体会利用无效发电数据并制造人为流动性。LLM规划器/审计器层能缓解部分风险但无法补偿错误奖励函数。论文SolarChain-Eval基准经济智能体推荐理由:想评估AI在真实物理系统中的可信度?这个新基准从六个维度测试智能体,还带了LLM审计层,结果挺扎心:RL优化收益但会钻物理漏洞。原文稍后读已读值得跟进有用关注 SolarChain-Eval
12:08官方账号arXiv cs.AI@So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen现有数据分柝基准局限于小表格的事实检索,忽略多表、外部知识整合与探索性洞察。新发布的DataGovBench源自政府开放数据,包含Table QA(复杂分解问答与可视化)和Table Insight(探索性分析生成专家级发现)两项任务。实验表明,当前主流LLM(包括带智能体框架的系统)在这两项任务上表现显著不足,距离真实数据分柝需求仍有很大差距。该基准为推进LLM处理复杂分柝查询与数据洞察提供了挑战性测试。论文DataGovBenchLLM数据分析推荐理由:研究团队用政府开放数据搞了个新测评,发现现在的大模型遇到多表格和外部知识就掉链子,专治各种表面功夫,推荐给关心模型真实落地能力的朋友。原文稍后读已读值得跟进有用关注 DataGovBench
11:41Ethan Mollick@emollickMAI-1 尚未有第三方独立基准,但官方发布的成绩显示其表现不如 Claude Sonnet 4.6。该模型计划作为 Copilot 集成到 Excel 和 Outlook 中,但目前已有较好的 Claude/OpenAI 插件可替代。评论认为 MAI-1 在办公场景下可能难以具备优势。AI模型MAI-1Sonnet 4.6Microsoft10 个信源在谈事件专题推荐理由:MAI-1 基准不如 Sonnet 4.6,还打算做 Office Copilot?给你省流了。原文稍后读已读值得跟进有用关注 MAI-1
10:16官方账号arXiv cs.AI@Evgeny ShilovRuBench 1.0 是一个仓库级智能体编码基准,包含25个来自5个开源仓库(aiohttp、aiogram、Laravel、NestJS、Fastify)的任务,每个任务以俄语撰写。所有修复提交均晚于被评估模型的训练数据截止日期。评测包括Claude Code(Opus 4.8、Sonnet 5、Haiku 4.5)和Codex CLI(GPT-5.5),最佳配置通过78.7%的任务。在25个任务中,仅最弱模型与其它模型之间存在统计显著差距。审计发现,Claude Code + Fable 5配置在5个任务(20%)中悄然回退到Opus 4.8,证明实际测量的是产品而非模型。AI模型RuBench俄语代码代理推荐理由:想了解用非英语自然语言写代码任务的基准?RuBench用俄语从真实提交中挖了25个任务,还抓到了模型被悄悄替换的证据。原文稍后读已读值得跟进有用关注 RuBench
00:25lmarena.ai@lmarena_aiClaude Sonnet 5 (Thinking) 在 Text Arena 中整体文本排名第32位。在专家级提示(Expert-level prompts)上,Sonnet 5 超越了上一代版本4.6。在数学、写作、文学与语言、生命/物理/社会科学类别中表现稳定,但大多数其他类别的排名出现下降。AI模型Claude Sonnet 5Anthropic文本排名10 个信源在谈事件专题推荐理由:想对比 Claude Sonnet 5 和 4.6 的文本能力?这份分析告诉你它在专家级提示上更强,但其他类别反而差了。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
10:22官方账号arXiv cs.AI@Brett Reynolds该论文提出对抗性语用学作为评估语言模型安全性的基准与标注协议,涵盖指令冲突、嵌入命令、引用、范围歧义、指示语、间接言语行为和多轮智能体转录。论文贡献包括一个18条目的种子基准(含验证者强制元数据)和一个54行的本地种子试点实验。专家评估协议区分任务成功、政策合规、安全风险、拒绝结果和评估者置信度。框架为验证安全评估、LLM裁判、黄金集构建、提示注入测试和安全文档提供了实用工具。论文对抗性语用学AI安全基准推荐理由:这篇论文搞了一个对抗性语用学基准,有18个具体条目,专门测试模型被指令冲突、嵌入命令搞昏头的情况,比以前只打通过/不通过标签靠谱多了。原文稍后读已读值得跟进有用关注 对抗性语用学
12:09官方账号NVIDIA AI@NVIDIAAIArtificialAnlys发布新基准AA-Briefcase,用于评估复杂项目中的现实任务。Nemotron 3 Ultra在该基准开放模型中排名靠前。该模型在多种长时间运行的智能体任务上表现强劲,即使首次面对这些任务也能保持性能。该基准旨在测试模型的长期执行与泛化能力。AI模型AA-BriefcaseNemotron 3 UltraArtificialAnlys推荐理由:新出的AA-Briefcase基准可以看看,Nemotron 3 Ultra在开放模型里排前面,适合对比它处理复杂任务的能力。原文稍后读已读值得跟进有用关注 AA-Briefcase
12:03官方账号arXiv cs.AI@Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang LinEG-VQA是一个开放式的视频问答基准,包含2,067个视频和11,838个QA对,每个问题都标注了精确的时间证据区间。提出EG-F1指标,统一衡量预测证据的时间对齐和语义一致性。实验发现即使最强模型(如专有模型)在证据定位上表现不佳,存在答案正确但定位偏差的问题。为此提出EG-Reasoner模型,通过显式证据监督训练,在开源模型中达到最优,并在反事实等推理密集型任务上表现突出。该研究证明仅靠扩展规模不足以实现鲁棒的视频理解,结构化证据监督是关键。论文EG-VQAVideo-LLM视频问答推荐理由:这个新基准EG-VQA把视频问答的答案和证据绑定在一起,测出来一大票模型只会蒙答案不会找证据。开源模型EG-Reasoner靠证据监督训练,反事实推理直接碾压好几家专有模型。原文稍后读已读值得跟进有用关注 EG-VQA
13:19官方账号arXiv cs.LG@Nathan Senyard, Salem Hamdani, Astrid Zhang, Derek Wang, Evan Shelhamer, Mathias Lécuyer, Joséphine GantoisHedgementation 是一个面向国家尺度、10m² 空间分辨率的树篱映射遥感基准。它整合了多个遥感数据产品与法国树篱清单的标注,用于评估机器学习模型。基准测试了三个基线模型在空间距离和气候区域上的泛化能力,并涵盖监督和自监督学习方法。代码已开源在 GitHub。论文Hedgementation遥感基准推荐理由:想测试遥感模型对细节的抓取能力?这个基准用了法国全国树篱数据,10米分辨率,还能跨气候区泛化。原文稍后读已读值得跟进有用关注 Hedgementation
10:08官方账号arXiv cs.AI@Tingyue Pan, Mingyue Cheng, Daoyu Wang, Yitong Zhou, Jie Ouyang, Qi Liu, Enhong ChenScholarQuest 是一个基于超过1,000个计算机科学主题和四种研究意图(方法导向、场景锚定、比较型、范围控制)的学术论文搜索基准。该基准通过可扩展的答案构建和共享检索后端 ScholarBase 支持可重复评测。评测中最佳智能体方法在 Recall@100 上仅达0.314,在 Recall@All 上为0.355,表明搜索性能仍有巨大提升空间。研究还分析了搜索效率、意图级鲁棒性和失败案例。论文ScholarQuestLLM智能体推荐理由:想测你的LLM论文搜索智能体?ScholarQuest 给了1000多个主题和4种意图的标准测试,最强方法才0.314召回,你的能提多少?原文稍后读已读值得跟进有用关注 ScholarQuest
00:10elvis@omarsar0精选OpenAI 推出 LifeSciBench,一个针对生命科学研究的基准测试,包含 750 个专家编写的任务,覆盖 7 个生物学研究工作流。该基准由 173 位来自生物技术和制药领域的科学家共同开发,旨在衡量 AI 在真实世界科研场景中的表现。结果显示通用模型在复杂结构处理上仍有不足,而专用模型在科学研究中优势明显。AI模型OpenAILifeSciBench基准10 个信源在谈事件专题推荐理由:OpenAI 联合 173 位科学家搞了个新基准 LifeSciBench,750 个专家任务专测 AI 搞科研的能力,比通用模型靠谱多了。原文稍后读已读值得跟进有用关注 OpenAI
14:43小互@imxiaohu6月,Apodex 向 FutureX 提交了四个基于 Apodex-1.0-mini 35B 的实验预测框架。该模型在6月第一周排名包揽第1至第4名,并在第二周持续霸榜第1名。这一成绩展示了 Apodex-1.0-mini 35B 在预测任务上的竞争力。AI模型ApodexApodex-1.0-miniFutureX推荐理由:Apodex 用 35B 参数模型做的预测框架,在 FutureX 排行榜上直接包揽前四名,太猛了。原文稍后读已读值得跟进有用关注 Apodex
10:57官方账号arXiv cs.AI@Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan WuX+Slides 是一个评估大语言模型根据受众条件自动生成幻灯片的新基准。它覆盖 113 个主题和 7 种演示场景,使用 8133 个去重、基于源文本的探针,并引入四个互补指标:Audience Coverage、Domain-wise Coverage、Efficiency 和 Correctness。在 DeepPresenter、SlideTailor 和 NotebookLM 上的实验表明,在 τ_A=0.7 阈值下,NotebookLM 消融版达到最高 Audience Coverage 0.853,而 DeepPresenter 为 0.714,SlideTailor 为 0.594。结果显示当前系统仍无法完整恢复受众关键信息,且视觉质量不能替代源文本验证。论文X+SlidesLLM幻灯片生成推荐理由:想了解如何科学评估AI做PPT的水平?这篇论文用113个主题和8133个探针,测出NotebookLM能覆盖85%的受众关键信息,比DeepPresenter和SlideTailor强不少。原文稍后读已读值得跟进有用关注 X+Slides
09:43官方账号arXiv cs.AI@Moon Ye-Bin, Nam Hyeon-Woo, Baek Seong-Eun, Yejin Yeo, Tae-Hyun OhTRAP基准评估了22个模型(包括前沿闭源和开源模型)在文档中利用私密信息完成任务时的隐私泄露风险。所有模型均显示非平凡泄露,且指令遵循能力与泄露率正相关。现有的提示防御方法在减少泄露的同时显著降低了任务准确性。论文证明基于softmax的模型无法通过软约束防御同时实现高任务成功率和零泄露概率。提出的结构性私密字段隔离方法用哈希键替换私有字段,几乎完全防止泄露且保持任务精度。论文TRAP基准隐私提取推荐理由:想看看你的AI模型干活时会不会偷偷泄密?这篇论文做了22个模型的隐私压力测试,还给了个不会牺牲任务性能的防漏方案。原文稍后读已读值得跟进有用关注 TRAP
09:20官方一手arXiv: OpenAI@Costas Mylonas, Magda Foti, Andrea Pomarico, Matheus Duarte, Qian Zhang, Emmanouel Varvarigos精选PowerAgentBench-SS是一个针对电力系统稳态研究中工具使用智能体的基准框架。它使用IEEE 39节点系统进行直流热N-2预想事故搜索测试,评估智能体在工具调用、约束满足和验证方面的能力。实验对比了三个本地Ollama模型和一个OpenAI API代理,发现纯求解器评估不足以区分智能体性能,验证预算使用、类型强制转换、证据报告等行为是关键差异。该基准包含召回率、假安全惩罚、严重性遗憾、行动成本等风险敏感指标。论文PowerAgentBench-SS智能体电力系统10 个信源在谈事件专题推荐理由:搞电力系统智能体评估的可以看看这个,用IEEE 39节点系统测试大模型能不能真干活,不只看结果还看过程,挺实在的。原文稍后读已读值得跟进有用关注 PowerAgentBench-SS
05:24官方账号OpenAI@OpenAIOpenAI发布LifeSciBench,一个专门用于衡量AI在真实生命科学研究中表现的基准。该基准由173位生物技术和制药领域科学家参与开发,包含750个专家编写的任务,覆盖7个生物研究工作流。LifeSciBench旨在系统评估AI模型在文献分析、实验设计等科研环节的实用性,并指导后续改进。AI模型OpenAILifeSciBench基准10 个信源在谈事件专题推荐理由:OpenAI联合173位科学家搞了个LifeSciBench,750个专家级任务覆盖7个生物研究流程,想测AI在生命科学里到底好不好用,科研人员可以用它来选模型。原文稍后读已读值得跟进有用关注 OpenAI
10:42官方账号arXiv cs.AI@Michèle Finck大型语言模型已能生成至少中位质量的法律文本,但现有法律AI评估仅测量辅助性任务,无法评价其是否执行教义性法律推理。欧盟AI法案对高风险司法AI要求“适当准确性”,却因缺乏教义性推理基准而无操作内容。这篇论文首次系统定义该测量空白,并呼吁建立对应的标准化评估。论文LLMEU AI Act法律推理推荐理由:这篇论文直击法律AI评测的核心缺陷——现有基准只测写文书,不测真正懂法理。做法律AI或合规的朋友值得看看。原文稍后读已读值得跟进有用关注 LLM
08:40Satya Nadella@satyanadella71°微软Azure在AI训练基准测试中创下新纪录,实现了史上最快的训练时间和最大的报告规模。这一里程碑得益于全栈创新,包括硅片、系统、网络和软件协同优化,以及与Nvidia的深度合作。Azure此次突破展示了其AI基础设施的最新进展。行业AzureNvidiaAI训练2 个信源在谈事件专题推荐理由:Azure和Nvidia联手刷了个AI训练速度纪录,规模也是史上最大,搞AI基础设施的可以看看。原文稍后读已读值得跟进有用关注 Azure
13:10rohanpaul_ai@rohanpaul_ai精选AGENTCL 提出一个评估语言智能体持续学习能力的新基准,通过构建任务流来测试智能体是否真正从经验中学习。该基准对比了“组合式”任务流(后续任务可复用前序任务的代码函数、研究证据或工作流)与“朴素”任务流(任务同领域但无明确复用关系)。研究发现,当前记忆方法在任务连接明显时能复用过往经验,但在任务差异较大时仍难以避免混淆。AGENTCL 旨在解决现有基准中任务关系不清晰导致的评估偏差问题。论文AGENTCL智能体持续学习推荐理由:看智能体记忆到底行不行原文稍后读已读值得跟进有用关注 AGENTCL
09:40官方账号arXiv cs.LG@Kaijie Xu, Anqi Wang, Xilin Dai论文提出 PowerPhase,一个面向电力系统的大规模概率预测基准,包含 6 个传输电网,通道数从 2000 到 36964,远超现有基准。该基准引入约束感知指标(如 Safety_mBrier、NECV、CVaR-α),以评估预测在安全约束下的表现。研究发现,分布准确性与约束满足之间存在“安全-保真度”权衡,不同模型在这两个维度上排名不同。作者进一步提出 PowerForge,一种基于场景的分位数预测器,采用类型特定的解码头和变量组间的因果桥,在所有电网规模上取得最佳平均排名。论文概率预测电力系统安全约束推荐理由:电力系统运维和预测建模团队终于有了能评估安全约束的基准——PowerPhase 比现有基准大一个数量级,PowerForge 在安全与精度间取得最佳平衡,做电网概率预测的可以直接参考。原文稍后读已读值得跟进有用关注 概率预测