11:11官方账号arXiv cs.AI@Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei ZhouSABRE是一个可扩展的自动化流水线,能把Markdown任务设计转化为结构化规格、图像和问答对,用于构建视觉语言模型压力测试。该流程通过自动化过滤和人工审查保证题目质量。作者用SABRE-Prior实例测试模型是否依赖世界先验而非视觉证据,包含600张图像和1000个问题。六个VLM在宏观平均准确率上仅达17.8%至31.3%,平均22.6%。SABRE-Counting和SABRE-Spatial的试点证明该工作流可扩展至其他压力测试场景。论文SABREVLM压力测试推荐理由:这论文给了一个能自动造VLM压力测试的框架,比现有基准更能暴露模型短板,做评测的可以看看。原文稍后读已读值得跟进有用关注 SABRE
23:44lmarena.ai@lmarena_aiFrontend Code Arena 的完整排行榜页面位于 arena.ai/leaderboard。Frontend Code Arena 展示前端编码场景下的模型排名。arena.ai/leaderboard 是官方公布的榜单入口。访问 Frontend Code Arena 可查看完整排名。AI模型Frontend Code Arenaarena.ai前端编码1 个信源在谈事件专题推荐理由:想挑个会写前端的模型?去 Frontend Code Arena 榜单看排名就行,入口在 arena.ai/leaderboard。原文稍后读已读值得跟进有用关注 Frontend Code Arena
05:15官方账号Runway ML@runwayml独立人类评估对六款AI视频智能体进行了30个电影提示和16个指标的测试。Runway Agent 2.0 在叙事连贯性、电影语言和制作质量三大支柱上均排名第一。Physion Labs 发布的 Physion-Arc 1.0 基准测试了100个剧本和600个生成视频,Runway 在主观指标(如电影品味)上优势尤其明显。AI模型Runway AgentPhysion-Arc视频生成推荐理由:Runway Agent 2.0 在视频生成评测里全面碾压了 Luma、MiniMax 这些对手,叙事和电影感都拿第一,做视频的可以看看。原文稍后读已读值得跟进有用关注 Runway Agent
01:40lmarena.ai@lmarena_aiGPT-5.6 Sol在Agent Arena评测中综合排名第二,整体得分提升10.9%。在可操纵性(Steerability)指标上以+17.3%位列第一。确认任务成功(Confirmed Task Success)和工具幻觉(Tool Hallucination)指标均排名第二,分别提升10.9%和1.3%。赞美与抱怨比(Praise vs. Complaint)排名第三(+17.6%),Bash恢复(Bash Recovery)排名第14(+7.5%)。AI模型GPT-5.6Agent Arena智能体推荐理由:GPT-5.6 Sol在Agent Arena里表现挺猛,可操纵性直接第一,整体第二,具体各项指标排名都有数据,值得看看。原文稍后读已读值得跟进有用关注 GPT-5.6
14:00shao__meng@shao__meng精选73°Atomic Bot 发布了一段基于本地模型 Qwen 35B 的真实任务视频,对比 OpenClaw 和 Hermes Agent 在抓取 GitHub 仓库 star 历史、分析增长 spike 并构建实时仪表盘上的表现。OpenClaw 用时 12 分 01 秒、消耗 203k tokens,Hermes Agent 用时 33 分 01 秒、消耗 257k tokens。Hermes 联创 @Teknium 反击称该基准不科学,指出单次运行、无重复测试、Qwen 35B 易循环等问题,并展示 Hermes 在公开基准和真实用户数据上全面领先,用户日 token 量已达 OpenClaw 的 2.5 倍。这场辩论揭示了 AI Agent 评测的复杂性和社区对公平对比的诉求。行业AI AgentOpenClawHermes Agent2 个信源在谈事件专题推荐理由:AI Agent 开发者或评测爱好者会看到一场关于基准科学性的硬核辩论——单次跑分 vs 真实用户数据,哪个更可信?值得点开围观双方论据。原文稍后读已读值得跟进有用关注 AI Agent
19:11官方账号arXiv cs.LG@Marcin Kostrzewa, Sebastian Tomczak, Roman Furman, Anna Poberezhna, Michał Furgała, Oleksii Furman, Maciej Zięba企业破产预测是高风险金融任务,面临严重类别不平衡和多时间跨度预测挑战,但现有公共数据集规模小且稀缺。新基准V4FinBench包含来自维谢格拉德集团四国(2006-2021)的超过100万条公司年度记录,涵盖131个特征、六种预测时间范围,并采用综合财务困境标准。参考评估显示,经过不平衡感知微调的TabPFN在长周期F1和ROC-AUC上达到或超越梯度提升;而Llama-3-8B在每个时间范围的ROC-AUC上均落后于梯度提升。在外部美国破产数据集上,V4FinBench微调的TabPFN优于原始版本,表明学到了可迁移的财务困境结构。该基准已开源,以支持更真实的金融预测方法评估。论文表格基础模型金融预测基准评测推荐理由:对于金融风控从业者,该基准提供了百万级真实财务数据及多时间范围评测框架,可有效检验表格型基础模型和LLM在不平衡场景下的预测能力。原文稍后读已读值得跟进有用关注 表格基础模型