10:18官方账号arXiv cs.LG@Jules Soria, Alban Grastien, Romain Xu-Darme, Julien Girard-Satabin, Zakaria Chihani, Daniela CancilaALE框架原先仅支持L2范数下的欧几里得潜在空间。本研究将ALE推广至球面度量、高斯密度和维度投影三类非欧几里得原型架构。作者针对三类变体推导了映射或新型界算法,并在图像分类器上计算子集最小形式解释。该统一框架在三种架构间首次实现严格的可解释性比较。论文ALEL2原型网络推荐理由:ALE以前只支持L2空间,这篇把它扩展到球面、高斯这些新结构,还在图像分类上实测了。原文稍后读已读值得跟进有用关注 ALE
14:43Philipp Schmid@_philschmidAgents' Last Exam (ALE) 是一个针对 AI 智能体的新基准测试,包含来自 55 个行业的 1000 多个真实专业任务,所有任务都源自实际专家工作,而非合成数据。测试结果显示,最佳智能体在最简单任务上得分低于 50%,在困难任务上低于 10%,最前沿模型在最高难度任务上通过率为 0%。模型选择对性能的影响大于工具链(harness),且增加 token 消耗并不能提升结果。智能体常见失败模式包括策略错误(47%)、领域知识缺失(31%)和执行错误(22%),且 34% 的任务需要 GUI 软件,但智能体倾向于回避并采用 CLI 变通方案。AI模型智能体基准测试ALE推荐理由:ALE 揭示了当前 AI 智能体在真实专业任务上的真实水平,做智能体开发或评估的团队值得关注——它可能是衡量 Agent 能力的最后一把尺子。原文稍后读已读值得跟进有用关注 智能体