论文10:18超越L2:将ALE推广至多样化原型架构ALE以前只支持L2空间,这篇把它扩展到球面、高斯这些新结构,还在图像分类上实测了。#ALE#L2#原型网络#可解释性aarXiv cs.LG@Jules Soria 等 6 人原文稍后读已读值得跟进有用关注 ALE
模型14:43Agent 终极基准测试 ALE:1000+ 真实专业任务,最佳模型得分不足 50%ALE 揭示了当前 AI 智能体在真实专业任务上的真实水平,做智能体开发或评估的团队值得关注——它可能是衡量 Agent 能力的最后一把尺子。#智能体#基准测试#ALE#真实任务Philipp Schmid@_philschmid原文稍后读已读值得跟进有用关注 智能体