03:02官方账号Meta AI@AIatMeta精选Meta 预览 WildArtifactBench,一个内部评估框架。该框架通过人类和智能体偏好评委的胜率和 Elo 分数,而非严格的真实基准,评估智能体在复杂现实任务中的表现。它扩展了任务覆盖范围,涵盖实用的多模态工作流。Meta 将发布 WildArtifactBench 中的 10 项任务。AI模型WildArtifactBenchMeta智能体推荐理由:Meta 推出 WildArtifactBench 评估框架,用胜率和 Elo 分数评估智能体,覆盖多模态工作流,还开放了 10 项任务。原文稍后读已读值得跟进有用关注 WildArtifactBench