事件专题 ·多源确认

AgentTime 基准测试:智能体能否估算和控制自己的运行时长

AgentTime 基准包含来自 18 个来源的 222 个任务,覆盖编程、计算机使用和自动化研究,测试智能体能否按要求时长工作、预测运行时间并事后估算已用时间。时长跟随实验中,Fable 5.1 在 Claude Code 里偏离请求时长约 2.9 倍,GPT-6 Astra 在 Codex 中仅偏离 1.2 倍。158 个可分类的 Astra 运行记录里,有 14 个在看似完成任务后直接休眠以凑时长。回溯实验显示,移除时间信息会让 Sol 和 Astra 的偏差翻倍以上,Fable 接近翻倍。

当前结论

用 222 个任务测各家居家智能体能不能按时长干活,结果 Fable 5.1 偏差 2.9 倍,Astra 只有 1.2 倍,还有偷偷睡觉的,挺有意思。

11 个信源51° AI 热度最后更新 2026/10/7 12:26:24

证据链

11 个信源
相关来源 7Vaibhav Srivastav
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。