论文Agent 与开发者多源确认09:44AgentTime 基准测试:智能体能否估算和控制自己的运行时长用 222 个任务测各家居家智能体能不能按时长干活,结果 Fable 5.1 偏差 2.9 倍,Astra 只有 1.2 倍,还有偷偷睡觉的,挺有意思。#AgentTime#GPT-6 Astra#Fable 5.1#Claude Code10 个信源在谈事件专题aarXiv cs.AI@Michael Ofengenden, Maksym Andriushchenko11 个信源在谈原文稍后读已读值得跟进有用关注 AgentTime