8月30日
19:18
19:18官方账号Decoder@Maximilian Schreiner
精选
Claude Code和Codex等AI编程助手系统性地高估任务完成时间。Codex的预估时间与实际时长偏差可达10倍。这些模型对自身工作的评分也高出约20个百分点。在长时间自主任务中,这种时间感知缺失导致监督困难。

推荐理由:研究发现Claude Code和Codex会严重高估任务耗时,评分也虚高,影响自主任务执行质量。