论文Agent 与开发者12:36DolphinBench 基准:用真实任务评估智能体记忆的准确率、成本与延迟做智能体记忆的可以看这份新基准:500k token 历史里找信息完成任务,还得报成本和延迟。#DolphinBench#智能体#智能体记忆#评测基准aarXiv cs.AI@Soumil Rathi 等 3 人原文稍后读已读值得跟进有用关注 DolphinBench