事件专题 ·多源确认

DolphinBench 公布双测试框架三模型智能体跑分

DolphinBench 公布了跨 Hermes 和 Claude Code 两种测试框架的官方结果,参测模型包括 GPT-5.6-Luna、MiniMax M3 和 Claude Sonnet 5。结果发布在 dolphinbench.ai 的实时排行榜上。同一家智能体模型在两种不同框架下的表现差异可直接对比查看。

当前结论

Mem0 把 GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5 扔进 Hermes 和 Claude Code 两套框架跑分了,排行榜在 dolphinbench.ai,可以直接看哪个模型换框架后掉分最少。

3 个信源67° AI 热度最后更新 2026/9/22 16:41:27

证据链

3 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。