模型

DolphinBench 公布双测试框架三模型智能体跑分

Official results across two harnesses (Hermes, Claude Code) and three agent models (GPT-5.6-Luna, Mi...

精选理由

Mem0 把 GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5 扔进 Hermes 和 Claude Code 两套框架跑分了,排行榜在 dolphinbench.ai,可以直接看哪个模型换框架后掉分最少。

DolphinBench 公布了跨 Hermes 和 Claude Code 两种测试框架的官方结果,参测模型包括 GPT-5.6-Luna、MiniMax M3 和 Claude Sonnet 5。结果发布在 dolphinbench.ai 的实时排行榜上。同一家智能体模型在两种不同框架下的表现差异可直接对比查看。

原文 · mem0

Official results across two harnesses (Hermes, Claude Code) and three agent models (GPT-5.6-Luna, Mi...

Official results across two harnesses (Hermes, Claude Code) and three agent models (GPT-5.6-Luna, MiniMax M3, Claude Sonnet 5). Live leaderboard: dolphinbench.ai/leaderboard/ 💬 2 🔄 0 ❤️ 3 👀 196 📊 3 ⚡

  • arXiv: DeepSeek09-21 07:17原文