Mem0 团队做了个新基准 DolphinBench,专测智能体记忆:不看答题对错,看长对话后动作做没做对,还把成本和延迟一起排名,选记忆系统前可以先看看。
全部动态
Mem0 把 GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5 扔进 Hermes 和 Claude Code 两套框架跑分了,排行榜在 dolphinbench.ai,可以直接看哪个模型换框架后掉分最少。
Anthropic 预告 Claude Sonnet 5.5 和 Haiku 5.5 几周内就来,主打性能、效率和安全三方面升级,用 Claude 的可以蹲一下。
Anthropic 亲自预告了,Sonnet 5.5 和 Haiku 5.5 几周内就来,性能效率安全都会升级,等发布再细看。
Anthropic 刚发了 Opus 5.5,编码和写作都很强,性能对标 Fable 5.1 但比 Opus 5 便宜 40%,可以上手试试。
Anthropic 出了 Opus 5.5,能力追平 Fable 5.1,价格还便宜四成,用 Opus 的可以看看换不换。
做了 50+ 家 AI 公司评测的两位作者出了续篇,Ramp、Shopify、Cursor 怎么靠 evals 降本增效都写了,还送个插件。
Vercel 老板亲自点评 Anthropic 的新页面,讲的是 headless 加 AI 怎么把网页设计玩出花,做前端的可以看看。
rauchg 要在 Vercel Ship SF 现场采访 Tobi Lütke,聊智能体商务和架构话题,10 月 15 日,感兴趣可以去官网报名。
Anthropic 把 Opus 5.5 的价格砍了 40%,缓存读取还便宜 60%,跑分追平 Fable 5.1,用 Claude 写代码的可以看看降价幅度。
Devin 现在能用 Claude Opus 5.5 了,在 FrontierCode 1.1 上反超 Fable 5 拿第一,价格还便宜不少,写码的朋友可以试试。
Cognition 自家的 FrontierCode 榜更新了,Claude Opus 5.5 拿 65.3% 超过 Fable 5,成本还更低,写代码的可以看看。
用 Claude Design 做设计的朋友看这个:设计时别喂代码,讲清楚功能就行,再学他导出 HTML+React 后用本地 Skill 迭代,省得来回搬文件。
Anthropic 的新旗舰 Opus 5.5 来了,性能对齐 Fable 5.1,跑起来比 Opus 5 便宜四成,用 Claude 写代码的可以关注下
Anthropic 把新模型 Opus 5.5 设成 Claude Code 和应用的默认了,比 Opus 5 便宜 40%,额度还多 25%,Pro 和 Team 用户直接就能用上。
Firecrawl 拿了 Smash Capital 领投的 7500 万美元 B 轮,做了个叫 Alexandria 的知识库,让智能体直接调各种数据集,做 agent 的可以关注。
AssemblyAI 的 Universal-3.5 Pro 在 OpenRouter 上线了,19 种语言转文字还能加词级时间戳,9 月 29 日前半价,搞语音的可以去试试。
LangChain 新出的 Managed Deep Agents,在 Slack 里 @一下 Patch,它就自己开好带 diff 的 GitHub PR,几行代码就能接进你的工作流。
NVIDIA 的 Nemotron Labs 搞了场专家直播,专门讲怎么评估 Agent 技能,做智能体开发的话可以看看他们的评估思路。
Anthropic 新发的 Opus 5.5 性能追平 Fable 5.1,还比上代便宜 40%,跑大规模任务的可以看看成本账。
Claude Opus 5.5 进了 Perplexity Computer,跑 WANDR 比 Fable 5.1 分数略高,价格还便宜六成多。
Firecrawl 拿到新资金做 Alexandria,做爬虫给 AI 用的内容方可以直接登记等名单,看看能不能靠数据赚钱。
Claude Opus 5.5 上 OpenRouter 了,编程和电脑操作能力超过 Opus 5,1M 上下文还降价 20%,可以试试。
Opus 5.5 来了:比 Opus 5 便宜 40%,输出还快 30%,跑活多的可以留意一下换模型能省多少。
Claude Opus 5.5 发布了,跑分对标 Fable 5.1 还便宜 40%,额度多了 5 小时,写作风格据说改得更自然,可以用起来试试。
小米的 MiMo v2.6 Flash 跑分接近 Grok 4.7,成本却只有 1/57,做 agent 的可以看看这份 60 任务实测。
宝玉实测的省钱组合:贵的模型出方案,便宜的模型干活,再让贵模型自动验收,全程不用人工盯。Token 贵的都该看看这套闭环玩法。
Anthropic 新模型追平自家顶级模型,价格还砍了四成,缓存读取降到 0.2 美元,跑 Agent 的开发者直接受益,比 GPT-6 Astra 便宜一半以上。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档