美团把 LongCat 升到 2.5 预览版,1M token 上下文加多模态,专门给跑长任务的编程智能体用,不过这次没放跑分数据。
#推理模型
阿里这次没发新模型,而是让 Qwen3.8-Max 自己训自己,33 轮迭代后成绩追上 Claude 和 GPT,还顺手把多模态价格砍了九成。
Anthropic 下一款 Sonnet 5.5 被内测网友扒出来了,实测编码干过 GPT-6 Sol,价格只要 $2/百万 token,文章还教你怎么检查自己有没有被灰度到。
Fireworks 拿 Kimi K3 改了个 Ember-1,推理 token 少用 40% 还不掉分,省钱党可以看看。
Fireworks 在 Kimi K3 上做了后训练,产出 Ember-1,跑编程任务时推理 token 少了 71%,性能不变,省钱明显。
MiniMax 推出轻量快的 M3.1 Flash 预览版,跑大量请求的团队用现有 Token Plan 就能直接调,不用额外配置。
有人把 Opus 5.5 和 GPT 6 的跑分放在一张图里了,重点看 Terminal-Bench 4.0,GPT 在跨应用自动化那项表现很猛。
作者把 OpenAI Dev Day 可能的几种打法都列出来了,降价 50% 和新模型 Bel 是重点,比 Codex 小功能更值得盯。
Yuchen Jin直接说Claude Opus 5.5不如Astra,还断言编程能力从Opus 4.8起就停滞了,看看这个反主流判断
OpenRouter 公布分类请求数据,Jev 拿下 27% 份额,把 DeepSeek V4 Flash 挤到第二,做分类任务可以关注下。
Anthropic 的 Opus 5.5 (High) 拿下 Text Arena 第一,1509 分比上一代高 18 分,前六名全是他们家,价格数据也标出来了。
Claude Opus 5.5 (High) 在 Text Arena 拿了 1509 分,价格每百万 token 16 美元,选模型时可以参考这个性价比坐标。
Gemini 4 已经进入后训练阶段,Kavukcuoglu 说可能年底前就发布,目标是追上 Anthropic 和 OpenAI。
Raschka 又更新了,这期手把手教你用 PyTorch 算 token 概率给模型答案打分,还搭了一个 self-refinement 循环,最后跑 MATH-500 看效果。
Jared Palmer 的 Kev 4B 上 OpenRouter 了,输出免费、输入每百万 token 才 $0.042,传状态进去就能拿到结构化的回答,做小任务很便宜。
Anthropic 的 Claude Opus 5.5 把破折号用量砍了 95%,回答还变长了 6%,全靠更短的句子撑起篇幅,数据挺有意思。
Text Arena 拆了 Opus 5.5 和 5 的写作差异:句子短了 17%,破折号少 95%,但含糊词翻倍,写东西前可以看看。
TypeSafe 做了个叫 Jev 的路由模型,每轮对话前给你的提示词打分,判断该用贵模型还是便宜模型,省钱和保质量二选一的问题它替你算。
OpenRouter 跑了五个 agent 基准,Jev Router 首 token 延迟全场最快,做智能体的可以看看选路由了。
Artificial Analysis 发文回顾两年:o1-preview 开创推理模型,他们的评测指数也从 4 项考试题扩到 10 项智能体任务,能看清评测怎么进化。
LMArena 用不到 60 秒讲清 GPT-6 Sol 和 Claude Opus 5.5 到来这周的动态,赶时间可以直接刷这条视频。
阿里 Qwen3.8-Max 被曝跑了 33 轮自动训练迭代,AA 分数从 40 涨到 45,还有 2.4T 参数的说法。
DeepSeek 和智谱都出了 Flash 版本,看来各家都在学 Google 那套分级打法,DeepSeek 可能还要出 Pro 和 Ultra。
有人扒到智谱 GLM-5.5 Flash、GLM-5.4 和 Kimi K4 的命名线索,猜 K4 激活参数比 K3 还少,吃瓜看看。