Microsoft 这篇论文做了个 Taste-Bench,专门考智能体在任务分叉时选路的品味,最强模型也就答对 59.7%,还发现加大推理预算没用。
#推理模型
StepFun 的 Step-5-Preview 实测来了,输出特别稳,还能钻规则空子赚积分,前端偏弱,想选国产模型写代码的可以看看。
xAI 的 Grok 4.7 上 Agent Arena 榜了,任务成功率明显变好,但单任务价格从 $0.74 涨到 $1.14,省钱党可以先观望。
Google DeepMind 的新掌门亲自确认 Gemini 4 在做 post-training 了,毕竟 3.5 Pro 跳票、对手 Claude 5 和 GPT-6 都已经出街,这篇讲清楚了 Google 下一步怎么追。
这个评测思路挺聪明:造出规则完全陌生的异星世界,模型没法靠背题,只能真去探索。评测了 10 个系统的表现,结果有些意外。
25 个模型在这个基准上只给故事不给问题,直觉成绩差了 22 倍,排名和常规榜单完全对不上,还有模型被自己的过滤器拦住,很值得细看。
一篇很硬的论文:把规划拆成生成、修订、评估三个隔离模块,ZebraLogic 上比直接让 LLM 规划高 30.8%,还压过 GPT-5-mini 14.5%。
这项研究拿 DeepSeek-R1-Distill 全系列做实验,结论挺扎心:模型变大只是解题能力强了一点,推理消耗的 token 一点没省,想靠堆规模提效率可能走不通。
OpenAI 把 GPT-6 Astra 的能力下放到 Sol 和 Luna 两个便宜模型,Luna 编码榜涨了 74 分,API 价格还砍了一半,跑批量任务可以看看。
Boltzbit 给出了智能体自我改进的第二条路:直接改权重而不是堆记忆,理论上算力省约 1000 倍,思路很值得琢磨。
做自定义 harness 的可以看看 CLM-8B,比 Jev 快 9 倍,DeepSWE 跑到 81.6%,代码和模型都开源了。
Sonnet 5.5 被偷跑测试了:100 万 tokens 上下文,价格直接对标 GPT-6-Sol,想换模型的可以盯一下。
Google DeepMind 主管透露 Gemini 4 已进后训练阶段,打算比年底更早放出早期版本再快速迭代,想追新模型的朋友可以盯一下时间线。
用 vLLM 做 RL 训练的老大难——训练和推理数值对不上,这次在 AMD MI300X 上真做到了逐位一致,做 RL 的都该看看。
The Information 传 Gemini 4 快训练完了,发布可能比年底早很多,盯着 OpenAI 的朋友可以留意下 Google 这边的时间线。
有人拿牛顿摆实测了 GLM-5.3 和 OpenRouter 上的神秘新模型,物理模拟谁更靠谱一看便知,还有难倒两个模型的翻车场景。
Claude Opus 5.5 拿下 58 分登顶,但 $0.13 的 MiMo-V2.6-Pro 得分 46,性价比党可以直接看这张图选模型。
前 OpenAI 研究副总裁 Jerry Tworek 说,模型做数学编程很猛,但简单任务照样翻车,光堆模型能力不够。
Google 官宣 Gemini 4 进入 post-training 了,初步版本很快就来,盯着 OpenAI 那边的朋友可以对照看看进度。
Zenith 用最便宜的 DeepSeek v4.1 Flash 打赢了 GPT 5.6 Sol,开源党可以看看它怎么做到的。
DeepMind 新掌门首次开口,说 Gemini 4 就在打磨阶段了,之前一直被 OpenAI 压着打的 Google 这次要追分了。
Gemini 3.5 Pro 跳票后谷歌直接憋了个 Gemini 4,已经进入后训练阶段,年底前就能见到,内部员工还拿它跑编程工具了。
Boltzbit 和剑桥搞了个新架构,把聊天里的新知识直接编译成 LoRA 权重写进模型,长对话和多轮场景下比 RAG 省算力还更准。
月之暗面的 Kimi K3.1 曝光了,会有 Low/High/Max 三档推理和 Swarm 多智能体协作,10 月见分晓。
一位前 TikTok 推荐算法工程师拆解了 JEV 这个新范式,还拿 500 篇 ECCV 论文的查询任务和 Claude 打了个平手,做推荐搜索的值得看看。
Anthropic 的 Claude Opus 5.5 (Max) 在 LMArena 拿下第一,混合价才 $16 每百万 token,性价比曲线被改写了。
腾讯混元把经典批大小理论搬进了 LLM 强化学习,实测 PPO 吞吐提升 2.29 倍、GRPO 训练省 29% 时间,做 RL 训练的可以看看怎么调参省钱。
Google 的 Gemini 4 据说要这两天就发,The Information 爆料的,感兴趣的可以先蹲一下官方消息。
小米 MiMo 团队搞了个新注意力架构,1M 上下文时 prefill 计算量和 KV cache 都砍到原来的几分之一,长文检索分数还涨了,做长上下文部署的可以看看论文。
OpenAI 新出的 GPT-6 Sol 和 Luna 便宜了一半,Sol 跑分还超过了 Claude Opus 5,做大批量任务可以认真看看这个定价。
这篇论文造了个诊断集,专门测长上下文模型“找到了但没用上”的问题,DeepSeek 两个模型都被测出检索满分但解读掉分,做长文本评测的可以看看。
这篇用分层贝叶斯方法量化了 DeepSeek-R1-Distill 系列的推理能力与 token 消耗,结论是加大模型只提升能力不提升效率,做选型或研究 scaling 的朋友可以看看。
Fireworks 在 Kimi K3 上做了个减法:推理 token 少用 40% 但质量不掉,跑推理烧钱的朋友可以看看。