小团队 Dots.3-preview 居然在性能和成本上都压过 DeepSeek 新模型,作者重点夸了他们的 RL 训练方案,想追国产模型进展的可以看看。
#推理模型
ARC Prize 晒出 Grok 4.7 的实测成绩,有意思的是它一代分数涨了,二三代替反而降了,可以看看这套数据对比
有人拿 8 个决策模型打 Tetris,Perplexity Decider 稳居第一,还能自己在 playground 里复现,挺好玩的。
Cloudflare 的 Clef Flash 上 OpenRouter 了,点进 Playground 就能直接试,不用自己搭环境。
有人在 Copilot 365 Premium 里刷出了 GPT-6.1 Sol,比官方公告还早,想第一时间尝鲜的可以去看看自己的账号有没有。
DeepSeek 的 V4.1 Flash 跑分出来了,ARC-AGI-2 拿下 72.9%,比上一代高了 11.5 分,不过每任务成本贵了两倍多,看你怎么权衡。
Mistral 这次真支棱起来了,1T 参数只激活 49B,用 4000 块芯片就训出能跟 GLM-5.3 掰手腕的模型,欧洲总算有能打的了。
Mistral 拿出 1T 参数的 Le Chonk,激活只有 49B,跑分号称欧洲开源第一,还能在视觉定位上压过闭源模型,10 月底开源权重,可以关注。
Mistral 放出 1T 参数的 Le Chonk,激活才 49B,视觉定位还能打赢闭源模型,10 月底开源权重,开源党可以蹲一下。
ARC Prize 2026 峰会请来 Duke 的 PRO-LONG 一作,讲怎么用程序化记忆做长程推理,做推理方向的可以看看。
Mistral 放出了 1T 总参、49B 激活的多模态模型预览版,说是欧美最强开源权重模型,月底连权重一起放出来,做开源部署的可以盯着。
有人在 DGX Spark 上用自写的 vLLM 补丁跑 DiffusionGemma 和 Jev 对比,vLLM 官方都转发了,想看扩散模型推理性能的可以点进去。
蚂蚁的 Ling 3.1 Flash 智能分直接从 20 涨到 41,智能体能力能跟 GLM-5.3-Flash、DeepSeek V4.1 Flash 掰手腕,权重还快开源了。
法国 Mistral AI 直接放话新模型网安能力超过中国模型,欧洲厂商开始下场对标,看看它拿什么跟 DeepSeek 掰手腕。
不用 RL 训练,只在开头加个 "Okay" 就能让 Olmo-3-7B 数学成绩翻近一倍,这篇论文把原因挖得很透,做模型训练的值得看看。
一篇有意思的论文:不靠每次采样几十个候选,而是把 power sampling 的锐化直接蒸进模型,单次生成就超过 64 候选采样,数学和代码基准都有实测数字。
Nvidia 投资的 Reflection 出了新模型 Beam,官方说推理成绩能打平 Z.AI 的 GLM-5.2,想看美国初创怎么追赶中国模型的可以看看。
论文发现重启推理链的位置本身就有讲究,选对位置在 MATH-500 上能用更少算力超过 self-consistency,做推理成本优化的人可以看。
有人算出 Beam 和 DeepSeek V3 总训练算力几乎一模一样,等于是两年后的复现,但效率差挺远,评论区还挺热闹。
Reflection AI 放了个 501B 总参、23B 激活的开源模型 Beam,主攻编程和智能体任务,权重这个月就放,做本地部署的可以盯一下。
Reflection 新模型 Beam 正在被 Artificial Analysis 独立测试,早期数据显示它是同级开源模型里最省 token 的之一。
Arena.ai 更新了 Agent Arena 榜单,Anthropic 和 OpenAI 的模型在真实任务上谁强谁弱,一目了然。
Nvidia 投资的 Reflection 出了首个开源权重模型 Beam,号称推理打平 GLM-5.2 还更省算力,权重这个月就放。
Simon Willison 用 Colin Fraser 的老加法实验测本地 Qwen 3.8 27B,还对比了开不开推理模式的结果,想本地跑模型的可看。
GPT-6-Astra 和 GPT-6.1 Sol 速度从 30 提到 50 token/秒,日常用起来明显更跟手,这次只提速不重置。
有人在 DGX Spark 上重跑了 GPT-4o 的文字加法实验,Qwen3.8 27B 开推理后 169 次只错 2 次,还能看到逐位进位的思考过程。
不生成文本、只做分类决策的 Jev 三周就跑到日处理 1 万亿 token,OpenAI 和 Cloudflare 都出了同路线产品,挺值得了解的新方向。