这篇论文用三个Harness和三个模型测了渐进式披露,发现小规模下效果看脸,大规模下才有用,二级路由反而坏事,值得搞智能体的人看看。
#推理模型
Poolside开源了Laguna S 2.1,118B参数只要8B激活就能跑,单卡DGX Spark就能用,还能和超大模型正面刚!
英伟达新硬件 Vera Rubin NVL72 实测 DeepSeek R1,每兆瓦 Token 吞吐量比 GB200 NVL72 高 10 倍,AI 推理效率飞跃。
OpenRouter上了两个新模型:Gemini 3.6 Flash和3.5 Flash-Lite,吞吐超150 tok/s,适合做智能体和子智能体,跑代码和知识工作很快。
Google 刚发的 Gemini 3.6 Flash 速度快、token 省,还能搞点 3D 小玩意儿,价格也降了,做前端活很顺手。
poolside 新出的 Laguna S 2.1 开源又高效,118B 模型只激活 8B 就能跑,还支持 1M 上下文,值得一试。
Google 出了两个新模型 Gemini 3.6 Flash 和 3.5 Flash-Lite,专为智能体场景优化,延迟更低、token 更省,做自动流程的可以看看。
Google 更新了三个新模型:3.6 Flash 更省 token,3.5 Flash-Lite 主打便宜,还有个专门搞网络安全的 Cyber 版本,选模型下拉菜单就能用。
Google 发布了三款新模型,其中 Gemini 3.6 Flash 在省钱和代码能力上明显提升,编程场景能省 65% Token,Computer Use 成功率 83% 值得一试。
杨植麟从Transformer-XL、XLNet到Kimi K3,只用16个专家就做到1M上下文,值得看看他的思路。
NVIDIA 把 40 亿参数的开放世界模型塞进设备端,机器人不用联网就能自己理解环境、推理并执行动作,适合边缘部署场景。
Anthropic的数学家随手用Fable 5怼翻了87年的雅可比猜想,OpenAI的Codex也跟上了,连张益唐当年都没搞定,AI这波真有点猛。
阿里发了Qwen-3.8 Max预览版,参数量2.4T,速度比Kimi-K3快一个数量级,限时一折,正式版很快开源,感兴趣可以试试。
Kimi K3在投资研究上直接干翻了GPT-5.5和OPUS-4.8,时间判断和证据边界控制尤其强,已经在AlphaEngine上用了,搞金融研究的可以试试。
有人把 Claude Fable 5 的思维链塞进了 MiniCPM5-1B,搞出个 657MB 的本地推理模型,128K 上下文还能看它怎么想的,部署门槛极低。
想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。
阿里新出的2万亿参数大模型Qwen3.8-Max-Preview,号称只比Fable 5差一点,已经能直接试用了,想看看它有多强可以测测。