Upstage 的 Solar Mini 4 这两周在 Nous Portal 免费用,3B 激活参数却能打过 10 倍大的模型,赶紧去试试。
#开源模型
德国公司 Aleph Alpha 把 Kolibri 权重完全开源了,Apache 2.0 许可随便用,78B 参数 MoE 架构还特意喂了 21% 德语数据。
Qdrant 和 Neo4j 办的线下辩论赛,工程师 1v1 互怼“开源权重该不该禁”,观众投票定胜负,10 月 9 日在旧金山,报名要审核。
EverMind AI 开源了 Raven,每个模型配一套会自我进化的 harness,用 DeepSeek-V4-Flash 在 BrowseComp 上跑出 69.3%,研究者可以看看这套思路。
一个开源项目把阿里 Qwen 的 125B 模型量化后塞进了 12GB 显存的消费级显卡,每秒还能跑几十个 token,本地部署玩家可以看看它怎么分配显存和内存。
vLLM 官方点名感谢开发者 Abhinandan,他给 semantic-router 和 Mooncake 都提交了代码,做推理优化的可以关注下这两个项目。
美国初创公司 Reflection 要发开放权重模型了,据说是冲着中国的开源模型去的,还有 SpaceX 签的算力合作撑腰,看看西方这次能不能追上。
Cantina 把 Z.ai 的 GLM-5.3-Flash 微调成了专挖漏洞的开源模型,60 个私有漏洞任务解出 40 个,MIT 协议随便部署。
做 Text-to-SQL 的同学可以看看 FALCON 这个框架,用小开源模型本地就能造出比现有基准更难的训练数据,还不用调外部 API。
一篇把 Qwen 从 7B 到 2.4T 参数每个版本的发布和许可证变化都捋清的长文,还带了来源链接,想对比选型可以收藏。
NVIDIA把PixelUMM开源了,一个模型搞定图文视频的理解和生成,做法是不用视觉编码器直接吃像素块,搞多模态研究的可以看看源码。
RNA 不是静态的,但数据一直很缺。这个团队放出了 2585 条全原子轨迹的基准,还做了一个模型能同时生成轨迹和从单个构象预测动力学,做分子模拟的可以看看。
MIT开源的JAZ只用一个invoke函数就干了记忆库和优化管道的活,成本不到Letta一半,成绩还更高,做Agent的可以看看源码。
博主用 M5 Stack 硬件加上 MiniMax API 做了个磁吸在屏幕边的小设备,还能语音播报,Muse Gadgets SDK 刷固件就能玩。
在手机上跑 Claude Code 的两个开源方案,Orca 能多 Agent 并行加终端分屏,Paseo 支持语音控制还不用登录,按需求挑一个就行。
不想云端模型动不动拒答的话,这个用 480KB 控制向量改 Qwen3.8-Flash-Next 的法子挺有意思,12GB 显存就能跑。
帮你盘了下四款国产开源模型的发版传闻:Qwen 4、Kimi K3.1、GLM-5.4、DeepSeek V4.2,想本地跑模型可以先记好时间线。
DeepSeek 的 Agent 桌面端把插件做成了核心架构,60% 用户都在装插件,这篇解释了他们为什么主动兼容 Claude Code Mods。
12G显存的电脑也能跑125B的Qwen3.8-Flash-Next了,Strata把常用专家放显卡、全量放内存,项目已在Github开源。
NASA 和 IBM 把月球轨道器 17 年的观测数据训成了一个开源模型,预测极地冰误差能降 22%,做月球研究的可以直接拿来用。
德国人自己从零训了个开源小模型,德语成绩还压过 Qwen3.5 和 GPT-OSS,数学也够硬,编程稍弱。
System76 的 COSMIC 桌面环境现在明确禁止 AI 生成代码进 PR,理由是维护成本太高,Ladybird 浏览器 6 月也这么干了。
有人实测推理只有 72 TPS,对比 DeepSeek V4-Flash 在 DSpark 报告里的单 GPU 成绩直接少了三分之二,评论里讨论了 TileLang 内核和 npugraph_ex 还能优化多少。
Meta 把 Muse Gadgets 的代码放出来了,但核心模型还是自己攥着,这条视频用 8 分钟讲清它想抢 Physical AI 入口的算盘。
Airtable 前高管 Bindu Reddy 的一个观点帖:她赌中国实验室、Google、Grok 这些人类团队还能赢过 OpenAI 和 Anthropic 的内部模型,还暗示开源新模型要来了。