#Qwen
日本 Actual Inc. 的 CEO 在阿里云 Apsara 大会上讲怎么用 Qwen 做建筑可视化,还聊了用 AI 复原老建筑体验,角度挺少见的。
日本游戏公司 Mynet 的 CTO 亲测后选了 Qwen,说它对日语写作的结构和语感把握得好,想了解 Qwen 日语能力的话可以看看。
Unity China 的 CEO 现场演示了怎么用 Qwen 模型加速游戏开发,做游戏或开发工具的朋友可以看看这套工作流。
阿里云分享的客户案例:Ignite Vision 用 Qwen 从几百万 KOL 资料里挑达人,人工几小时的活变成几分钟,做投放的可以看看。
德国搜索引擎 Ecosia 嫌 Mistral 慢一年,改用 Qwen、GLM、Kimi,成本砍半性能还涨,欧洲也开始接中国开源模型了。
一篇数据库方向的论文:把 Transformer 剪成 FFN 切片塞进数据库里跑预测查询,用 BERT-base 和 Qwen-0.6B 实测延迟降到 1/4.42,精度不掉。做数据库+ML 的人可以看看。
手把手拆了一个数据分析 Agent 的三层架构,主模型只写 SQL,另一个模型负责审查,连 200 行限制和人工审批都写好了,做 Agent 的人直接抄作业。
一篇降本干货:ECO 在 Qwen、DeepSeek 的分离式部署上实测省 40.5% 能耗,做 GPU 推理优化的可以看看方法细节。
12GB 显卡也能跑 125B 的 Qwen3.8-Flash-Next 了,Strata 开源,RTX 5070 上 94 词元/秒,配置门槛和 GitHub 链接都在文里。
Atomic Chat 把 NVIDIA TensorRT 接进自家引擎,RTX 5090 上跑 Qwen 系列模型比 llama.cpp 快一倍多,本地部署党可以看看实测数据。
Simon Willison 用 Colin Fraser 的老加法实验测本地 Qwen 3.8 27B,还对比了开不开推理模式的结果,想本地跑模型的可看。
一个开源项目把阿里 Qwen 的 125B 模型量化后塞进了 12GB 显存的消费级显卡,每秒还能跑几十个 token,本地部署玩家可以看看它怎么分配显存和内存。
一篇把 Qwen 从 7B 到 2.4T 参数每个版本的发布和许可证变化都捋清的长文,还带了来源链接,想对比选型可以收藏。
帮你盘了下四款国产开源模型的发版传闻:Qwen 4、Kimi K3.1、GLM-5.4、DeepSeek V4.2,想本地跑模型可以先记好时间线。
一张 RTX 3090 把 27B 模型跑到每秒 273 token,作者自己写的引擎,速度直接把普通部署方案甩开了。
AWS 开源了个 2B 小模型,专门替智能体做选择,115 毫秒出结果还带置信度,做路由和工具调用判断挺实用。
Cloudflare 用 Qwen 造了个决策模型,输出只按 schema 来,flash 版每百万 token 才 0.09 美元,比 Jev 便宜不少。
研究者测了五个开源模型,发现 Mistral 7B 和 Muse Glimmer 能从已滑出窗口的缓存里找回信息,做长上下文推理的可以看看。