西蒙威利森今天做了个叫CORS Chat的小工具,能通过网页界面测试LM Studio和OpenRouter的聊天接口,还支持流式SVG渲染,挺实用。
#Qwen
Mac 本地跑模型试试这个 Zig 写的 MLX-Serve,免 Python 还带菜单栏,配 Qwen 3 跑 Pagoda 测试比之前都强。
DeepInfra上线了Qwen最新稀疏MoE模型,2.4T总参数只激活95B,专攻编程和智能体场景,价格也公布了,想试API的可以直接上手。
Qwen3.8-27B 现在靠 Unsloth 动态量化,17GB 内存就能跑,还有 NVFP4 量化版,适合本地尝鲜。
DeepSeek V4 Pro 到底行不行?这条推文用公开数据聊了聊它为什么不够惊艳,顺便夸了 Flash 和 GLM-5.2,观点挺实在。
阿里开源了Qwen3.8-2.4T-A95B,2.4T参数激活95B,原生256K上下文,编程和Agent能力对标GPT 5.6 Sol和Opus 4.8。
论文搞了个新基准CoDyControlBench,测了6款模型,GPT成功率最高94.8%,还蒸馏出1.5B小模型能上机械臂干活。
想用DeepSeek、Qwen这些开源模型?现在在Netlify里就能直接用OpenRouter调了,不用来回切换平台。
这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。
这篇论文用具体数字告诉你,准确率分数会骗人:同样2048 token,Qwen比DeepSeek多出近10倍的无答案失败,评估时得分开看执行状态和得分。
这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
这篇论文解决了长上下文下投机解码的瓶颈,用滑动窗口草稿省掉99%的KV读取,实测速度提升近三成,而且不损失精度。搞大模型推理优化的值得看。
阿里云和AMD一起办了个Agent Builder Day,说现在的云不适合智能体,他们要搞一套专门为智能体设计的云,包括Qwen和Wan模型。
阿里Qwen新能力Rich Content,一张图能嵌套VSCode、Qwen Chat等四层界面,像套娃一样,考验模型对复杂布局的理解。
阿里云晒出真实客户案例:EaseMate用他们AI服务,内容审核准到99.5%以上,还省了20%成本,做AI平台的人都该看看。