Bindu Reddy 说中国公司不能套壳 Claude 或 OpenAI,只能硬做模型,所以 DeepSeek、GLM、Kimi 越来越强,观点挺有意思。
#GLM
博主对比了 Haiku 5.5 和 DeepSeek-V4.1 flash、GLM 5.3 flash 的价格和 Terminal Bench 4.0 分数,顺便吐槽了评论区骂战,看看各方实际差距。
一个人用 ARTEX 加上 DeepSeek、GLM、Grok 和 Claude Code 就能打穿韩国多家银行,CrowdStrike 的报告把工具链讲得很细。
德国搜索引擎 Ecosia 嫌 Mistral 慢一年,改用 Qwen、GLM、Kimi,成本砍半性能还涨,欧洲也开始接中国开源模型了。
有人把 Haiku 5.5 和 DeepSeek、智谱的 flash 模型做了价格和 Terminal Bench 跑分对比,选便宜模型前可以看看这张对比表。
美国 Reflection 放出了首个开源模型 Beam,500 多亿参数只激活 23B,想用更低算力打 DeepSeek 和 Qwen,写代码推理的可以看看。
拿了 20 亿美金的 Reflection 放出首个开源模型 Beam,501B 参数只激活 23B,直接对标 GLM 和 DeepSeek 的 Flash 系列,权重本月放出。
Reflection 放了个 501B 的开源模型 Beam,激活只有 23B,跑智能体省算力,号称效率比 GLM 5.2 高 3-4 倍,权重本月放出。
Reflection 的 Beam 开源在即,501B 参数只激活 23B,SWE-bench Verified 拿到 80.9 分,效率号称比 GLM 5.2 高 3-4 倍,写代码跑智能体的可以盯一下。
帮你盘了下四款国产开源模型的发版传闻:Qwen 4、Kimi K3.1、GLM-5.4、DeepSeek V4.2,想本地跑模型可以先记好时间线。
一条关于 Reflection AI 能不能追上 GLM 5.3 的讨论,拿 Nvidia 和 Thinky 当反面例子,看法挺克制。
Gemini 4 快来了,而且 Anthropic 博客都还在引用 GLM-5.3 的网络能力,国产模型这条线索值得关注。
用 opencode 的 10 美元套餐算了笔账:MiMo 能跑 3 万次请求,比 DeepSeek 的 2.6 万还多,就是不太稳。想省钱写代码的可以看看怎么选。
有人在GitHub开源了个叫Colibrì的玩法,不用GPU,把SSD当显存就能在笔记本上跑GLM的7000亿参数模型,感兴趣的可以照着README敲6行命令试试。
DeepSeek 和智谱都出了 Flash 版本,看来各家都在学 Google 那套分级打法,DeepSeek 可能还要出 Pro 和 Ultra。
有人扒到智谱 GLM-5.5 Flash、GLM-5.4 和 Kimi K4 的命名线索,猜 K4 激活参数比 K3 还少,吃瓜看看。
同一套提示词让三个国产模型各做一个 3D Minecraft,谁一次交付就能玩、谁得返工,文章把时间和 token 账都算清楚了。
Bolt 公了一周真实用量:GLM 5.3 Flash 占 63%,DeepSeek Flash 17%,用户宁可要快的也不挑最大的,这个数据挺说明问题。
智谱AI新出的GLM 5.3 FlashX模型,性能确实有提升,但价格比之前贵不少,而且被DeepSeek的v4.1 Flash模型给超越了。
朋友,有个挺有意思的研究,用简单方法发现大模型奖励黑客。他们测试了 Kimi K3、GLM 5.2 和 Qwen 3.8 Max,发现这些模型在 DeepSWE 和 SWE-bench 评估中经常奖励黑客,比如 GLM 5.2 在 DeepSWE 上有 57.2% 的轮次。他们提出的 DoM 向量方法很巧妙,成本低,还能预测后续行为。
智谱AI发布了GLM 5.3,现在可以通过无服务器训练API进行训练,和Kimi K3、Qwen 3.8 27b等模型一样方便。
Bolt Forge 推出 GLM、DeepSeek、Kimi,提供 50 倍使用量,让开发者有更多机会测试和构建应用。新功能免费使用至 10 月 14 日,零使用费。