#DeepSeek
DeepSeek 这轮融了至少 120 亿美元,连宁德时代都进场了,还盯上 2027 年 IPO,规模挺罕见的。
DeepSeek 这轮可能融到 120 亿美元以上,估值 710 亿,还要买 16 万块华为芯片建数据中心,腾讯宁德时代都跟投了。
DeepSeek 这轮融资规模冲到可能近 1000 亿元,腾讯和宁德时代都下重注,还计划 2027 年 IPO,加上内蒙古那个 16 万枚华为芯片的数据中心,信息量很大。
有人扒了 Beam 的沙箱数据:峰值 17 万并发、总共 13 亿个,每个只活 3-5 分钟,还对比了 DeepSeek 的统计口径,挺有意思。
拿了 20 亿美金的 Reflection 放出首个开源模型 Beam,501B 参数只激活 23B,直接对标 GLM 和 DeepSeek 的 Flash 系列,权重本月放出。
Fireworks 现在能直接微调 DeepSeek V4.1 Flash 了,想做编程智能体或工具调用的可以看看,托管训练省不少事。
DeepSeek V4.1 Flash 把和 Anthropic 的跑分差距从 15% 追到只剩 3%,想知道中美模型现在差多少的看这篇。
倍思新出的耳夹耳机,降噪做到 -50dB,还接了豆包和 DeepSeek 能录音转写、同传,598 元国补价可以看看。
Business Insider 的新报告说 DeepSeek 把中美模型差距又拉近了一截,还判断中国厂商会抢到更多市场份额。
帮你盘了下四款国产开源模型的发版传闻:Qwen 4、Kimi K3.1、GLM-5.4、DeepSeek V4.2,想本地跑模型可以先记好时间线。
有人实测推理只有 72 TPS,对比 DeepSeek V4-Flash 在 DSpark 报告里的单 GPU 成绩直接少了三分之二,评论里讨论了 TileLang 内核和 npugraph_ex 还能优化多少。
DeepSeek 的 Harness 更新了,现在能直接跑 Claude Code Mods 当插件,还带了插件开发工具包,写 agent 的可以试试。
DeepSeek 给开源智能体框架 Harness v0.2 出了桌面版,Mac 和 Windows 都有,还能接别的 OpenAI 兼容模型,搞自动化任务的可以试试。
Gemini 4 快来了,而且 Anthropic 博客都还在引用 GLM-5.3 的网络能力,国产模型这条线索值得关注。
写代码的朋友可以试试,560B 的 MoE 模型 Ling 3.1 Flash 进 Cline 了,10月13日前免费用,性能对标 Kimi K3 和 DeepSeek V4 Pro。
一条关于 DeepSeek V4.1 的训练观察:没做 dense warmup 也能训练顺利,作者解释了为什么这种设计值得 scale up。
DeepSeek V4.1 Flash 的论文在 HF 榜单只有 191 赞,发帖人直接开怼,评论区吵起来了,看看大家怎么说。
一个玩家用单张消费卡跑出比多数 API 还快的推理速度,靠的是 Qwen Flash 的模型设计和 Strata 流水线架构,文章讲清了原理,本地部署党别错过。