#DeepSeek-V4-Pro
训练万亿参数 MoE 模型的负载不均问题有了新解法,DeepSeek-V4-Pro 上实测训练加速最高 1.94 倍,还不用加硬件,做训练的可以看看。
Ollama 云端上线了 DeepSeek-V4-Pro,订阅 Pro/Max 就能直接用,美国节点还带零数据保留,要试的话一条命令就够。
DeepSeek 一口气发了 V4-Pro 和可插拔的 Harness,还涨了 API 价,缓存命中输入暴增 12 倍,用之前看清楚价目表。
DeepSeek 突然给 V4 API 涨价,还发了 V4-Pro,推理强度分三档,能直接配 Codex 用。想升级 Agent 工作流可以看看。
DeepSeek新模型V4-Pro专攻代码生成,在Code Arena排第8,开源第2,仅次于Kimi K3,还超过了GPT-5.6 Sol。
DeepSeek新模型在Text Arena拿1465分,和GLM-5.1、GPT-5.6 Terra一个水平,开源阵营排第五。
DeepSeek 发公告说 API 近期要涨价,幅度不小。现在 V4-Flash 输出 2 元/百万 Token,V4-Pro 输出 6 元/百万 Token,有需要的可以提前安排。
DeepSeek刚更新了V4-Flash API到0731版,但架构和预览版一样,V4-Pro正式版马上就出,API开发者可以先升级试试。
这篇论文搞了个CodeSpec,让代码智能体在仓库里加新功能时先建可执行规范,在FeatureBench上用DeepSeek-V4-Pro跑到70.7%通过率,比Claude Code靠谱不少。
论文提出DARWIN,用进化算法同时生成攻击和训练防护,在DeepSeek-V4-Pro和GPT-5.5上攻击成功率超高,安全召回率也强。
腾讯云上了 DeepSeek-V4 原厂版,7 月中旬就能用,价格分峰谷,白天贵一倍,晚上便宜,有 Pro 和 Flash 两个版本可选。
国产芯片终于能跑万亿参数大模型了,做AI基础设施和模型训练的团队值得关注——这证明昇腾910C已具备工业级训练能力,后续国产替代路径更清晰。
做多语言智能体或网页浏览任务的团队会立刻意识到差距——韩语场景下最强模型准确率不到一半,说明现有评估严重偏向英语。做韩语 NLP 或本地化产品的开发者可以直接用这个基准测试自己的模型。
腾讯云智能体平台的两款热门模型结束免费公测,做AI应用开发的团队需要重新评估成本,建议提前了解计费细节,避免服务中断。