#DeepSeek-V4
MoE 推理部署的人可以看看,DeepSeek-V4 和 GLM-5.3 上实测 TTFT 快了近一半,思路是让专家计算别干等慢副本。
StateM 不改模型权重,光靠升级执行系统就把 GPT-5.6 在终端测试的准确率拉到 95.3%,成本只要 15 美元,值得看看它的思路。
这篇论文把PTQTP量化器约束成九级格式,在DeepSeek-V4上做到和官方API几乎一样准,还快6.7%、文件小9%,适合搞MoE推理优化的朋友看。
SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。
这篇论文展示了如何在华为Ascend芯片上高效后训练万亿参数模型,并且通过运筹学专用微调,在特定任务上超越了GPT-5.4-Mini。
DeepSeek-V4 Flash RL 在 AMD 显卡上跑通了,训练结果还不错,AIME 分数涨了一截。想试试 AMD 平台搞 RL 训练可以看看这篇。
SGLang加入DSpark后,高并发场景下吞吐能提升20%,在DeepSeek-V4上实测383.7 tok/s,推理优化党可以试试。
DeepSeek 出了个叫 Deep Code 的开源编程助手,专门搭配 V4 模型用,能记对话续任务,改代码跑命令一气呵成。
腾讯云上了 DeepSeek-V4 原厂版,7 月中旬就能用,价格分峰谷,白天贵一倍,晚上便宜,有 Pro 和 Flash 两个版本可选。
DeepSeek开源了DSpark框架,能让你的V4模型推理提速60%以上,且不影响质量。它解决了投机解码在真实部署中的难题,已经稳定跑在生产环境。
vLLM v0.23.0 大更新,DeepSeek-V4 和 Llama 用户值得升级,新的 KV 缓存卸载能省显存,推理与工具调用解析也更顺了。
LSA 解决了超长上下文推理的 GPU 内存瓶颈,做长文档分析或大规模序列建模的团队可以直接参考其稀疏注意力方案,显著降低部署成本。
腾讯云大幅降低DeepSeek-V4系列模型调用成本,做AI应用开发或智能体集成的团队可以直接降低推理成本,缓存命中价格降幅高达97.5%,高频调用场景尤其划算,建议开发者抓紧调整预算。
NVIDIA 官方修复版解决了 DeepSeek-V4 在自家硬件上的精度和稳定性问题,用 NVIDIA GPU 做推理的团队可以直接拉取使用,省去自己调优的麻烦。
Orbit 让万亿参数模型的后训练不再依赖大规模集群,做 RL 微调或大模型优化的团队可以直接在单节点上跑 DeepSeek-V4,建议试试这个开源方案。
努比亚用户无需等待系统更新就能用上百万上下文AI模型,做深度文档分析或复杂任务的用户可以直接试试,体验升级立竿见影。
长上下文和低成本是当前 AI 应用的两大痛点,DeepSeek-V4 同时解决这两个问题,做 RAG、文档分析或长对话的开发者可以直接上手试试。