DeepSeek把新模型和Harness框架一起开源了,权重MIT可自建,代码能力干到87.9分,直接对标Claude Code。
DeepSeek于8月13日发布V4-Pro-0813模型及代码智能体框架Harness公测版,后者对标OpenAI Codex和Anthropic Claude Code。V4-Pro-0813为1.6万亿参数MoE模型,推理时每token仅激活490亿参数,支持100万token上下文和38.4万token输出。内部测评显示,正式版在Terminal Bench 2.1得分87.9,预览版为72.1;DeepSWE从12.8升至62.7,DSBench-Hard翻倍至67.2。模型权重已以MIT许可证开放,开发者可下载自建。
对标 Claude Code:DeepSeek Harness 公测,同步开放 NPM 插件生态
IT之家 8 月 13 日消息,DeepSeek-V4-Pro-0813 正式发布,同时还推出了其代码智能体框架 Harness 的公开测试版,并同步开放了配套的 NPM 插件生态系统(但 GitHub 仓库仍处于非公开状态)。 “Harness”的通俗定义是将模型转化为智能体的工具。在大型语言模型之外,Harness 负责调度上下文、工具、任务状态、反馈与边界,把模型能力落地到真实环境中,完成从理解需求到交付代码的完整闭环。DeepSeek 此前在官方招聘信息中给出了“Model+Harness=Agent”的公式。 在产品定位上,DeepSeek Harness 精准对标 OpenAI Codex 及 Anthropic Claude Code,旨在成为一款主打编程和办公场景的 AI 生产力工具。 团队负责人崔添翼已于 8 月 2 日面向全球公开征集 Harness 内测用户。招募帖发布后,短时间内吸引了数十名全球开发者报名。 DeepSeek Harness(DSH)提供 dsh 命令行工具,用于产品配置与启动。其核心命令 dsh --profile <name> 用于启动指定配置文件。该工具支持 Web、Headless 等多种运行模式,并允许通过插件机制进行扩展。 DeepSeek-V4-Pro-0813 是一款基于混合专家(MoE)的模型,总参数量高达 1.6 万亿,实际推理中每个 token 仅激活 490 亿参数。该模型拥有 100 万 token 的上下文窗口,并支持最大 38.4 万 token 的输出长度。 在交互模式上,V4 Pro 提供“思考模式”与“非思考模式”两种选项,其中思考模式为默认设置。此外,V4 Pro 全面支持 JSON 结构化输出、Tool Calls、Responses API 和 Anthropic API 等高级功能。 据 DeepSeek 开展的内部测评,正式版相比预览版能力大幅提升,在多项测试中接近甚至超越 Claude Fable 5。例如在 Terminal Bench 2.1 测试中得分 87.9,远超预览版的 72.1。在其他测试中,DeepSWE 从 12.8 跃升至 62.7,DSBench-Hard 翻倍至 67.2。 值得关注的是,DeepSeek-V4-Pro-0813 的权重已正式开放。DeepSeek 的权重采用 MIT 许可证。此举被解读为将模型底座从对特定算力的依赖中解耦,开发者可下载自建,不再依赖云端单一服务;国产 GPU、通用算力卡无需厂商定制即可直接运行。这降低了政企私有化门槛,提升了供应链抗风险能力。