#DeepSeek V4 Pro
模拟电路版 SWE-bench 来了:50 个真实设计任务,15 种智能体跑 2250 次实验,DeepSeek V4 Pro 靠参考拓扑涨了 18.7 个点。
有人把多个模型混着调用,30 个智能体任务测下来追平 GPT-6 Astra,成本只要 1/3,混合路由这事有数据了。
Bolt 给 1100 万开发者开放了 GLM 5.3 Flash 等开源模型,使用量提升 50 倍,比 DeepSeek V4 Pro 更快更便宜。
Perplexity 把 DeepSeek V4 Pro 放进自家电脑了,跑分 0.359,每任务才 0.75 美元,比同档便宜六成多,性价比很能打。
CodePilot 现在能白嫖 Grok 的绘图和视频模型,只要有 Twitter 会员就行,还支持检索推文,挺划算的。
千问办公现在能直接用 GLM-5.3 和 DeepSeek V4 Pro,一个开源一个超长上下文,复杂任务和自动化工作流都能扛,想试试前沿模型可以直接上手。
OpenCode Go 直接把 DeepSeek V4 Pro 放进客户端了,之前大家还在追 Flash,现在 V4 Pro 出来直接在 OpenCode Go 里用,想试新模型的朋友打开就能选。
DeepSeek 又发新版本了,V4 Pro 正式版 API 已上线,智能体能力更强,还支持 Codex,性能直逼 Fable 5。
DeepSeek V4 Pro 正式版来了,Agent 能力增强,支持 Codex 接入,跑分直逼 Fable 5,用 API 的可以试试。
有人用同一组提示词跑Grok 4.6和DeepSeek V4 Pro,Grok在打砖块场景和Bento样式上都很惊艳,部分比DS 4 Pro还好看。
想知道中国大模型是不是都一个样?这篇论文用囚徒困境测了DeepSeek、Qwen、Kimi和GLM,发现它们合作倾向差别挺大,别再把它们当铁板一块了。
DeepSeek V4 Pro 跟 Claude Fable 只差 0.3%,又赶上新一轮融资,colaos.ai 的六倍 DeepSeek 额度还能撑多久真不好说。
OpenRouter按真实花费给模型排名,DeepSeek V4 Pro拿下Shell执行第一,Kimi K3拿下工具调度第一,开放模型领先。
有人设想让 V4 Pro 规划、V4 Flash 执行,还招开源开发者内测 DeepSeek Harness,想玩 Agent 的可以关注。
OpenAI把Luna模型价格砍到原来的五分之一,比DeepSeek V4 Pro还便宜,性能却更好,做任务的成本大幅降低。
阿里云发了个 2.4T 参数的开源模型 Qwen 3.8 max preview,性能接近 Fable 5,首月才 4 美元,还能在 Claude Code 里用,可以试试。
想选行业AI模型?Claude Fable 5 碾压全场,但成本是 DeepSeek V4 Pro 的百倍,性能只多 12 分,性价比得掂量。