#DeepSeek-V4-Flash
一群研究者专门审计智能体排行榜的基准污染问题,用 GPT-4.1 和 DeepSeek-V4-Flash 在 SWE-bench 上做了对照实验,结论是很多污染指控证据不足,做评测的人值得看看这套框架。
EverMind AI 开源了 Raven,每个模型配一套会自我进化的 harness,用 DeepSeek-V4-Flash 在 BrowseComp 上跑出 69.3%,研究者可以看看这套思路。
把 LLM 当遗传算法的调参师用,8 个控制案例全部跑通,成本才 $0.002 一次,做控制或自动化的朋友可以看看这套架构。
越南 PDPD 合规催生的实用论文:本地跑 Qwen3.5-27B 配混合 RAG,效果追平云端 DeepSeek-V4-Flash,还公开了越南语 RoPA 基准。
把 token 当粒子建模,还拿 Kimi-K3 和 DeepSeek-V4-Flash 实测验证,讲清稀疏注意力为啥省算力还不丢效果。
想了解游戏开发中 AI 生成软件的性能?这个新基准测试集 GameASG-Bench 很有用,它有 47 个具体任务和详细的实验数据,能帮你判断不同模型的效果。
朋友发了这个新基准数据集,专门用来测试模型在生物物理领域的科学推理能力,比之前的基准更复杂,能看出不同模型在这个专业领域的真实水平。
DeepSeek 的工程师们优化了他们的 V4-Flash 模型,让它跑在 AMD 的 GPU 上更快了,解码速度提升明显。
想了解阿里巴巴如何以更低成本打造强大模型?Qwen3.8-Flash-Next值得一试,它比DeepSeek-V4-Flash和Claude Opus 4.6更高效,成本更低。
研究ISAC框架,了解如何利用问题信息提升LLM生成提交信息的效果,与现有方法相比有显著提升。
PMCoder把规划和记忆绑在一起,SWE-bench Verified上多解25个issue,换Claude或DeepSeek也有效,思路挺巧。
Ollama 云把 DeepSeek-V4-Flash 设为默认了,现在跑 200+ tps 还零数据保留,Pro 套餐能开多个长会话,写代码的可以试试。
DeepSeek这个Flash新模型参数够劲,304B总参只激活13B,还有1M上下文,配GB300机柜看挺直观。
Unsloth搞了个DSpark,能让DeepSeek-V4-Flash在本地跑快一两倍,每秒120 tokens,精度不变,自己部署更爽了。
DeepSeek 发公告说 API 近期要涨价,幅度不小。现在 V4-Flash 输出 2 元/百万 Token,V4-Pro 输出 6 元/百万 Token,有需要的可以提前安排。
DeepSeek新模型V4-Flash跑Agent任务每单只要0.024美元,比GPT-5.6 Luna还便宜,性价比很能打。
DeepSeek 新模型在 Agent Arena 排开源第三,API 上线且支持 Codex,做智能体可以试试。
DeepSeek-V4-Flash比GPT-5.6 Luna便宜六成,一周调用7.22万亿Token登顶,逼得硅谷连夜降价,你要不要看看?
OpenRouter周榜出炉,DeepSeek-V4-Flash一周干了7.22万亿Token,前五全是国产模型,连美国厂商都被压了14周。
想用 DeepSeek-V4-Flash 的话,超算互联网已经上线了,不用自己配环境,一键就能调 API,试试它的智能体能力。
马斯克刚关注了 DeepSeek,同一天 V4-Flash 正式版 API 公测,性价比拉满,X 上已经 2.5 万赞,值得围观。