8月1日
11:35
11:35小互@imxiaohu
78°
DeepSeek-V4-Flash正式版发布,官方声称可原生接入OpenAI Codex。该模型在九项Agent测试中全部反超自家更大的V4-Pro预览版。它登顶开源模型前三,输出价格比Opus 4.8便宜89倍。DeepSeek还为Codex做了官方适配,提供一条命令接入方案。
事件专题

推荐理由:DeepSeek新出的V4-Flash能直接配Codex,一条命令搞定,跑分还反超自家V4-Pro,价格比Opus 4.8便宜89倍。
10:13
10:13Fireworks AI@FireworksAI_HQ
72°
DeepSeek-V4-Flash-0731已在Fireworks平台上线,支持日零部署。DeepSeek报告该模型在全部9项智能体评测中超越V4 Pro,其中Terminal Bench得分82.7%。其性价比优于V4 Pro,定价为每百万tokens 0.28美元,上下文窗口达100万tokens。

推荐理由:Fireworks当天上线了DeepSeek最新模型,智能体评测全面超过V4 Pro,价格还更便宜,适合跑高并发任务。
01:08
01:08官方账号Decoder@Thomas Joos
DeepSeek V4 Flash 的 0731 更新版本在 Artificial Analysis Intelligence Index 上得分 50,较前版提升 10 分。该分数仅比 OpenAI GPT-5.6 Luna 低 1 分,但每任务成本约低 60%。这一成绩让 DeepSeek 的平价模型在性能逼近旗舰的同时,展现出明显的成本优势。
事件专题

推荐理由:DeepSeek 把 V4 Flash 升到 0731 版,性能只比 GPT-5.6 Luna 低 1 分,成本却省六成,平价模型也能打了。
7月31日
23:04
23:04官方一手歸藏(guizang.ai)@op7418
精选
DeepSeek 宣布 V4 Flash 0731 模型已开源。模型权重托管在 Hugging Face 的 deepseek-ai 组织下。该版本属于 Flash 系列,版本号为 0731。开发者可以下载权重进行本地部署或二次开发。
推荐理由:DeepSeek 把 V4 Flash 0731 的开源权重放出来了,想本地跑模型的话直接去 Hugging Face 下载就行。
22:14
20:19
20:19AI Will@FinanceYF5
DeepSeek-V4-Flash官方API已进入公开测试阶段。输入每百万Token仅0.28美元,输出价格为0.87美元。其Agent能力大幅升级,基准成绩全面超过V4-Pro-Preview。新版本原生支持Responses API格式,并完全适配Codex。
事件专题

推荐理由:DeepSeek的V4-Flash刚上线,API便宜到离谱,输入才0.28美元,性能还压过V4-Pro-Preview,搭Agent直接用它。
20:08
20:08AI Will@FinanceYF5
精选79°
DeepSeek V4 Flash 官方API现已开启公测,重点升级Agent能力。Terminal Bench 2.1得分82.7,DeepSWE得分54.4,多项成绩大幅超过V4 Pro Preview。该模型还接近Opus 4.8的表现,并原生支持Responses API格式,现已适配Codex。

推荐理由:DeepSeek V4 Flash 公测了,Agent 跑分比 V4 Pro 高不少,还原生支持 Responses API,玩 Codex 的可以直接试。
17:41
17:41向阳乔木@vista8
精选
DeepSeek-V4-Flash的官方API已进入公开测试。其Agent能力基准分数远超V4-Pro-Preview。该版本原生支持Responses API格式。同时完全适配Codex,开发者可在DeepSeek官方文档查看配置详情。
事件专题

推荐理由:DeepSeek把V4-Flash的API放出来了,Agent能力比V4-Pro-Preview还猛,而且直接支持Codex,开发者快去试试。
16:47
16:47官方账号深度求索 DeepSeek@deepseek_ai
DeepSeek-V4-Flash-0731与预览版保持相同的模型架构和大小。本次升级只作用于DeepSeek-V4-Flash API,DeepSeek-V4-Pro API和App/Web端模型均未变化。DeepSeek官方表示,DeepSeek-V4-Pro正式版将尽快发布。
事件专题

推荐理由:DeepSeek刚更新了V4-Flash API到0731版,但架构和预览版一样,V4-Pro正式版马上就出,API开发者可以先升级试试。
15:45
15:45官方一手歸藏(guizang.ai)@op7418
72°
DeepSeek 官方发布 DeepSeek-V4-Flash 的官方 API,已进入公开测试阶段。该版本重点强化 Agent 能力,官方宣称其基准得分已远远超过 V4-Pro-Preview。V4-Flash 原生支持 Responses API 格式,并已完全适配 Codex 客户端。具体配置方式见 DeepSeek 官方 API 文档。
事件专题

推荐理由:DeepSeek 把 V4-Flash API 放出来公测了,Agent 能力比 V4-Pro-Preview 强不少,还直接支持 Codex,想玩可以去翻官方文档。
15:40
15:40官方账号深度求索 DeepSeek@deepseek_ai
DeepSeek-V4-Flash 官方 API 现已进入公开测试版,Agent 能力获得升级。官方基准成绩显示其已远超 V4-Pro-Preview。该 API 原生支持 Responses API 格式,并已完全适配 Codex。具体配置方法见官方文档 api-docs.deepseek.com/quick_start/ag...
事件专题

推荐理由:DeepSeek把V4-Flash的API开放公测了,Agent能力比V4-Pro-Preview强不少,还直接适配Codex,想试新模型可以去看看。
15:23
7月30日
7月29日
12:27
12:27官方一手歸藏(guizang.ai)@op7418
精选
Codepilot 推出了 Subagent 功能,允许用户在一个聊天中启用多个由不同模型驱动的子智能体。例如可用 Grok 检索 Twitter 信息、DeepSeek 生成文案、K3 生成网页、GLM 5.2 统筹。该设计旨在发挥各模型长处,同时减少昂贵模型的消耗,降低使用成本。

推荐理由:Codepilot 这个 Subagent 功能真香,一个聊天里混用 Grok、DeepSeek、GLM 5.2 等模型,各取所长还省钱,试试看。
12:26
12:26官方一手歸藏(guizang.ai)@op7418
作者使用 Codepilot 的一条提示词,让 Grok 爬取 Twitter 信息、Kimi 生成网页、DeepSeek 撰写文案,并由 GLM 5.2 统筹。该 workflow 成功完成昨天 AI 热点事件统计,时效性与人工搜集相当,甚至补充了漏掉的信息。通过分模型调用,降低了昂贵模型的消耗。

推荐理由:想用最少的成本让不同模型干各自擅长的事?参考这个 workflow:Grok 爬推文、DeepSeek 写文案、Kimi 做网页、GLM 5.2 调度。
12:25
12:25官方一手歸藏(guizang.ai)@op7418
用户通过一句提示词,调用 Grok 进行 Twitter 热点事件信息爬取,Kimi 生成网页,DeepSeek 撰写文案。三个模型分工协作,完成了昨日 AI 热点事件的统计,结果与手动搜集高度一致,并补充了遗漏信息。展示了多模型组合工作流的实际效果。
推荐理由:用一句提示词让 Grok、Kimi、DeepSeek 各司其职,自动统计 Twitter 热点,省时又全面,适合想提升信息搜集效率的人。
11:23
11:23官方一手arXiv: DeepSeek@Jia Liu, Veena Krishnaraj, Kateryna Vovk, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Anamaria Hell, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou
该研究测试了大型语言模型(LLMs)在科研项目规划和提案评估中的表现。人类研究者与ChatGPT、Claude、DeepSeek(2025年中模型)分别生成了8个专家构思的研究项目的一页计划,共计32份提案。4位人类评审员和2个前沿LLM(Claude Opus 4.8、ChatGPT Pro 5.5)采用四维度评估标准盲审。人类评审员对AI和人类提案的整体评分相似,而AI评审员对AI提案的评分平均高出约1分(5分制)。人类评审员正确识别人类和AI提案的比例分别为72%和79%,而两个AI评审员均100%正确分类。研究表明当前LLM能生成与人类提案相当的计划,但AI评审员存在系统性偏好。
推荐理由:这篇论文测试了ChatGPT、Claude、DeepSeek写科研计划的能力,发现人类评委分不出好坏,但AI评委偏爱AI写的。值得一读。
7月28日
16:16
16:16官方一手Pandaily@contact@pandaily.com (Pandaily)
82°
Moonshot AI发布47页Kimi K3技术报告,核心架构包括KDA+Gated MLA混合注意力机制。AttnRes跨层检索层降低推理成本。Stable LatentMoE包含896个专家,支持动态路由。采用51.2M规模的RL沙箱进行强化学习训练,提升模型对齐能力。报告还引入模型参数与推理时间两个缩放轴,重新定义性能前沿。
事件专题

推荐理由:Moonshot AI 发了Kimi K3的47页技术报告,混合注意力、896专家MoE和5100万RL沙箱的架构特别硬核,值得看它怎么跟DeepSeek对标。
12:03
12:03官方一手arXiv: DeepSeek@Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic
76°
该研究对GPT-5、Claude、Grok、Gemini、DeepSeek、Kimi、Qwen共7个主流模型进行了基于政治轴的可控性压力测试,使用12种意识形态角色提示和70个政治指南针项目,共收集63,700条回答。结果发现,上下文框架解释了经济和社会轴上约88%-93%的方差,而模型自身身份的影响不到3%。在威权提示下,不同模型在相同问题上表现出相似偏移。研究强调需要进行可操控性审计,报告分散性、对称性、饱和度和拒绝底线。数据集和代码已开源。
推荐理由:这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
7月27日
10:57
10:57官方一手arXiv: DeepSeek@Deyu Yang, Rundong Wei, Xiaoqi Li
该论文提出一种结合漏洞聚焦代码切片、ERC-721 知识库和约束 DeepSeek 的 NFT 智能合约漏洞检测方法。在 450 个 NFT 合约样本上,完整配置的检测器给出了 437 个正标签,正标签率达到 97.1%。去除外部知识库后,正标签率降至 87.11%;进一步去除代码切片,正标签率降至 73.78%。结果表明,聚焦代码上下文和领域约束显著影响检测效果。
推荐理由:研究了一套专门针对 NFT 合约的漏洞检测方法,用 DeepSeek 加代码切片把准确率干到了 97.1%,比纯分析完整合约高了 23 个百分点。做合约安全的可以看看。