8月25日
10:24
10:24官方一手arXiv: DeepSeek@Zongen Ren, Wei Shi, Bo Xiong, Chong Wang, Peng Liang
提出ISAC框架,结合代码差异和问题信息生成提交信息,ApacheCM-Issue数据集支持评估,GPT-5.5和DeepSeek-V4-Flash模型测试,问题信息提升模型性能,结构化问题摘要改善感知完整性,但可能牺牲上下文细节。
事件专题

推荐理由:研究ISAC框架,了解如何利用问题信息提升LLM生成提交信息的效果,与现有方法相比有显著提升。
8月10日
16:27
16:27官方一手pandaily@contact@pandaily.com (Pandaily)
OpenRouter数据显示,中国大模型周Token使用量首次突破34.25万亿,前四名均为中国模型。DeepSeek-V4-Flash正式上线后以环比增长570%的成绩跃居榜单第一。中国模型已连续15周保持全球Token使用量领先。
事件专题

推荐理由:中国模型又赢了,DeepSeek-V4-Flash刚发布就冲到全球第一,周涨570%,去看看吧。
8月5日
8月4日
23:40
23:40lmarena.ai@lmarena_ai
精选
LMArena 公布 DeepSeek-V4-Flash-20260731(High) 的五项关键信号。总体得分上升 1.98%,确认成功项提升 6.99%,好评对差评比增加 1.54%。可引导性下降 2.31%,Bash 恢复得分 2.53%,工具幻觉率 1.2%。数据来自竞技场真实用户反馈。
事件专题

推荐理由:想知道 DeepSeek 最新版行不行?看这五个真实用户信号,总体涨近2%,确认成功涨7%,但可引导性跌了。
8月1日
7月31日
17:41
17:41向阳乔木@vista8
精选
DeepSeek-V4-Flash的官方API已进入公开测试。其Agent能力基准分数远超V4-Pro-Preview。该版本原生支持Responses API格式。同时完全适配Codex,开发者可在DeepSeek官方文档查看配置详情。
事件专题

推荐理由:DeepSeek把V4-Flash的API放出来了,Agent能力比V4-Pro-Preview还猛,而且直接支持Codex,开发者快去试试。
16:47
16:47官方账号深度求索 DeepSeek@deepseek_ai
DeepSeek-V4-Flash-0731与预览版保持相同的模型架构和大小。本次升级只作用于DeepSeek-V4-Flash API,DeepSeek-V4-Pro API和App/Web端模型均未变化。DeepSeek官方表示,DeepSeek-V4-Pro正式版将尽快发布。
事件专题

推荐理由:DeepSeek刚更新了V4-Flash API到0731版,但架构和预览版一样,V4-Pro正式版马上就出,API开发者可以先升级试试。
15:45
15:45官方一手歸藏(guizang.ai)@op7418
72°
DeepSeek 官方发布 DeepSeek-V4-Flash 的官方 API,已进入公开测试阶段。该版本重点强化 Agent 能力,官方宣称其基准得分已远远超过 V4-Pro-Preview。V4-Flash 原生支持 Responses API 格式,并已完全适配 Codex 客户端。具体配置方式见 DeepSeek 官方 API 文档。
事件专题

推荐理由:DeepSeek 把 V4-Flash API 放出来公测了,Agent 能力比 V4-Pro-Preview 强不少,还直接支持 Codex,想玩可以去翻官方文档。
7月14日
09:59
09:59官方账号arXiv cs.AI@Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Dong, Yueming Yuan, Boyuan Ma, Qizheng Zhang, Jiwei Fu, Yuzhen Mao, Wendong Fan, Ping Nie, Philip Torr, Bernard Ghanem, Changran Hu, Jonathan Lingjie Li, Urmish Thakker, Guohao Li
SETA是一个可扩展框架,用于生成可验证的终端环境以支持强化学习。其构建的SETA-Env数据集包含超过4500个环境,是当前最大的开源可验证终端RL数据集。使用Qwen3-8B在SETA-Env上训练,在Terminal-Bench 2.0上达到12% pass rate,为8B规模RL训练模型的最佳结果。在DeepSeek-V4-Flash上,同一终端代理基准的pass@1从40%提升至43%,pass@5从54%提升至58%。SETA-Env为终端代理研究提供了高质量的训练环境。
推荐理由:终端代理训练数据难找,SETA开源了4500+环境的RL数据集,Qwen3-8B训后Terminal-Bench拿到12%,顺带还让DeepSeek-V4涨了分,搞终端AI的别错过。
7月3日
16:26
16:26官方一手pandaily@contact@pandaily.com (Pandaily)
蚂蚁集团与香港科技大学(广州)联合提出Skill-MAS框架,该框架将多智能体系统设计经验抽象为可重用的元技能。在DeepSeek-V4-Flash等模型上的实验验证了其有效性,能够通过元技能进化机制提升多智能体协作效率,并实现跨场景迁移。此外,Skill-MAS支持动态组合元技能以适应不同任务需求。
事件专题

推荐理由:蚂蚁和港科大的新框架Skill-MAS,把多智能体经验打包成可复用的元技能,在DeepSeek-V4-Flash上验证有效,做多智能体开发可以看看。
09:45
09:45官方一手arXiv: DeepSeek@Zirui Chen, Zhipeng Xue, Jiayuan Zhou, Xing Hu, Xin Xia, Xiaohu Yang
Refploit是一个基于LLM的轨迹恢复框架,用于从公开漏洞利用参考中重现漏洞利用。它通过差异化执行验证智能体生成的漏洞利用,当无效时分析重现进度、定位轨迹片段并推导约束以指导恢复。在三个开源Java漏洞数据集(172个漏洞引用,143个漏洞)上,使用DeepSeek-V4-Flash时,Refploit成功重现138个漏洞利用,重现率达80.2%。相比初始轨迹提升64.3%,超过现有方法PoCGen及基于GPT-5.4的Codex等高级代码智能体。
事件专题

推荐理由:Refploit能自动修复代码智能体生成漏洞利用时出错的部分,用DeepSeek-V4-Flash在143个Java漏洞上做到80.2%成功率,比PoCGen和GPT-5.4驱动的Codex都强。搞漏洞研究的人可以关注。
6月30日
10:37
10:37官方一手arXiv: DeepSeek@Xuan Zhao, Haonan He, Qingyu Yang, Minglei Li, Jingqi Ye, Zelin Tan, Bo Wan, Peng Ye
提出ParametricSkills框架,将自由格式的文本技能在测试时转换为LoRA参数适配器。该框架利用大规模技能库和OpenCode合成的单/多轮轨迹训练超网络。在六个软件工程子任务上,比上下文学习平均提升6.44个点(由DeepSeek-V4-Flash评判),BERT Score和F1分数也更高。参数化技能具有累积性,为测试时持续学习提供了初步方向。
事件专题

推荐理由:这篇论文把技能文本直接转成模型参数,编程任务上比上下文学习高出6分多,还能不断积累,挺实用的。
6月29日
16:31
16:31官方一手Pandaily@contact@pandaily.com (Pandaily)
中国AI大模型API调用量连续九周位居全球第一。DeepSeek-V4-Flash、MiMo-V2.5和MiniMax M3是调用量最高的三个模型。同期美国市场份额从72%暴跌至33%,中国模型的API调用优势正在扩大。
事件专题

推荐理由:中国AI模型API调用量九周全球第一,DeepSeek、MiMo、MiniMax这些国产模型很猛,美国份额从72%掉到33%,值得看看。