10:24官方一手arXiv: DeepSeek@Zongen Ren, Wei Shi, Bo Xiong, Chong Wang, Peng Liang提出ISAC框架,结合代码差异和问题信息生成提交信息,ApacheCM-Issue数据集支持评估,GPT-5.5和DeepSeek-V4-Flash模型测试,问题信息提升模型性能,结构化问题摘要改善感知完整性,但可能牺牲上下文细节。论文LLMCommit Message GenerationISAC4 个信源在谈事件专题推荐理由:研究ISAC框架,了解如何利用问题信息提升LLM生成提交信息的效果,与现有方法相比有显著提升。原文稍后读已读值得跟进有用关注 LLM
11:43官方一手arXiv: DeepSeek@Zixuan Li精选论文提出Bounded-State Restoration(BSR)方法,分离完整发现与本地驻留。在DeepSeek-V4-Flash模型测试中,外部状态达31.277 GiB/rank时,L1 RWS仅保持500.75 MiB/rank,实现63.959倍的外部到实时暂存比例。BSR通过最多W个块的窗口安装确认状态,在辅助状态有界的情况下,恢复容量为O(W)。SSD优化将512K恢复TTFT从43.1降至17.6秒,不改变RWS大小。论文DeepSeek-V4-FlashBSRKV-cache2 个信源在谈事件专题推荐理由:DeepSeek团队提出BSR方法,让LLM在极小内存下恢复超大状态,比传统方法高效63倍。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
19:17IT之家(博客/媒体)DeepSeek 公布调价方案,新价格于8月17日生效。DeepSeek-V4-Flash 缓存命中输入价降至每百万 tokens 0.02 元,V4-Pro 为0.025元。缓存未命中输入价分别为每百万 tokens 1元和3元,输出价分别为2元和6元。两个模型均支持1M上下文长度和最大384K输出,新版版本号分别为 DeepSeek-V4-Flash-0731 和 DeepSeek-V4-Pro-0813。AI产品DeepSeekDeepSeek-V4-FlashDeepSeek-V4-Pro10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash和V4-Pro的API价格调低了,缓存命中每百万tokens只要几分钱,做批量调用很划算。原文稍后读已读值得跟进有用关注 DeepSeek
18:33Geek@geekbbGLM 5.2 在18小时内先降价至与 DeepSeek-V4-Flash 同级,随后价格又回升。有评论认为这是国产厂商选择与 DeepSeek/OpenAI 打价格战的信号。评论还列出国产厂商的三条路径:发布旗舰模型、打价格战或陷入被动。AI产品GLM 5.2DeepSeek-V4-Flash价格战10 个信源在谈事件专题推荐理由:GLM 5.2 先降价到 DeepSeek-V4-Flash 水平又涨回,关注国产模型价格战的可以看这条。原文稍后读已读值得跟进有用关注 GLM 5.2
16:27官方一手pandaily@contact@pandaily.com (Pandaily)OpenRouter数据显示,中国大模型周Token使用量首次突破34.25万亿,前四名均为中国模型。DeepSeek-V4-Flash正式上线后以环比增长570%的成绩跃居榜单第一。中国模型已连续15周保持全球Token使用量领先。AI模型DeepSeek-V4-FlashDeepSeekOpenRouter6 个信源在谈事件专题推荐理由:中国模型又赢了,DeepSeek-V4-Flash刚发布就冲到全球第一,周涨570%,去看看吧。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
11:23官方一手arXiv: DeepSeek@Jiahao Zhang, Yifan Zhang, Yu HuangPMCoder是一种用于软件问题修复的LLM智能体,核心是将层次化阶段规划器与情景记忆双向耦合。在SWE-bench Verified基准上,它比匹配基线的设置平均多解决25个案例(+5.0个百分点)。在Verified-500上,Claude Haiku 4.5、DeepSeek-V4-Flash和OpenHands移植版均至少多解决14个案例(+2.8个百分点)。消融实验显示,规划与记忆联合使用优于单独使用任一组件,并显著减少重复失败动作和上下文耗尽。论文PMCoderSWE-bench VerifiedClaude Haiku 4.58 个信源在谈事件专题推荐理由:PMCoder把规划和记忆绑在一起,SWE-bench Verified上多解25个issue,换Claude或DeepSeek也有效,思路挺巧。原文稍后读已读值得跟进有用关注 PMCoder
10:59Geek@geekbb据 dax 统计,OpenCode Go 用户过去一周在 DeepSeek-V4-Flash 上日均花费 1.14 美元。而运行双 DGX 的自部署方案硬件成本为 1 万美元。按当前用量计,回本需 24 年;即使用量翻 10 倍,也要 2.4 年。作者 geekbb 因此直言,在绝对价格优势面前,隐私问题已无所谓。AI模型DeepSeek-V4-FlashOpenCode Go模型成本7 个信源在谈事件专题推荐理由:日均1.14美元就够用,自部署却要花1万美元、24年才回本,谁还折腾硬件?原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
14:53ollama@ollama精选Ollama 宣布 DeepSeek-V4-Flash-0731 已全量上线其云平台,并成为 deepseek-v4-flash 的新默认模型。该模型在 Ollama 云上提供 200+ tps 输出速度,官方标注的持续输出速度为 120+ tps。托管采用零数据保留(ZDR)策略,服务区域覆盖美国和欧洲。Ollama 的 Pro 和 Max 套餐支持长时间多会话运行,适合搭配常用编码工具使用。AI模型DeepSeek-V4-FlashOllamaDeepSeek8 个信源在谈事件专题推荐理由:Ollama 云把 DeepSeek-V4-Flash 设为默认了,现在跑 200+ tps 还零数据保留,Pro 套餐能开多个长会话,写代码的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
22:56Geek@geekbbDeepSeek-V4-Flash-0731参数总规模304B,其中基础模型284B,激活参数仅13B,上下文长度达1M。官方权重采用FP8+FP4混合精度,并包含DSpark speculative decoding模块。配套展示的GB300 NVL72机柜搭载72颗Blackwell Ultra GPU与36颗Grace CPU,总显存约20.7TB,NVLink带宽约130TB/s。AI模型DeepSeekDeepSeek-V4-FlashGB3008 个信源在谈事件专题推荐理由:DeepSeek这个Flash新模型参数够劲,304B总参只激活13B,还有1M上下文,配GB300机柜看挺直观。原文稍后读已读值得跟进有用关注 DeepSeek
01:20Geek@geekbb精选71°Unsloth AI推出DSpark加速方案,让DeepSeek-V4-Flash-0731的GGUF模型在本地生成速度提升约1.4至2倍。根据Unsloth官方实测,该模型在本地可达到每秒120 tokens,精度没有变化。相关GGUF文件已发布在Hugging Face上,完整指南见Unsloth官方文档。AI模型DeepSeek-V4-FlashUnslothDSpark9 个信源在谈事件专题推荐理由:Unsloth搞了个DSpark,能让DeepSeek-V4-Flash在本地跑快一两倍,每秒120 tokens,精度不变,自己部署更爽了。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
09:55IT之家(博客/媒体)DeepSeek 于 8 月 6 日公告,计划近期整体上调 API 服务定价,预计涨幅较大。当前 DeepSeek-V4-Flash 输入缓存未命中价为 1 元/百万 Token,输出价为 2 元/百万 Token。DeepSeek-V4-Pro 输入缓存未命中价为 3 元/百万 Token,输出价为 6 元/百万 Token。两模型缓存命中时的输入价分别为 0.02 和 0.025 元/百万 Token,官方称具体方案以正式通知为准。AI产品DeepSeekDeepSeek-V4-FlashDeepSeek-V4-Pro10 个信源在谈事件专题推荐理由:DeepSeek 发公告说 API 近期要涨价,幅度不小。现在 V4-Flash 输出 2 元/百万 Token,V4-Pro 输出 6 元/百万 Token,有需要的可以提前安排。原文稍后读已读值得跟进有用关注 DeepSeek
10:06官方一手arXiv: DeepSeek@Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang KangApproximate Speculative Decoding(ASD)是一种免训练的投机解码验证器,用预算化的最长前缀选择替代逐位截断,在保留目标贪心后缀的同时接受部分不匹配token。在Qwen3-14B+DSpark-14B的七项任务上,ASD相比严格验证平均提升7.78%吞吐,区间为3.05%到15.26%。在FP4到FP8兼容设置下,DeepSeek-V4-Flash(284B)搭配DSpark时,GSM8K和MATH-500上的验证方接受率提高约10%到16%。该方法无需新草稿模型或微调,预算为零时精确退化为标准贪心验证,代码已开源。论文ASD投机解码Qwen3-14B7 个信源在谈事件专题推荐理由:这篇论文搞了个叫ASD的投机解码改进,不用重新训练就能提速,实测吞吐最高涨15%,代码也开源了,跑推理的可以看看。原文稍后读已读值得跟进有用关注 ASD
09:38lmarena.ai@lmarena_ai精选DeepSeek-V4-Flash-20260731 (High)在Agent Arena中排名第21,净改进+1.98%,在开源模型中位列第3,基于12.5K次真实智能体会话。该模型每次任务的中位成本为0.024美元,低于GPT-5.6 Luna (xHigh)的0.026美元,但高于DeepSeek-V4-Pro (Thinking)的0.020美元。在各项信号中,Confirmed Success得分+6.99%,而Steerability为-2.31%。其排名比DeepSeek-V4-Pro高6位,比之前的DeepSeek-V4-Flash高13位。AI模型DeepSeek-V4-FlashAgent ArenaGPT-5.6 Luna9 个信源在谈事件专题推荐理由:DeepSeek新模型V4-Flash跑Agent任务每单只要0.024美元,比GPT-5.6 Luna还便宜,性价比很能打。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
23:40lmarena.ai@lmarena_ai精选LMArena 公布 DeepSeek-V4-Flash-20260731(High) 的五项关键信号。总体得分上升 1.98%,确认成功项提升 6.99%,好评对差评比增加 1.54%。可引导性下降 2.31%,Bash 恢复得分 2.53%,工具幻觉率 1.2%。数据来自竞技场真实用户反馈。AI模型DeepSeekDeepSeek-V4-FlashLMArena7 个信源在谈事件专题推荐理由:想知道 DeepSeek 最新版行不行?看这五个真实用户信号,总体涨近2%,确认成功涨7%,但可引导性跌了。原文稍后读已读值得跟进有用关注 DeepSeek
23:39lmarena.ai@lmarena_ai精选DeepSeek 发布 DeepSeek-V4-Flash-20260731(High)版本,在 Agent Arena 综合排名第 21,净提升 +1.98%,开源模型中位列第 3。该成绩基于 12.5K 次真实智能体会话评估,比 DeepSeek-V4-Pro 高 6 位(-0.47%),比上一代 V4-Flash 高 13 位(-2.81%)。分项信号中 Confirmed Success 达到 +6.99%,而 Steerability 为 -2.31%。官方 API 同步开放公开测试,原生支持 Responses API 格式,并已适配 Codex。AI模型DeepSeek-V4-FlashAgent Arena智能体9 个信源在谈事件专题推荐理由:DeepSeek 新模型在 Agent Arena 排开源第三,API 上线且支持 Codex,做智能体可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
19:50IT之家(博客/媒体)DeepSeek于7月31日发布V4-Flash正式版API,跑分显示其单任务成本比GPT-5.6 Luna低约60%。OpenRouter周度统计中,V4-Flash以7.22万亿Token调用量位居全球第一。荣耀CMO关海涛称这是“法拉利的性能,电动小摩托的价格”。该模型引发的“行业生死线”讨论,已倒逼OpenAI等巨头大幅降价并提升入门级模型能力,Kimi K3等国产模型同样加剧了竞争。AI模型DeepSeek-V4-FlashGPT-5.6 LunaOpenRouter10 个信源在谈事件专题推荐理由:DeepSeek-V4-Flash比GPT-5.6 Luna便宜六成,一周调用7.22万亿Token登顶,逼得硅谷连夜降价,你要不要看看?原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
08:56IT之家(博客/媒体)OpenRouter最新周报显示,7月27日至8月2日DeepSeek-V4-Flash以7.22万亿Token调用量位居全球第一。该平台聚合超400款模型,拥有约800万注册用户,每月处理约100万亿Token。OpenCode平台单日处理DeepSeek-V4-Flash达8万亿Token,其中5万亿来自免费试用,3万亿为开发者付费。榜单前五全部是中国AI模型,已连续14周压制美国厂商。行业DeepSeek-V4-FlashOpenRouterOpenCode7 个信源在谈事件专题推荐理由:OpenRouter周榜出炉,DeepSeek-V4-Flash一周干了7.22万亿Token,前五全是国产模型,连美国厂商都被压了14周。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
15:44IT之家(博客/媒体)7月31日,DeepSeek 发布 DeepSeek-V4-Flash 正式版(DeepSeek-V4-Flash-0731)API,并开启公测。国家超算互联网同步上线该模型的 API 调用服务和模型文件。新版经过大量后训练,智能体与指令遵循能力大幅增强,官方称性能可媲美最强闭源模型。超算互联网 AI 社区已汇集 1700 余款开源大模型,并成为全国首个十万卡级超智融合算力资源池。AI模型DeepSeek-V4-FlashDeepSeek国家超算互联网10 个信源在谈事件专题推荐理由:想用 DeepSeek-V4-Flash 的话,超算互联网已经上线了,不用自己配环境,一键就能调 API,试试它的智能体能力。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
21:08IT之家(博客/媒体)埃隆·马斯克今早关注了 DeepSeek 的 X 账号,Big Tech Alert 账号发布了这一动态。DeepSeek 昨日通过 API 文档宣布 DeepSeek-V4-Flash 正式版上线公测,主打超高性价比,相关 X 消息已获超 2.5 万点赞和超 5000 条转发。马斯克在 7 月 23 日《经济学人》专访中称中国在机器人和 AI 领域实力雄厚,可能成为领导者,并特别提到对月之暗面 Kimi K3 模型印象深刻。他认为中国在 AI 竞赛中有决定性优势,电力供应能力是关键因素。AI模型DeepSeek-V4-FlashDeepSeekKimi K310 个信源在谈事件专题推荐理由:马斯克刚关注了 DeepSeek,同一天 V4-Flash 正式版 API 公测,性价比拉满,X 上已经 2.5 万赞,值得围观。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
09:47lmarena.ai@lmarena_ai72°DeepSeek-V4-Flash-High在Frontend Code Arena中得分1586,刷新了帕累托前沿。其API定价为每百万token 0.14/0.28美元,是同级别中性能价格比最高的模型。DeepSeek-V4-Flash官方API已进入公开测试阶段,Agent能力大幅升级,基准成绩全面超过V4-Pro-Preview。该模型原生支持Responses API格式,并已适配Codex。AI模型DeepSeek-V4-FlashFrontend Code Arena编程助手10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash的API放出来了,1586分的代码能力只要白菜价,还支持Codex,写前端的时候可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
08:32IT之家(博客/媒体)75°DeepSeek-V4-Flash 正式版 API 于 7 月 31 日上线公测。Artificial Analysis 智能指数(AII)测得 DeepSeek V4 Flash 0731 得 50 分,比 4 月版本高 10 分,比 V4 Pro 高 6 分,比 GPT-5.6 Luna 最高分低 1 分。DeepSeek 自有 API 提供约 98% 缓存命中折扣,使单任务成本比 GPT-5.6 Luna 低约 60%。Frontend Code Arena 中 DeepSeek-V4-Flash-High 得 1586 分,总排名第 7,开放类别第 3。每 MToken 价格 0.14/0.28 美元,是同类产品中性价比最高的。AI模型DeepSeekDeepSeek-V4-FlashGPT-5.6 Luna10 个信源在谈事件专题推荐理由:DeepSeek V4-Flash 正式版上线,AII 得 50 分只比 GPT-5.6 Luna 低 1 分,价格便宜 60%,前端代码跑分 1586,可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
00:35lmarena.ai@lmarena_ai81°DeepSeek-V4-Flash 已进入 Agent Arena,将在数百万个真实长程智能体任务中接受评测,任务可调用网页搜索、文件系统和终端工具。官方同步开放 V4-Flash API 公测,称其智能体能力大幅升级,基准得分已明显超过 V4-Pro-Preview。新版 API 原生支持 Responses API 格式,并已适配 Codex。该模型还将在 Frontend Code Arena、Text 和 Vision Arena 中评测,具体分数待公布。AI模型DeepSeek-V4-FlashDeepSeek智能体10 个信源在谈事件专题推荐理由:DeepSeek 把 V4-Flash 放进 Agent Arena,API 公测也开了,智能体跑分超过 V4-Pro-Preview,还适配 Codex,想试的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
00:23elvis@omarsar0DeepSeek发布V4-Flash-Preview新检查点,官方API进入公开测试阶段。该模型在TerminalBench-2.1上实现20多分跳升,Agent能力大幅增强,整体成绩远超V4-Pro-Preview。API定价为每百万token输入0.14美元、输出0.28美元。V4-Flash原生支持Responses API格式,并已适配Codex。AI模型DeepSeek-V4-FlashDeepSeek智能体10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash API公测了,输入才0.14刀每百万token,Agent跑分还涨了20多分,想折腾的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
17:41向阳乔木@vista8精选DeepSeek-V4-Flash的官方API已进入公开测试。其Agent能力基准分数远超V4-Pro-Preview。该版本原生支持Responses API格式。同时完全适配Codex,开发者可在DeepSeek官方文档查看配置详情。AI模型DeepSeekDeepSeek-V4-FlashCodex10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash的API放出来了,Agent能力比V4-Pro-Preview还猛,而且直接支持Codex,开发者快去试试。原文稍后读已读值得跟进有用关注 DeepSeek
16:47官方账号深度求索 DeepSeek@deepseek_aiDeepSeek-V4-Flash-0731与预览版保持相同的模型架构和大小。本次升级只作用于DeepSeek-V4-Flash API,DeepSeek-V4-Pro API和App/Web端模型均未变化。DeepSeek官方表示,DeepSeek-V4-Pro正式版将尽快发布。AI产品DeepSeekDeepSeek-V4-FlashDeepSeek-V4-Pro10 个信源在谈事件专题推荐理由:DeepSeek刚更新了V4-Flash API到0731版,但架构和预览版一样,V4-Pro正式版马上就出,API开发者可以先升级试试。原文稍后读已读值得跟进有用关注 DeepSeek
15:45官方一手歸藏(guizang.ai)@op741872°DeepSeek 官方发布 DeepSeek-V4-Flash 的官方 API,已进入公开测试阶段。该版本重点强化 Agent 能力,官方宣称其基准得分已远远超过 V4-Pro-Preview。V4-Flash 原生支持 Responses API 格式,并已完全适配 Codex 客户端。具体配置方式见 DeepSeek 官方 API 文档。AI模型DeepSeekDeepSeek-V4-Flash智能体10 个信源在谈事件专题推荐理由:DeepSeek 把 V4-Flash API 放出来公测了,Agent 能力比 V4-Pro-Preview 强不少,还直接支持 Codex,想玩可以去翻官方文档。原文稍后读已读值得跟进有用关注 DeepSeek
14:06IT之家(博客/媒体)DeepSeek 7 月 31 日下午通过 API 文档宣布 DeepSeek-V4-Flash 正式版 API 上线公测。版本号 DeepSeek-V4-Flash-0731 与 preview 版结构尺寸一致,仅重新进行了后训练。Agent 基准中 Terminal Bench 2.1 为 82.7,NL2Repo 为 54.2,Cybergym 为 76.7,DeepSWE 为 54.4,Toolathlon verified 为 70.3。Agent Last Exam 为 25.2,Automation Bench (Public) 为 25.1,DSBench-FullStack 为 68.7,DSBench-Hard 为 59.6,全面超过 V4-Pro-Preview。新版本原生支持 Responses API 格式并适配 Codex,V4-Pro API 和 APP/WEB 端本次未改动。AI模型DeepSeekDeepSeek-V4-FlashDeepSeek-V4-Pro10 个信源在谈事件专题推荐理由:DeepSeek 把 V4-Flash 转正了,智能体跑分全面压过 V4-Pro 预览版,做开发可直接试。原文稍后读已读值得跟进有用关注 DeepSeek
10:12官方一手arXiv: DeepSeek@Christian Rosenthal该研究提出一种规则型双生子反事实门控,用九条固定约束对LLM给出的组态设定点做许可/阻断决策,底层PID和MPC不变。在Skogestad Column A上,门控智能体C3在非标目标获取中的IAE比传统MPC低至0.361,但在扰动抑制场景中无门控LLM的IAE反而高出16.03倍,说明其不适合该工况。门控将规范背离吸引子压缩为有界偏移,P95单格IAE从11.5降至0.77;单行提示词修复可从源头消除该现象。250格统计测试中,590次门控干预中534次属于规范边界几何问题,318次阻断仍能纠正有害提议。论文DeepSeek-V4-FlashNVIDIA Nemotron-3-Super安全门控10 个信源在谈事件专题推荐理由:这篇论文给LLM控制环路加了一道硬性安全检查,用数字告诉你什么时候能信AI、什么时候必须拦下来,做控制或智能体的都该看看。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
09:49官方一手arXiv: DeepSeek@Ruslan KhrulevBlueprintRepair是一种让大模型通过十种受模式检查的局部操作修改Lean证明蓝图的修复接口。研究构造了包含142个受控失败案例的BlueprintTrace基准,并对比了类型化编辑、精确源码补丁和完整模块重写三种方式。在DeepSeek-V4-Flash下,三种接口解决的局部失败数几乎相同,但类型化修复每个已解状态成本最低,补丁费用为其1.30倍,重写为其2.06倍。在每任务10000个补全token预算内,类型化修复几乎达到最终覆盖率,而两种自由形式接口明显落后。Qwen3.6-Flash解决的案例更少,但类型化修复依然最便宜,并在证明编写类状态上领先。论文BlueprintRepairLeanDeepSeek-V4-Flash10 个信源在谈事件专题推荐理由:修Lean证明蓝图?这个接口用类型化编辑,比源码补丁省30%、比重写省一半,1万token内就顶到上限。原文稍后读已读值得跟进有用关注 BlueprintRepair
09:48官方一手arXiv: DeepSeek@Tianyang Zhu精选DeepSeek-V4-Flash的稀疏MoE推理中,数学等价的专家归约顺序会产生可观察的执行分歧。研究对比4种聚合方案:720个A模式顺序产生10个延续盆地,720个B模式顺序形成360个结构类和11个盆地。在一条中文提示词下,B类分裂为202个裁员、113个招聘和45个其他延续。192条持久轨迹中,P32、A、B方案改变所有原生参考路由,而C方案保留路由、token序列和文本。FP64精确重建可在301个下游状态上获得七步一致。论文DeepSeek-V4-Flash稀疏MoE数值精度10 个信源在谈事件专题推荐理由:这篇论文把DeepSeek-V4-Flash的MoE数值细节挖得很深,归约顺序不同结果就不同,跑推理时得留神。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
09:14官方一手arXiv: DeepSeek@Guiling Guo, Jia Yang, Jiahao Xu, Shuyuan Zheng, Zhonghai Sun, Qiyuan LiGraphRareBench是一个保留来源的基准,包含2,365个本体派生案例和18,093对目标-混淆对。在237个案例的基因组分测试集上,监督排序器MRR范围为0.640-0.740,目标-混淆准确率为0.898-0.916。基于Agents-A1和DeepSeek-V4-Flash的智能体MRR分别为0.746和0.718,但证据覆盖率差异达0.561。22.1%到43.7%的成功案例中仍存在硬混淆者排名高于目标。该基准可用于评估模型在完全集检索和硬混淆区分上的表现。论文GraphRareBenchAgents-A1DeepSeek-V4-Flash1 个信源在谈事件专题推荐理由:想测AI罕见病诊断能力?GraphRareBench用2365个案例和18093对混淆,专门检测模型能不能分清真病和假病。原文稍后读已读值得跟进有用关注 GraphRareBench
09:59官方账号arXiv cs.AI@Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Dong, Yueming Yuan, Boyuan Ma, Qizheng Zhang, Jiwei Fu, Yuzhen Mao, Wendong Fan, Ping Nie, Philip Torr, Bernard Ghanem, Changran Hu, Jonathan Lingjie Li, Urmish Thakker, Guohao LiSETA是一个可扩展框架,用于生成可验证的终端环境以支持强化学习。其构建的SETA-Env数据集包含超过4500个环境,是当前最大的开源可验证终端RL数据集。使用Qwen3-8B在SETA-Env上训练,在Terminal-Bench 2.0上达到12% pass rate,为8B规模RL训练模型的最佳结果。在DeepSeek-V4-Flash上,同一终端代理基准的pass@1从40%提升至43%,pass@5从54%提升至58%。SETA-Env为终端代理研究提供了高质量的训练环境。论文SETAQwen3-8BDeepSeek-V4-Flash推荐理由:终端代理训练数据难找,SETA开源了4500+环境的RL数据集,Qwen3-8B训后Terminal-Bench拿到12%,顺带还让DeepSeek-V4涨了分,搞终端AI的别错过。原文稍后读已读值得跟进有用关注 SETA
09:45官方一手arXiv: DeepSeek@Zheng Yu本论文在16设备华为Ascend 910系统上使用CANN和vLLM-Ascend部署了两个大模型推理负载:基于W8A8 MoE模型DeepSeek-V4-Flash的LLM-as-a-judge安全对齐评估流水线,以及基于DeepSeek-V4-Flash-Vision的多模态医学视觉基准测试(MMMU和MMMU-Pro)。为保证运行可靠性,需要12个源码级补丁,并关闭多个高吞吐特性以维持数值正确性。论文总结了8类平台限制:不完整算子支持、脆弱并行、低阶内核数值错误、图编译不成熟、不稳定高级特性、可扩展性差、可观测性弱和生态碎片化。同时量化了集成工作量、并发行为和基准质量,验证了负载的正确性。论文Huawei AscendDeepSeek-V4-FlashLLM-as-a-judge1 个信源在谈事件专题推荐理由:这篇论文实测了华为昇腾跑MoE和多模态大模型的工程代价——需要打12个补丁、关掉一堆特性才能不出错,想用非GPU加速器的团队先看看这个。原文稍后读已读值得跟进有用关注 Huawei Ascend
21:06IT之家(博客/媒体)72°腾讯云宣布 DeepSeek-V4 正式版原厂直供模型将于 2026 年 7 月中旬在 TokenHub 和智能体开发平台上线。腾讯云同步引入峰谷定价机制,高峰时段为每日 9:00-12:00 和 14:00-18:00。DeepSeek-V4-Pro 推理输出高峰定价 12 元/百万 tokens,平时 6 元;DeepSeek-V4-Flash 高峰 4 元,平时 2 元。Token Plan 企业版积分抵扣规则也随峰谷调整,缓存命中输入抵扣量在 Pro 版为 2.5 积分(平时)与 5 积分(高峰)每百万 tokens。AI产品DeepSeek-V4腾讯云TokenHub3 个信源在谈事件专题推荐理由:腾讯云上了 DeepSeek-V4 原厂版,7 月中旬就能用,价格分峰谷,白天贵一倍,晚上便宜,有 Pro 和 Flash 两个版本可选。原文稍后读已读值得跟进有用关注 DeepSeek-V4
16:26官方一手pandaily@contact@pandaily.com (Pandaily)蚂蚁集团与香港科技大学(广州)联合提出Skill-MAS框架,该框架将多智能体系统设计经验抽象为可重用的元技能。在DeepSeek-V4-Flash等模型上的实验验证了其有效性,能够通过元技能进化机制提升多智能体协作效率,并实现跨场景迁移。此外,Skill-MAS支持动态组合元技能以适应不同任务需求。论文Skill-MASAnt GroupDeepSeek-V4-Flash2 个信源在谈事件专题推荐理由:蚂蚁和港科大的新框架Skill-MAS,把多智能体经验打包成可复用的元技能,在DeepSeek-V4-Flash上验证有效,做多智能体开发可以看看。原文稍后读已读值得跟进有用关注 Skill-MAS
09:45官方一手arXiv: DeepSeek@Zirui Chen, Zhipeng Xue, Jiayuan Zhou, Xing Hu, Xin Xia, Xiaohu YangRefploit是一个基于LLM的轨迹恢复框架,用于从公开漏洞利用参考中重现漏洞利用。它通过差异化执行验证智能体生成的漏洞利用,当无效时分析重现进度、定位轨迹片段并推导约束以指导恢复。在三个开源Java漏洞数据集(172个漏洞引用,143个漏洞)上,使用DeepSeek-V4-Flash时,Refploit成功重现138个漏洞利用,重现率达80.2%。相比初始轨迹提升64.3%,超过现有方法PoCGen及基于GPT-5.4的Codex等高级代码智能体。论文Refploit漏洞利用DeepSeek-V4-Flash2 个信源在谈事件专题推荐理由:Refploit能自动修复代码智能体生成漏洞利用时出错的部分,用DeepSeek-V4-Flash在143个Java漏洞上做到80.2%成功率,比PoCGen和GPT-5.4驱动的Codex都强。搞漏洞研究的人可以关注。原文稍后读已读值得跟进有用关注 Refploit
09:30官方一手arXiv: DeepSeek@Zhaojian Yu, Penghao Yin, Shuzheng Gao, Shilin He, Kai Cai, Xiao-Ping ZhangAutoTrainess是一个基于大语言模型的智能体,通过暴露规划、数据准备、训练、评估和日志等操作作为代理-计算机接口,自动化语言模型的后训练流程。在PostTrainBench基准上,AutoTrainess搭配GPT-5.4(Codex)取得平均26.94分,超过CLI-only基线的23.21分。它还能跨模型泛化,将DeepSeek-V4-Flash(OpenCode)的得分从12.13提升至19.58。该研究提出将人工经验外部化为显式工作流和约束,引导智能体更有效且可靠地执行训练任务。论文AutoTrainessPostTrainBenchGPT-5.42 个信源在谈事件专题推荐理由:这篇论文提出一个叫AutoTrainess的智能体,能自己跑模型训练流程,不用人盯着。在PostTrainBench上比纯命令行强,还能帮DeepSeek-V4涨分。原文稍后读已读值得跟进有用关注 AutoTrainess
10:37官方一手arXiv: DeepSeek@Xuan Zhao, Haonan He, Qingyu Yang, Minglei Li, Jingqi Ye, Zelin Tan, Bo Wan, Peng Ye提出ParametricSkills框架,将自由格式的文本技能在测试时转换为LoRA参数适配器。该框架利用大规模技能库和OpenCode合成的单/多轮轨迹训练超网络。在六个软件工程子任务上,比上下文学习平均提升6.44个点(由DeepSeek-V4-Flash评判),BERT Score和F1分数也更高。参数化技能具有累积性,为测试时持续学习提供了初步方向。论文ParametricSkillsOpenCodeDeepSeek-V4-Flash2 个信源在谈事件专题推荐理由:这篇论文把技能文本直接转成模型参数,编程任务上比上下文学习高出6分多,还能不断积累,挺实用的。原文稍后读已读值得跟进有用关注 ParametricSkills
16:31官方一手Pandaily@contact@pandaily.com (Pandaily)中国AI大模型API调用量连续九周位居全球第一。DeepSeek-V4-Flash、MiMo-V2.5和MiniMax M3是调用量最高的三个模型。同期美国市场份额从72%暴跌至33%,中国模型的API调用优势正在扩大。行业DeepSeek-V4-FlashMiMo-V2.5MiniMax M36 个信源在谈事件专题推荐理由:中国AI模型API调用量九周全球第一,DeepSeek、MiMo、MiniMax这些国产模型很猛,美国份额从72%掉到33%,值得看看。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
11:07官方账号arXiv cs.AI@Alexander V. Kozachok, Alexander M. Nazimov, Shamil G. Magomedov该研究扩展了Text2DSL自动生成领域特定语言代码的工作,用DeepSeek-V4-Flash作为教师模型,在结构化上下文(BNF语法、API规范、词汇表)下生成数据,经AST验证(使用esprima)和运行时验证(polkitd与pkcheck)的流水线,将PolkitBench语料从4,204对扩充到10,073对,其中AST有效性达100.0%、运行时通过率99.7%。在GigaChat-10B-A1.8B上对八种消融条件(C0-C7)评估发现:无上下文时语法有效从97.6%降至58.5%而完整上下文仅从98.6%降至97.4%,完整上下文C7在所有指标上最优,词汇表对语义质量贡献最大(组合得分+0.198),API和BNF分别对结构有效性贡献+24.7和+22.3个百分点。论文Text2DSLDeepSeek-V4-FlashGigaChat-10B-A1.8B推荐理由:这篇论文用DeepSeek-V4-Flash生成了上万条验证过的Polkit规则,并通过消融实验证明结构化上下文不是锦上添花,词汇表才是提升语义质量的关键。原文稍后读已读值得跟进有用关注 Text2DSL