14:36idoubi@idoubiccDSCode 是基于 Pi Agent Toolkit 的 Coding Agent,采用 MIT 协议完整开源。它针对 DeepSeek V4 Flash 和 1M Context 作了深度优化,利用前缀缓存提高长会话命中率。内置 Plan、会话恢复、Checkpoint/Undo 和后台任务,支持多 Agent 并行及 Git Worktree 隔离。兼容 Skills、Hooks、MCP,并可切换 GPT、Claude 等模型;API Key 默认本地保存,命令在 OS Sandbox 中运行。AI产品DSCodeDeepSeek编程助手推荐理由:DSCode 开源了,专为 DeepSeek 优化,省 token、支持多 Agent 和 MCP,也能接 Claude,MIT 随便改。原文稍后读已读值得跟进有用关注 DSCode
11:35小互@imxiaohu78°DeepSeek-V4-Flash正式版发布,官方声称可原生接入OpenAI Codex。该模型在九项Agent测试中全部反超自家更大的V4-Pro预览版。它登顶开源模型前三,输出价格比Opus 4.8便宜89倍。DeepSeek还为Codex做了官方适配,提供一条命令接入方案。AI模型DeepSeekV4-FlashCodex10 个信源在谈事件专题推荐理由:DeepSeek新出的V4-Flash能直接配Codex,一条命令搞定,跑分还反超自家V4-Pro,价格比Opus 4.8便宜89倍。原文稍后读已读值得跟进有用关注 DeepSeek
10:13Fireworks AI@FireworksAI_HQ72°DeepSeek-V4-Flash-0731已在Fireworks平台上线,支持日零部署。DeepSeek报告该模型在全部9项智能体评测中超越V4 Pro,其中Terminal Bench得分82.7%。其性价比优于V4 Pro,定价为每百万tokens 0.28美元,上下文窗口达100万tokens。AI模型DeepSeekV4-Flash-0731Fireworks推荐理由:Fireworks当天上线了DeepSeek最新模型,智能体评测全面超过V4 Pro,价格还更便宜,适合跑高并发任务。原文稍后读已读值得跟进有用关注 DeepSeek
09:48lmarena.ai@lmarena_ai精选DeepSeek-V4-Flash-High在Frontend Code Arena中取得1586分,总排名第7。它在开源模型中位列第3,消费者产品类目排名第4。参考设计、数据与分析、游戏类目均排第6,品牌与营销类目排第7。相比DeepSeek-V4-Flash-High-Preview提升154分,相比DeepSeek-V4-Pro-Preview提升121分。该模型定价为每百万token输入0.14美元、输出0.28美元,是同级别中性能价格比最高的。AI模型DeepSeek-V4-Flash-HighFrontend Code ArenaDeepSeek推荐理由:DeepSeek-V4-Flash-High跑前端代码榜第7、开源第3,价格0.14美元/百万token,同级别性价比最高。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-High
09:40SuperTechFans(博客/媒体)UEFA 及其 55 个成员协会联合声明,拒绝 FIFA 将世界杯转售给私人投资者的提案,否则将不参加 FIFA 赛事。电梯调度科普文登上 HN 热榜,对比 LOOK 与 RSR 算法,并提供交互模拟器,获得 802 点热度。DeepSeek 发布 V4-Flash 模型,13B 激活参数下输入成本为 0.14 美元/百万 token,支持 Responses API。OpenAI 推出 GPT-5.6 系列,降低 Luna 等模型成本并提升速度。谷歌用大语言模型升级 Chrome 漏洞管理流程,6 月修复漏洞数超过过去两年总和。行业Hacker NewsDeepSeekOpenAI10 个信源在谈事件专题推荐理由:今天 HN 干货多,UEFA 硬刚 FIFA、电梯模拟器好玩,还有 DeepSeek 和 OpenAI 上新原文稍后读已读值得跟进有用关注 Hacker News
08:32IT之家(博客/媒体)75°DeepSeek-V4-Flash 正式版 API 于 7 月 31 日上线公测。Artificial Analysis 智能指数(AII)测得 DeepSeek V4 Flash 0731 得 50 分,比 4 月版本高 10 分,比 V4 Pro 高 6 分,比 GPT-5.6 Luna 最高分低 1 分。DeepSeek 自有 API 提供约 98% 缓存命中折扣,使单任务成本比 GPT-5.6 Luna 低约 60%。Frontend Code Arena 中 DeepSeek-V4-Flash-High 得 1586 分,总排名第 7,开放类别第 3。每 MToken 价格 0.14/0.28 美元,是同类产品中性价比最高的。AI模型DeepSeekDeepSeek-V4-FlashGPT-5.6 Luna10 个信源在谈事件专题推荐理由:DeepSeek V4-Flash 正式版上线,AII 得 50 分只比 GPT-5.6 Luna 低 1 分,价格便宜 60%,前端代码跑分 1586,可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
08:29官方账号Simon Willison’s Weblog(博客/媒体)DeepSeek-V4-Flash-0731正式发布,参数量304B,在Hugging Face上体积167GB。Artificial Analysis评估其综合智能排名超过428B参数的MiniMax M3。输入价格每百万token 0.14美元,输出0.27美元,是目前性价比最高的模型之一。在默认推理等级下生成质量一般,但将reasoning_effort调至high后效果显著提升。AI模型DeepSeek-V4-Flash-0731DeepSeek智能体推荐理由:DeepSeek新模型便宜又能打,304B参数干翻428B的MiniMax M3,记得把推理等级调高。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-0731
06:08官方一手marktechpost@Asif RazzaqDeepSeek于2026年7月31日发布DeepSeek-V4-Flash-0731,并同步将V4-Flash API转为公开测试版。该版本基于V4-Flash重新后训练,架构与规模未变。官方模型卡明确这是取代预览版的正式版本。新版在智能体任务与代码生成方面的表现有明显提升。AI模型DeepSeekDeepSeek-V4-Flash-0731智能体推荐理由:DeepSeek把V4-Flash正式版放出来了,智能体和写代码都变强,API也开放公测,可以直接上手试试。原文稍后读已读值得跟进有用关注 DeepSeek
01:08官方账号Decoder@Thomas JoosDeepSeek V4 Flash 的 0731 更新版本在 Artificial Analysis Intelligence Index 上得分 50,较前版提升 10 分。该分数仅比 OpenAI GPT-5.6 Luna 低 1 分,但每任务成本约低 60%。这一成绩让 DeepSeek 的平价模型在性能逼近旗舰的同时,展现出明显的成本优势。AI模型DeepSeekV4 FlashGPT-5.6 Luna10 个信源在谈事件专题推荐理由:DeepSeek 把 V4 Flash 升到 0731 版,性能只比 GPT-5.6 Luna 低 1 分,成本却省六成,平价模型也能打了。原文稍后读已读值得跟进有用关注 DeepSeek
00:35lmarena.ai@lmarena_ai81°DeepSeek-V4-Flash 已进入 Agent Arena,将在数百万个真实长程智能体任务中接受评测,任务可调用网页搜索、文件系统和终端工具。官方同步开放 V4-Flash API 公测,称其智能体能力大幅升级,基准得分已明显超过 V4-Pro-Preview。新版 API 原生支持 Responses API 格式,并已适配 Codex。该模型还将在 Frontend Code Arena、Text 和 Vision Arena 中评测,具体分数待公布。AI模型DeepSeek-V4-FlashDeepSeek智能体10 个信源在谈事件专题推荐理由:DeepSeek 把 V4-Flash 放进 Agent Arena,API 公测也开了,智能体跑分超过 V4-Pro-Preview,还适配 Codex,想试的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
00:23elvis@omarsar0DeepSeek发布V4-Flash-Preview新检查点,官方API进入公开测试阶段。该模型在TerminalBench-2.1上实现20多分跳升,Agent能力大幅增强,整体成绩远超V4-Pro-Preview。API定价为每百万token输入0.14美元、输出0.28美元。V4-Flash原生支持Responses API格式,并已适配Codex。AI模型DeepSeek-V4-FlashDeepSeek智能体10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash API公测了,输入才0.14刀每百万token,Agent跑分还涨了20多分,想折腾的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
23:04官方一手歸藏(guizang.ai)@op7418精选DeepSeek 宣布 V4 Flash 0731 模型已开源。模型权重托管在 Hugging Face 的 deepseek-ai 组织下。该版本属于 Flash 系列,版本号为 0731。开发者可以下载权重进行本地部署或二次开发。AI模型DeepSeekV4 Flash 0731Hugging Face推荐理由:DeepSeek 把 V4 Flash 0731 的开源权重放出来了,想本地跑模型的话直接去 Hugging Face 下载就行。原文稍后读已读值得跟进有用关注 DeepSeek
22:14AK@_akhaliqDeepSeek-V4-Flash-0731 已发布到 Hugging Face。版本号 0731 出现在模型名中。该模型来自 DeepSeek V4 系列。Hugging Face 页面目前已经可以访问。AI模型DeepSeekV4-FlashHugging Face推荐理由:DeepSeek 发了新模型 V4-Flash-0731,已在 Hugging Face 上线,想试的直接去看模型卡下载。原文稍后读已读值得跟进有用关注 DeepSeek
21:38Geek@geekbb72°OpenAI宣布GPT-5.6 Luna降价,但未披露具体幅度。同日,DeepSeek推出V4 Flash正式版。有用户称早上将主力模型换成Luna,中午看到V4 Flash发布后后悔。该用户期待V4 Pro正式版发布时价格再降一档。AI模型GPT-5.6 LunaDeepSeek V4 FlashOpenAI10 个信源在谈事件专题推荐理由:OpenAI刚降价,DeepSeek就发新模型,换模型的速度都赶不上这波价格战。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
20:19AI Will@FinanceYF5DeepSeek-V4-Flash官方API已进入公开测试阶段。输入每百万Token仅0.28美元,输出价格为0.87美元。其Agent能力大幅升级,基准成绩全面超过V4-Pro-Preview。新版本原生支持Responses API格式,并完全适配Codex。AI模型DeepSeekV4-Flash智能体10 个信源在谈事件专题推荐理由:DeepSeek的V4-Flash刚上线,API便宜到离谱,输入才0.28美元,性能还压过V4-Pro-Preview,搭Agent直接用它。原文稍后读已读值得跟进有用关注 DeepSeek
20:08AI Will@FinanceYF5精选79°DeepSeek V4 Flash 官方API现已开启公测,重点升级Agent能力。Terminal Bench 2.1得分82.7,DeepSWE得分54.4,多项成绩大幅超过V4 Pro Preview。该模型还接近Opus 4.8的表现,并原生支持Responses API格式,现已适配Codex。AI模型DeepSeekV4 Flash智能体推荐理由:DeepSeek V4 Flash 公测了,Agent 跑分比 V4 Pro 高不少,还原生支持 Responses API,玩 Codex 的可以直接试。原文稍后读已读值得跟进有用关注 DeepSeek
17:41向阳乔木@vista8精选DeepSeek-V4-Flash的官方API已进入公开测试。其Agent能力基准分数远超V4-Pro-Preview。该版本原生支持Responses API格式。同时完全适配Codex,开发者可在DeepSeek官方文档查看配置详情。AI模型DeepSeekDeepSeek-V4-FlashCodex10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash的API放出来了,Agent能力比V4-Pro-Preview还猛,而且直接支持Codex,开发者快去试试。原文稍后读已读值得跟进有用关注 DeepSeek
17:14shao__meng@shao__meng71°DeepSeek-V4-Flash-0731 正式发布,官方 API 进入公开测试阶段。相比 V4-Pro-Preview,其 Agent 能力大幅升级,基准成绩全面超越 V4-Pro-Preview 和 GLM-5.2。在 DeepSWE 基准上取得 54.5 分,接近 Claude Opus-4.8 的水平。新版本原生支持 Responses API,并已适配 Codex。官方还预告了 DeepSeek Harness 以及内部基准 DSBench-FullStack 和 DSBench-Hard。AI模型DeepSeek-V4-Flash-0731DeepSeekGLM-5.2推荐理由:DeepSeek 把 V4-Flash 转正了,Agent 跑分超过 GLM-5.2,还适配了 Codex,想用 API 的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash-0731
16:52Geek@geekbb83°DeepSeek-V4-Flash官方API现已进入公开测试阶段。其在Agent、工具调用、代码生成和数据科学相关基准测试上全面领先V4-Pro-Preview,其中DeepSWE基准的领先幅度尤为明显。V4-Flash原生支持Responses API格式,并已完全适配Codex环境。开发者可查阅官方API文档获取具体配置方法。AI模型DeepSeekV4-Flash智能体10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash的Agent能力拉满,公测就能用,还直接适配Codex,想试的赶紧去文档看配置。原文稍后读已读值得跟进有用关注 DeepSeek
16:47官方账号深度求索 DeepSeek@deepseek_aiDeepSeek-V4-Flash-0731与预览版保持相同的模型架构和大小。本次升级只作用于DeepSeek-V4-Flash API,DeepSeek-V4-Pro API和App/Web端模型均未变化。DeepSeek官方表示,DeepSeek-V4-Pro正式版将尽快发布。AI产品DeepSeekDeepSeek-V4-FlashDeepSeek-V4-Pro10 个信源在谈事件专题推荐理由:DeepSeek刚更新了V4-Flash API到0731版,但架构和预览版一样,V4-Pro正式版马上就出,API开发者可以先升级试试。原文稍后读已读值得跟进有用关注 DeepSeek
16:02宝玉@dotey72°DeepSeek 将 V4-Flash(版本号 0731)从预览升级为正式版 API,总参数 284B、激活参数 13B 的 MoE 架构不变,改动集中在后训练。官方称其在多项 Agent 基准上的成绩大幅超过 V4-Pro-Preview,编程和工具调用能力反超更贵的 Pro 预览版。V4-Flash 原生支持 Responses API 格式,可直接对接 OpenAI Codex,并提供一键配置脚本。API 定价为输入每百万 Token 0.14 美元、输出 0.28 美元,上下文窗口 100 万 Token。AI模型DeepSeekV4-FlashCodex10 个信源在谈事件专题推荐理由:Flash 转正后 Agent 能力反超 Pro 预览版,还原生适配 Codex,不用代理直接切,输入每百万 token 才 0.14 美元。原文稍后读已读值得跟进有用关注 DeepSeek
15:45官方一手歸藏(guizang.ai)@op741872°DeepSeek 官方发布 DeepSeek-V4-Flash 的官方 API,已进入公开测试阶段。该版本重点强化 Agent 能力,官方宣称其基准得分已远远超过 V4-Pro-Preview。V4-Flash 原生支持 Responses API 格式,并已完全适配 Codex 客户端。具体配置方式见 DeepSeek 官方 API 文档。AI模型DeepSeekDeepSeek-V4-Flash智能体10 个信源在谈事件专题推荐理由:DeepSeek 把 V4-Flash API 放出来公测了,Agent 能力比 V4-Pro-Preview 强不少,还直接支持 Codex,想玩可以去翻官方文档。原文稍后读已读值得跟进有用关注 DeepSeek
15:40官方账号深度求索 DeepSeek@deepseek_aiDeepSeek-V4-Flash 官方 API 现已进入公开测试版,Agent 能力获得升级。官方基准成绩显示其已远超 V4-Pro-Preview。该 API 原生支持 Responses API 格式,并已完全适配 Codex。具体配置方法见官方文档 api-docs.deepseek.com/quick_start/ag...AI模型DeepSeekV4-FlashCodex10 个信源在谈事件专题推荐理由:DeepSeek把V4-Flash的API开放公测了,Agent能力比V4-Pro-Preview强不少,还直接适配Codex,想试新模型可以去看看。原文稍后读已读值得跟进有用关注 DeepSeek
15:23Geek@geekbbDeepSeek 发布 V4-Flash-0731,属于 V4-Flash 系列的迭代版本。本次更新仅针对 API 接口,未提及模型能力变化。官方称 V4-Pro 正式版将尽快发布。AI模型DeepSeekV4-FlashAPI接口10 个信源在谈事件专题推荐理由:DeepSeek给V4-Flash刷了个小版本,只动了API接口,想等V4-Pro的可以蹲一下。原文稍后读已读值得跟进有用关注 DeepSeek
14:06IT之家(博客/媒体)DeepSeek 7 月 31 日下午通过 API 文档宣布 DeepSeek-V4-Flash 正式版 API 上线公测。版本号 DeepSeek-V4-Flash-0731 与 preview 版结构尺寸一致,仅重新进行了后训练。Agent 基准中 Terminal Bench 2.1 为 82.7,NL2Repo 为 54.2,Cybergym 为 76.7,DeepSWE 为 54.4,Toolathlon verified 为 70.3。Agent Last Exam 为 25.2,Automation Bench (Public) 为 25.1,DSBench-FullStack 为 68.7,DSBench-Hard 为 59.6,全面超过 V4-Pro-Preview。新版本原生支持 Responses API 格式并适配 Codex,V4-Pro API 和 APP/WEB 端本次未改动。AI模型DeepSeekDeepSeek-V4-FlashDeepSeek-V4-Pro10 个信源在谈事件专题推荐理由:DeepSeek 把 V4-Flash 转正了,智能体跑分全面压过 V4-Pro 预览版,做开发可直接试。原文稍后读已读值得跟进有用关注 DeepSeek
10:51IT之家(博客/媒体)国家发展改革委7月31日表示,将加快《人工智能法》立法进程。上半年,深度求索、月之暗面等本土企业发布了万亿参数开源大模型,国产大模型全球下载量突破100亿次。下一步还将布局国家人工智能应用中试基地,并强化技术监测、风险预警和应急响应体系。行业国家发改委人工智能法DeepSeek推荐理由:发改委今天放话要加快《人工智能法》立法,还提到国产大模型下载量破了100亿次,搞AI的可以关注监管风向。原文稍后读已读值得跟进有用关注 国家发改委
09:53官方一手arXiv: DeepSeek@Huiyuan Tian, Bonan Xu, Shijian Li精选本研究提出专家子空间分离指数(ESSI)和匹配路由残差等方法,区分路由一致性、候选质量和上下文交互。在六种MoE架构中发现专家子空间高度重叠,但实际路由对token表征的解释优于匹配替代方案。在OLMoE、Mixtral和DeepSeek的39个阶乘单元中,选中专家在每个单元都比最强的未选中候选解释更多残差,但实际前缀在所有交互中均缩小该优势,所有95%置信区间低于零。尽管几何重叠,添加后续专家在39个冻结路由比较中改善24个单元的下一token预测,其余15个不显著,受控训练中三个种子均偏好Top-2优于Top-1。这一模式表明路由从共享几何邻域选择token相关专家,而多专家计算无需不相交线性覆盖即可保持效用。论文MoE稀疏混合专家OLMoE推荐理由:这篇论文把MoE路由的几何重叠和功能价值分开了,用了新指标ESSI和受控实验,结论很扎实,比单纯算相似度靠谱。原文稍后读已读值得跟进有用关注 MoE
08:11IT之家(博客/媒体)72°据彭博社报道,DeepSeek 计划在内蒙古乌兰察布建设一座大型 AI 数据中心,新增 1GW(吉瓦)算力。部分算力预计于 2027 年底或 2028 年初投入运行。乌兰察布年平均气温约 4°C,低温环境可降低 AI 服务器散热成本。作为参考,英伟达 CEO 黄仁勋曾预计 1GW 级 AI 数据中心投资达 500 亿美元。DeepSeek 已发布当地数据中心高级交付经理等岗位。行业DeepSeek乌兰察布内蒙古推荐理由:DeepSeek 要在内蒙建一个超大 AI 数据中心,1GW 算力,2028 年初部分上线,自己建还租别家的,手笔不小。原文稍后读已读值得跟进有用关注 DeepSeek
18:35IT之家(博客/媒体)78°欧盟委员会宣布提供100亿欧元(约773.81亿元人民币)支持建设7座AI超级计算工厂,目标吸引200亿欧元私人投资。每座工厂至少配备10万颗先进AI芯片,计算能力约为现有欧盟数据中心平均水平的4倍。当前欧盟计算资源由19个数据中心提供,新工厂将使算力翻倍。美联储2025年评估显示欧洲在AI关键领域落后于美国和中国,且欧盟电力成本是美国的2至3倍。法国AI公司Mistral AI运营欧洲最大数据中心之一,但其发展速度未赶上OpenAI和DeepSeek。行业欧盟Mistral AIDeepSeek10 个信源在谈事件专题推荐理由:欧盟砸100亿欧元建7座AI超级工厂,算力直接翻倍,目标追中美。看看欧洲怎么靠公共投资硬刚美国巨头。原文稍后读已读值得跟进有用关注 欧盟
09:19官方一手arXiv: DeepSeek@Zhoupeng Shou, Xiaodong Hong, Congjing Ren, Jingdai Wang, Yongrong Yang, Zuwei Liao该框架利用大语言模型(如DeepSeek-V4-Flash、Qwen3.7-Plus)模拟工程师工作流,通过闭环响应特征生成并迭代修正PID增益。在100个FOPDT和100个SOPDT测试用例上,托管LLM最终成功率达75-89%和77-79%。对于本地部署的Qwen3-0.6B,监督微调使首次推荐成功率为86.5%,结合物理信息GRPO进一步提高至94.0%,主要改善了首次尝试可靠性和稳定性裕度。论文Qwen3DeepSeekPID整定6 个信源在谈事件专题推荐理由:这篇论文用LLM自动调PID参数,小模型Qwen3-0.6B调参成功率94%,比大模型还稳。原文稍后读已读值得跟进有用关注 Qwen3
12:27官方一手歸藏(guizang.ai)@op7418精选Codepilot 推出了 Subagent 功能,允许用户在一个聊天中启用多个由不同模型驱动的子智能体。例如可用 Grok 检索 Twitter 信息、DeepSeek 生成文案、K3 生成网页、GLM 5.2 统筹。该设计旨在发挥各模型长处,同时减少昂贵模型的消耗,降低使用成本。技巧CodepilotGrokDeepSeek推荐理由:Codepilot 这个 Subagent 功能真香,一个聊天里混用 Grok、DeepSeek、GLM 5.2 等模型,各取所长还省钱,试试看。原文稍后读已读值得跟进有用关注 Codepilot
12:26官方一手歸藏(guizang.ai)@op7418作者使用 Codepilot 的一条提示词,让 Grok 爬取 Twitter 信息、Kimi 生成网页、DeepSeek 撰写文案,并由 GLM 5.2 统筹。该 workflow 成功完成昨天 AI 热点事件统计,时效性与人工搜集相当,甚至补充了漏掉的信息。通过分模型调用,降低了昂贵模型的消耗。技巧GrokKimiDeepSeek推荐理由:想用最少的成本让不同模型干各自擅长的事?参考这个 workflow:Grok 爬推文、DeepSeek 写文案、Kimi 做网页、GLM 5.2 调度。原文稍后读已读值得跟进有用关注 Grok
12:25官方一手歸藏(guizang.ai)@op7418用户通过一句提示词,调用 Grok 进行 Twitter 热点事件信息爬取,Kimi 生成网页,DeepSeek 撰写文案。三个模型分工协作,完成了昨日 AI 热点事件的统计,结果与手动搜集高度一致,并补充了遗漏信息。展示了多模型组合工作流的实际效果。技巧GrokKimiDeepSeek推荐理由:用一句提示词让 Grok、Kimi、DeepSeek 各司其职,自动统计 Twitter 热点,省时又全面,适合想提升信息搜集效率的人。原文稍后读已读值得跟进有用关注 Grok
11:23官方一手arXiv: DeepSeek@Jia Liu, Veena Krishnaraj, Kateryna Vovk, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Anamaria Hell, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou该研究测试了大型语言模型(LLMs)在科研项目规划和提案评估中的表现。人类研究者与ChatGPT、Claude、DeepSeek(2025年中模型)分别生成了8个专家构思的研究项目的一页计划,共计32份提案。4位人类评审员和2个前沿LLM(Claude Opus 4.8、ChatGPT Pro 5.5)采用四维度评估标准盲审。人类评审员对AI和人类提案的整体评分相似,而AI评审员对AI提案的评分平均高出约1分(5分制)。人类评审员正确识别人类和AI提案的比例分别为72%和79%,而两个AI评审员均100%正确分类。研究表明当前LLM能生成与人类提案相当的计划,但AI评审员存在系统性偏好。论文ChatGPTClaudeDeepSeek推荐理由:这篇论文测试了ChatGPT、Claude、DeepSeek写科研计划的能力,发现人类评委分不出好坏,但AI评委偏爱AI写的。值得一读。原文稍后读已读值得跟进有用关注 ChatGPT
09:16官方一手arXiv: DeepSeek@Maxim Chupilkin论文使用动态序数理想点方法,将LLM作为受访者分析1946-2025年5555份联合国决议。支持率从DeepSeek的37.8%到GPT-5的97.3%。在21世纪,GPT-5、Claude Sonnet和Gemini最接近俄罗斯,DeepSeek最接近法国,所有四个模型均远离美国。针对美国反对而中俄支持的2104项决议,GPT-5支持96.1%,Gemini 83.4%,Claude Sonnet 65.2%,DeepSeek 36.1%。论文DeepSeekGPT-5Claude Sonnet推荐理由:用联合国投票数据测了四个大模型的政治立场,发现DeepSeek最亲法,GPT-5最亲俄,跟开发者国家不一样。原文稍后读已读值得跟进有用关注 DeepSeek
16:16官方一手Pandaily@contact@pandaily.com (Pandaily)82°Moonshot AI发布47页Kimi K3技术报告,核心架构包括KDA+Gated MLA混合注意力机制。AttnRes跨层检索层降低推理成本。Stable LatentMoE包含896个专家,支持动态路由。采用51.2M规模的RL沙箱进行强化学习训练,提升模型对齐能力。报告还引入模型参数与推理时间两个缩放轴,重新定义性能前沿。AI模型Kimi K3Moonshot AIDeepSeek10 个信源在谈事件专题推荐理由:Moonshot AI 发了Kimi K3的47页技术报告,混合注意力、896专家MoE和5100万RL沙箱的架构特别硬核,值得看它怎么跟DeepSeek对标。原文稍后读已读值得跟进有用关注 Kimi K3
12:33官方一手arXiv: DeepSeek@Hong Liu, Yuan Cheng, Lin Niu, Yi Su, Yufei Xue, Anmin Liu, Guanghua Yu, Jianchen ZhuDeepSeek稀疏注意力(DSA)在生成式系统中实现令牌级稀疏注意力,但索引器仍需对所有前序token打分,复杂度为O(L²)。PIVOT利用附近查询的token重叠性和索引器得分长尾分布,通过共享前缀扫描加速。PIVOT将一组查询聚合成一个代理查询,进行一次全前缀扫描得到候选集,再为每个查询选择top-k。两个变体:PIVOT-Reuse共享代理top-k,PIVOT-Refine重新评分候选集。在DeepSeek-V3.2和GLM-5.1上,在LongBench和RULER基准上,PIVOT匹配精度,索引器加速4倍,端到端延迟降低1.6倍。论文PIVOTDeepSeekGLM推荐理由:PIVOT用共享前缀扫描替代逐查询扫描,加速4倍,端到端延迟降1.6倍,效果不打折。适合长上下文推理场景。原文稍后读已读值得跟进有用关注 PIVOT
12:31官方一手arXiv: DeepSeek@Zongyou Yang, Yinghan Hou精选语言模型基准将是否到达可评估状态和答案是否正确合并为一个准确率分数。新提出的两层评估框架分离了执行证据(终止、答案暴露、可解析性、完成长度)和正确性。在5个Qwen和DeepSeek配置的2550个输出上,2048 token限制下:Qwen MATH有49/450未终止,DeepSeek MATH有5/300未终止,ARC无未终止。相同300个DeepSeek MATH输出在8192 token下无缺失最终答案终止。覆盖审计的目标验证表明候选选择与聚合策略可显著改变比较准确率估计。论文QwenDeepSeekMATH推荐理由:这篇论文用具体数字告诉你,准确率分数会骗人:同样2048 token,Qwen比DeepSeek多出近10倍的无答案失败,评估时得分开看执行状态和得分。原文稍后读已读值得跟进有用关注 Qwen
12:03官方一手arXiv: DeepSeek@Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic76°该研究对GPT-5、Claude、Grok、Gemini、DeepSeek、Kimi、Qwen共7个主流模型进行了基于政治轴的可控性压力测试,使用12种意识形态角色提示和70个政治指南针项目,共收集63,700条回答。结果发现,上下文框架解释了经济和社会轴上约88%-93%的方差,而模型自身身份的影响不到3%。在威权提示下,不同模型在相同问题上表现出相似偏移。研究强调需要进行可操控性审计,报告分散性、对称性、饱和度和拒绝底线。数据集和代码已开源。论文GPT-5ClaudeGrok推荐理由:这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。原文稍后读已读值得跟进有用关注 GPT-5
10:57官方一手arXiv: DeepSeek@Deyu Yang, Rundong Wei, Xiaoqi Li该论文提出一种结合漏洞聚焦代码切片、ERC-721 知识库和约束 DeepSeek 的 NFT 智能合约漏洞检测方法。在 450 个 NFT 合约样本上,完整配置的检测器给出了 437 个正标签,正标签率达到 97.1%。去除外部知识库后,正标签率降至 87.11%;进一步去除代码切片,正标签率降至 73.78%。结果表明,聚焦代码上下文和领域约束显著影响检测效果。论文智能合约漏洞检测DeepSeek推荐理由:研究了一套专门针对 NFT 合约的漏洞检测方法,用 DeepSeek 加代码切片把准确率干到了 97.1%,比纯分析完整合约高了 23 个百分点。做合约安全的可以看看。原文稍后读已读值得跟进有用关注 智能合约