22:08量子位@一水DeepSeek-Coder-V2在SWE-bench Verified上以67.3%的成绩超越GPT-4o和Claude 3.5 Sonnet,成为首个免费开源的编码模型达到该水平。该模型在HumanEval上得分92.1%,在MBPP上得分90.5%。开发者可通过Hugging Face免费下载使用。AI模型DeepSeek-Coder-V2DeepSeek开源模型推荐理由:DeepSeek-Coder-V2免费开源,性能还超过了GPT-4o和Claude,写代码直接省钱了。原文稍后读已读值得跟进有用关注 DeepSeek-Coder-V2
20:05Junyang Lin@JustinLin610作者JustinLin610指出前沿模型效果好但成本高,个人订阅用户可最大化token使用量(如Codex月费200美元可产生超8000美元token消耗)。企业按token计费时,可将简单格式化任务分配给Seed、Qwen、DeepSeek等便宜模型,复杂智能体任务交给Fable、Sol。GLM 5.2编码能力接近Claude和GPT,Grok类似。合理设计系统能提升生产力且不增加成本。技巧ClaudeGPTDeepSeek推荐理由:如果你用AI时总担心费用,这篇聊透了怎么把便宜模型(如Qwen、DeepSeek)和贵模型(Claude、GPT)搭着用,省成本又出活。原文稍后读已读值得跟进有用关注 Claude
15:42Geek@geekbb精选CS Native 是一个面向 Claude Science 的本地 provider 和运行时控制面板,能在隔离沙箱中将模型请求转发到 DeepSeek、Qwen、OpenAI 等第三方供应商。它保留了官方 Claude Science 的独立入口,让用户可以在沙箱环境中安全地切换不同模型。该项目已在 GitHub 开源,可搭配 Claude Science 使用。技巧CS NativeClaude ScienceDeepSeek10 个信源在谈事件专题推荐理由:想给 Claude Science 换个模型后端?试试 CS Native,它让你在隔离沙箱里调用 DeepSeek、Qwen 或 OpenAI,还不丢官方入口。原文稍后读已读值得跟进有用关注 CS Native
11:30IT之家(博客/媒体)QuestMobile发布2026年6月AI应用市场报告,AI原生App月活达4.99亿,同比增长85.4%。豆包以3.82亿月活位居榜首,千问1.67亿、DeepSeek1.30亿紧随其后。豆包同比增长172.1%,千问同比增长5792.9%。用户黏性方面,豆包、DeepSeek、Kimi的10分钟以上用户占比分别为27.5%、30.0%、26.1%。AI原生App月人均用户时长达到183分钟,同比增长40%。行业QuestMobile豆包千问推荐理由:想看国内哪款AI应用用户最多?QuestMobile数据告诉你豆包月活3.8亿断层领先,千问增速近58倍,值得关注。原文稍后读已读值得跟进有用关注 QuestMobile
11:14官方一手arXiv: DeepSeek@Ilia KarpovMafiaScope是一个开源测试平台,将社交推理游戏“黑手党”转化为测量机器理论心智的工具。在32场DeepSeek案例研究中,它收集了13815个结构化探针回答,发现智能体的置信度校准误差为0.17,且高估自己被怀疑的概率达1.5倍。该平台支持交互式可视化、反事实重放,并已发布200+跨模型游戏语料库。论文MafiaScopeDeepSeek社交推理推荐理由:想研究LLM在社交推理中的真实信念?MafiaScope用探针实验和反事实回放,让你看到智能体表面的伪装。DeepSeek案例数据很硬核。原文稍后读已读值得跟进有用关注 MafiaScope
09:14官方一手arXiv: DeepSeek@Maxim Chupilkin一项论文使用背书实验测试GPT-5、Claude Sonnet、Gemini和DeepSeek四款大模型对国际经济与安全政策的评分。当政策被描述为获得美国或欧盟支持时,模型评分显著高于被描述为获得中国或俄罗斯支持的政策,数值条件中GPT-5、Claude Sonnet和Gemini对中国和俄罗斯背书的政策评分分别降低约10%-20%。加入要求模型提供理由后,GPT-5和Claude Sonnet的西方/非西方差距保持不变,Gemini的惩罚减弱,但DeepSeek此前无差距转而呈现对中国和俄罗斯的惩罚。模型理由显示西方背书被视为可信度信号,而中俄背书与数据安全、主权、监控或地缘政治风险关联。论文GPT-5Claude SonnetGemini推荐理由:这篇论文用实验数据告诉你,大模型评政策时会看谁站台——同一政策挂美国旗得分高,挂中国旗得分低。GPT-5、Claude Sonnet、Gemini、DeepSeek表现各异,值得关注。原文稍后读已读值得跟进有用关注 GPT-5
09:13官方一手arXiv: DeepSeek@Linhui Xiao, Guiping Cao, Mingyue Guo, Xianchao Guan, Fan Yang, Ming Tao, Xin Li, Yuxin Peng, Yaowei Wang该综述系统梳理了大型模型绿色发展的研究进展,涵盖注意力算子优化、线性复杂度架构、模型稀疏化与合并等效率型模型设计方法,以及数据高效学习、参数高效微调、计算压缩等训练与部署策略。在硬件层面,总结了主流AI芯片、内存优化、跨平台部署与可持续基础设施。还探讨了大型模型在DeepSeek、遥感解译、国家级基础设施等可持续关键领域的应用,并指出持续学习范式、以内存为中心的硬件和标准化评估协议等未来挑战。论文DeepSeek模型压缩绿色AI推荐理由:想了解怎么让大模型更省资源、更环保?这篇综述从算法优化到硬件设计都讲透了,还提到了DeepSeek等应用案例。原文稍后读已读值得跟进有用关注 DeepSeek
09:12官方一手arXiv: DeepSeek@Alexander Tian, Aditya Ghai, Sanjit Neelam, Zaal Vasania, Akshay Mishra精选COBS通过引入压缩的二阶统计量改进了DeepSeek Native Sparse Attention(NSA)的块选择策略。在32k RULER长上下文检索基准上,COBS将平均分从NSA基线的0.2999提升至0.8195,接近稠密注意力的0.9040,缩小了约86%的差距。其KV缓存读取流量仅为稠密注意力的1/15.15,比NSA基线高1.21倍。模型保持短上下文行为,并在位置负对数似然上低于稠密注意力。论文COBSNative Sparse AttentionDeepSeek推荐理由:COBS在NSA基础上加了个二阶统计量,长上下文检索分数从0.3拉到0.82,接近稠密注意力但省了十几倍带宽,很实用。原文稍后读已读值得跟进有用关注 COBS
20:37AI Will@FinanceYF5Ara Kharazian 指出外界可能高估了中国模型和开源模型对 OpenAI、Anthropic 收入的冲击。Ramp AI Index 显示 Anthropic 在企业市场持续扩大优势,42% 的企业在使用 Anthropic。OpenAI 的企业使用率基本持平。DeepSeek 的企业使用率仅为 0.3%。行业Ara KharazianAnthropicOpenAI10 个信源在谈事件专题推荐理由:分析师 Ara Kharazian 用 Ramp AI Index 数据告诉你:Anthropic 企业份额达 42%,DeepSeek 只有 0.3%,别高估开源模型的威胁。原文稍后读已读值得跟进有用关注 Ara Kharazian
10:53官方一手Pandaily@contact@pandaily.com (Pandaily)精选DeepSeek、智谱AI和Qwen的成本高效模型在OpenRouter平台上周令牌份额超过20%,数据基于2025年7月的统计。这一增长显示开发者正从高价模型转向性价比更高的选项。结构性的市场转变表明成本正在成为AI基础设施选择的关键因素。行业DeepSeekZhipuQwen推荐理由:开发者的钱袋更聪明了:DeepSeek、智谱、Qwen靠低价拿下OpenRouter五分之一流量,值得关注。原文稍后读已读值得跟进有用关注 DeepSeek
10:48官方一手pandaily@contact@pandaily.com (Pandaily)DeepSeek和智谱AI据报道正在开发自研AI推理芯片,效仿OpenAI和Anthropic此前路线。两家公司希望通过自研芯片降低推理成本并提升效率,目前具体规格和发布时间尚未披露。此举表明中国头部AI公司正加速向上游硬件延伸。行业DeepSeekZhipu AIAI芯片10 个信源在谈事件专题推荐理由:DeepSeek和智谱也要自研AI芯片了,和OpenAI同赛道,看看他们能不能控制推理成本。原文稍后读已读值得跟进有用关注 DeepSeek
10:19官方一手Pandaily@contact@pandaily.com (Pandaily)智谱AI和DeepSeek的中国AI模型在美国开发者中份额增长,其成本性能优势达到美国同行的10倍。这一性价比差距吸引了大量开发者从OpenAI等转向使用中国模型。例如DeepSeek-V2的API价格仅为GPT-4的1/10,而智谱AI的GLM-4在多项基准上接近美国顶级模型。行业Zhipu AIDeepSeek性价比10 个信源在谈事件专题推荐理由:智谱AI和DeepSeek的模型成本只有美国同行的十分之一,性能还不差,开发者快去试试。原文稍后读已读值得跟进有用关注 Zhipu AI
15:06@koltregaskes@koltregaskes83°OpenAI于今日向公众全面发布GPT-5.6,此前仅对合作伙伴开放,并应美国政府要求延迟上市。GPT-6预计约一个月后发布,基于全新预训练基础而非Spud架构。谷歌Gemini 3.5 Pro仍在内测中,目标提升推理深度和智能体性能,计划7月发布。MiniMax正准备2.7T参数模型M3 Pro,DeepSeek筹备V4 GA,中国当局讨论限制先进模型海外访问。AI模型GPT-5.6Gemini 3.5 ProMiniMax10 个信源在谈事件专题推荐理由:各家疯狂出新模型,OpenAI今天正式发GPT-5.6,谷歌的Gemini 3.5 Pro快了,中国也有新动作,竞争太激烈了。原文稍后读已读值得跟进有用关注 GPT-5.6
10:42宝玉@dotey79°据爆料,OpenAI准备跳过5.x系列,直接发布GPT-6,可能一个月内到来,作为对Anthropic Mythos 5的回应。GPT-5.6(代号Spud,约4T token)将于7月9日向公众开放,但GPT-6将使用全新的更大预训练底座。Anthropic的Mythos 5因网络安全能力导致美国出口管制,禁令于6月30日解除,Fable 5.1预计几周内发布。xAI正在训练10T参数的Grok,DeepSeek V4正式版7月中旬上线,能力可能追平GLM-5.2,同时MiniMax M3 Pro(2.7T参数)计划Q3开源。行业GPT-6GPT-5.6Anthropic10 个信源在谈事件专题推荐理由:想了解OpenAI、Anthropic、xAI和国产模型的最新动静?这篇爆料把GPT-6的加速发布、Mythos引发的连锁反应都串起来了,还提到DeepSeek V4和GLM-5.2的竞争,信息量很大。原文稍后读已读值得跟进有用关注 GPT-6
10:20官方一手arXiv: DeepSeek@Lifei Liu, Haoran Yu, Xiaochong Jiang, Su Wang, Pin Qian, Yihang Chen这项研究提出一种五条件对比设计,拆解多智能体LLM安全中的三个机制。在30个合成有害场景和四个安全基准上测试,发现操作重构是最可迁移的风险信号,使GPT、Gemini和DeepSeek的合规性上升,而Claude相对抵抗。批准框架委托的敏感性因提示设计、模型配对和场景来源而异,怀疑性执行提示可大幅降低合规性。原始直接模型排名可能误导:Gemini在直接提示中最安全(8.9%),但与Claude规划器配对后合规性升至38.9%。GPT的零净管道效应实际上隐藏了重构增加被规划器拒绝抵消的事实。论文GPTGeminiDeepSeek推荐理由:这篇论文拆穿了多智能体安全评估的常见错觉——GPT看似安全但只是被拒绝掩盖,Gemini配对Claude反而危险。做安全测试时别只看总数。原文稍后读已读值得跟进有用关注 GPT
17:16量子位@听雨翁荔在最新博客中提出AI自进化应首先构建Harness框架。DeepSeek成员崔添翼转发该博客并评论称该方向容易出成果。Harness可能作为系统化工具简化自进化流程,引发行业关注。AI模型翁荔HarnessDeepSeek推荐理由:翁荔给自进化指了条新路:先搭Harness。DeepSeek的崔添翼都说容易出成果,搞自进化的可以看看。原文稍后读已读值得跟进有用关注 翁荔
16:08官方一手pandaily@contact@pandaily.com (Pandaily)DeepSeek与智谱AI宣布自研AI推理芯片,效仿OpenAI和Anthropic。此举旨在降低对英伟达GPU的依赖,并削减推理成本。国内头部AI实验室开始从模型层面向上游芯片延伸,标志行业结构转型。行业DeepSeek智谱AI自研芯片10 个信源在谈事件专题推荐理由:DeepSeek和智谱也开始自己造芯片了,目标就是省钱和摆脱对英伟达的依赖。原文稍后读已读值得跟进有用关注 DeepSeek
14:48IT之家(博客/媒体)CNBC报道,全球AI聚合平台OpenRouter数据显示,自2月8日以来,美国公司每周调用DeepSeek、智谱GLM系列等中国模型的比重持续超过30%,峰值达46%。过去12个月平均比例仅为11%,而2025上半年最低点仅4.5%。AI初创公司Lindy在6月将全部流量从Anthropic的Claude切换至DeepSeek,CEO称数月节省数百万美元。OpenRouter指出,中国开源模型价格较Anthropic和OpenAI领先模型低60%至90%。性能差距缩小:GLM 5.2在Agent基准上分数与Anthropic Opus 4.8仅差1个百分点,成本约为后者的1/5。行业DeepSeekClaudeOpenRouter10 个信源在谈事件专题推荐理由:DeepSeek比Claude便宜九成,性能差距不到十个月,美国企业批量迁移,OpenRouter数据硬核实锤,省钱看这篇。原文稍后读已读值得跟进有用关注 DeepSeek
14:10量子位@梦晨DeepSeek于一年前启动秘密造芯项目,专攻AI推理芯片。目前已与多家芯片设计公司、晶圆代工厂和存储器供应商展开接洽。招聘全程不公开,显示该项目高度保密。此举可能降低对第三方芯片的依赖,提升推理效率。行业DeepSeekAI芯片推理芯片推荐理由:DeepSeek偷偷造芯片了,专为推理优化,已经找好代工厂和存储器供应商,硬件布局动了真格。原文稍后读已读值得跟进有用关注 DeepSeek
11:31官方一手arXiv: DeepSeek@Andrew Zhang, Chengzhan Li论文提出 Agent Step Value (ASV) 框架,通过重放黑盒轨迹并用无状态 LLM 评估器打分,量化每一步的价值。在 100 道开放问答任务(使用 PubMed 实时检索和 DeepSeek 对数概率评分)上,ASV 评估了 1,100 次转移,结果显示熵移动为 0.000,平均贝叶斯惊讶为 2.693,表明信念近乎 one-hot 转折。在 128 个 token 的 rationale 条件下,平均黄金边际增益为 -2.335(95% CI [-3.395, -1.272]);而直接用单 token 评分同一轨迹得到 +4.033。论文通过 100 次转移的组件审计追踪到反转源于短 rationale 对完整状态的覆盖。论文ASVAgent Step ValueDeepSeek推荐理由:这篇论文教你怎么用 ASV 框架来拆解 AI agent 每一步的决策价值,在开放问答任务上实测发现短 rationale 反而有害,做 agent 评估的必看。原文稍后读已读值得跟进有用关注 ASV
04:33Aadit Sheth@aaditsh中国在AI模型落后时采取开源策略,通过Qwen、DeepSeek、GLM等开源模型推动模型层商品化,美国企业每周路由超30%的AI token(一年前仅11%)。目前中国模型水平距美国前沿仅差6-9个月,而非过去数年。本周报道称北京首次讨论限制海外访问其最佳模型,原因是认为即将成为领先者。行业QwenDeepSeekGLM推荐理由:看中国怎么用开源打了一场翻身仗:从落后到逼近前沿,再到考虑限制,数据很硬核。原文稍后读已读值得跟进有用关注 Qwen
03:19@koltregaskes@koltregaskes精选71°DeepSeek 正在自研专用于推理的 AI 芯片,该项目已进行约一年。公司已私下招募芯片设计师,并与合作伙伴沟通,同时仍在使用 Nvidia 和华为的芯片来运行 R1 等模型。美国对先进芯片的出口管制是推动包括 DeepSeek 在内的多家实验室自研芯片的直接原因。不过芯片研发周期长达数年,且会面临与其他厂商相同的制造瓶颈。行业DeepSeekAI芯片推理芯片8 个信源在谈事件专题推荐理由:DeepSeek 自己动手做推理芯片了,不想被英伟达卡脖子,但这条路得走好几年。原文稍后读已读值得跟进有用关注 DeepSeek
23:47IT之家(博客/媒体)72°路透社援引知情人士消息,DeepSeek(深度求索)正在自研面向 AI 推理场景的芯片,项目约一年前启动。若成功,将降低其对英伟达、华为的依赖。受此影响,英伟达盘前股价下跌约 1.6%。分析师指出,受制于制造工艺,该芯片海外市场机会有限。DeepSeek 近期低调招聘芯片设计工程师,未公开职位信息。行业DeepSeek英伟达华为推荐理由:DeepSeek 在搞自己的 AI 推理芯片,想少用英伟达和华为的货。项目才起步,但已有分析师不看好海外市场。看国产大模型如何突围硬件依赖。原文稍后读已读值得跟进有用关注 DeepSeek
17:04IT之家(博客/媒体)73°据CNBC报道,DeepSeek、智谱AI等中国模型因成本比Anthropic/OpenAI低60%-90%,性能接近,正被美国企业大量采用。OpenRouter数据显示自2月8日起美国企业调用中国模型占比每周超30%,峰值达46%。智谱GLM 5.2上线首周日调用量暴涨27倍,客户数增长近80倍。Lindy公司从Claude切换至DeepSeek后节省数百万美元成本。在智能体能力评测中,GLM 5.2与Anthropic Opus 4.8仅差1个百分点,成本仅为后者五分之一。AI模型DeepSeek智谱AIGLM 5.210 个信源在谈事件专题推荐理由:中国模型性能追上来了,成本还便宜一大截。DeepSeek、智谱GLM被美国公司大量采用,想省钱的团队可以关注。原文稍后读已读值得跟进有用关注 DeepSeek
16:29AI Will@FinanceYF5第三方服务商通过SGLang推理引擎、Prefill-Decode解耦架构、专家并行技术及AMD MI300 GPU,将DeepSeek模型的API调用成本降至官方价格的1/5。该技术栈组合显著降低了推理开销,使小型团队和企业能以更低成本使用高性能模型。方案中涉及的专家并行与Prefill-Decode分离是核心优化手段。技巧DeepSeekSGLangAMD MI300推荐理由:想低成本跑DeepSeek?有第三方用SGLang和AMD MI300把API成本压到官方的五分之一,技术方案公开,值得参考。原文稍后读已读值得跟进有用关注 DeepSeek
15:57Marc Andreessen@pmarcaMarc Andreessen 在推特上引用观点,认为 DeepSeek 的模型 Fable 在给定足够测试时计算(test time compute)的情况下,可能能够完成任意人类知识工作者的任务。它可以通过生成子代理(subagents)、运行RLM环境等方式实现。该观点称Fable是“智能完备”(Intelligence-Complete)的。目前该推文获得75个点赞和约24k阅读量。AI模型DeepSeekFableAGI推荐理由:Marc Andreessen 直接评价说 DeepSeek 的 Fable 可能已经接近 AGI 的门槛,这个判断来自顶级投资人,值得关注。原文稍后读已读值得跟进有用关注 DeepSeek
11:47官方一手arXiv: DeepSeek@Andrew Zhang, Chengzhan LiASV是一个状态转换测量框架,为每个观察到的动作评分,基于状态锚定评估器在固定候选结果上的分布变化。在100个开放问答任务中,使用实时PubMed检索和部分实时的DeepSeek执行器与log-probability评分,评估了1100步和2200个状态。在固定布局理由条件下,平均金标准边际增益为-2.335(轨迹自举95% CI [-3.395, -1.272]),熵值变化为0.000,平均贝叶斯惊喜为2.693。ASV能够定位最终答案分数或纯熵步指标遗漏的建设性和破坏性信念转变。论文ASV智能体评估状态转换推荐理由:这篇论文提出了ASV框架,能比传统方法更细粒度地诊断智能体每一步的好坏,特别适合做Agent评估的朋友。原文稍后读已读值得跟进有用关注 ASV
00:15OpenRouter@OpenRouterAIDeepSeek 在 OpenRouter 平台的 token 份额从 2025 年 1 月的 9% 增长至 6 月的 18%,六个月内翻倍。OpenRouter 分析认为主要驱动力是智能体(agentic)工作场景。该数据来自 OpenRouter 官方博客的深度分析。行业DeepSeekOpenRoutertoken份额推荐理由:OpenRouter 数据显示 DeepSeek 的 token 份额半年翻倍,智能体场景是推手,值得开发者关注。原文稍后读已读值得跟进有用关注 DeepSeek
17:21IT之家(博客/媒体)中央网信办自 2026 年 4 月启动“清朗·整治 AI 应用乱象”专项行动,第一阶段累计处置违规 AI 产品 1.4 万余款,清理违法违规信息 600 余万条,处置账号 2.6 万余个。北京、上海、浙江等网信办分别建立联动巡查、升级举报机制、优化模型审核能力等管理措施。华为在应用商店增加生成式 AI 备案审核,阿里巴巴完善数字指纹比对与关键词拦截,智谱、稀宇、DeepSeek 等平台也加强了内容识别和恶意行为阻断。下一步将聚焦利用 AI 制作虚假信息、暴力低俗、假冒仿冒、侵害未成年人权益及网络水军等问题开展第二阶段整治。行业中央网信办华为阿里巴巴推荐理由:网信办这次动真格了,清理了 600 万条违规信息,下架 1.4 万款产品,连带华为、阿里都加强了审核。想了解 AI 监管风向的可以看。原文稍后读已读值得跟进有用关注 中央网信办
10:12IT之家(博客/媒体)DeepSeek 发布了开源 AI 编程助手 Deep Code,专为 DeepSeek-V4 系列模型适配。该工具支持深度思考和推理强度控制,并具备 Agent Skills。截至最新版本 v0.1.31,它提供终端 CLI 和 VS Code 插件两种使用方式。Deep Code 能结合项目上下文保存会话记录,支持读取文件、修改代码和执行命令,实现连续协作。AI产品DeepSeekDeep CodeDeepSeek-V4推荐理由:DeepSeek 出了个叫 Deep Code 的开源编程助手,专门搭配 V4 模型用,能记对话续任务,改代码跑命令一气呵成。原文稍后读已读值得跟进有用关注 DeepSeek
16:58官方一手pandaily@contact@pandaily.com (Pandaily)72°清华博士Gu Yuxian(近5000引用)加入DeepSeek,将参与即将发布的V4版本。Gu Yuxian曾获清华特等奖学金,其研究在高引论文领域有影响力。DeepSeek V4计划于2026年7月中旬推出,目前团队正进行最终准备。行业DeepSeekGu YuxianDeepSeek V4推荐理由:清华高引学者加入,DeepSeek V4马上要来了,团队实力又强了一截。原文稍后读已读值得跟进有用关注 DeepSeek
09:53官方一手arXiv: DeepSeek@Jian Xu, Delu Zeng, John Paisley, Qibin Zhao论文提出偏差感知贝叶斯主动排名方法,解决LLM裁判偏好冗长、格式和位置效应导致的系统偏差。在16个真实LLM(Llama、Qwen、Phi-4、GPT-4o-mini/5.1/5.5、Gemini、DeepSeek、Claude Haiku/Sonnet/Opus)的基准测试中,朴素聚合在偏差裁判上无法识别正确top-k,而该模型将召回率从约0.5-0.6提升至0.84-1.0。Top-k感知获取规则比循环赛或全局不确定性规则更少比较次数达到相同性能。论文LLMClaudeGPT推荐理由:用贝叶斯方法修LLM当裁判时的废话偏好和位置偏差,实测召回从0.5拉到接近1,比直接投票靠谱多了。原文稍后读已读值得跟进有用关注 LLM
09:46官方一手arXiv: DeepSeek@Gabriel Hurtado精选该论文提出一种无需阈值的审计方法,结合两种内部信号——参考锚定的激活拒绝间隙与基础到候选权重的恢复能量——来检测开放权重检查点是否被剥离拒绝机制。在包含Qwen、DeepSeek-distilled Qwen、Llama和Gemma的273个检查点注册表上,两个信号的z-sum分离了57个公开的abliterations与37个良性微调、合并和指令微调,AUROC达到0.95,显著高于任一单独信号(0.84和0.90)。经Youden校准的阈值在留出族上达到平衡准确率0.89(FPR 0.11),仅漏掉57个中的4个。论文还映射了两种失败模式:伪造参考可无训练规避两个信号,白盒所有者可训练出超过阈值但仍不安全且连贯的检查点。论文QwenDeepSeekLlama推荐理由:想知道模型有没有被偷偷去掉安全护栏?这篇论文用两个内部信号在273个模型上做到95%的准确率,比单信号靠谱多了。原文稍后读已读值得跟进有用关注 Qwen
21:30IT之家(博客/媒体)微软宣布成立微软前沿公司(Microsoft Frontier Company),初期注资25亿美元(约合170亿元人民币),服务联合利华、诺和诺德等客户。新公司将整合微软自研和第三方AI工具(如Anthropic、OpenAI、DeepSeek、Gemini),对接企业数据,成果归客户所有。此前Palantir和亚马逊云科技也有类似布局。微软商用业务总裁承认,三年前绑定单一模型OpenAI是错误,企业需要灵活切换和微调模型的能力。行业微软微软前沿公司Anthropic10 个信源在谈事件专题推荐理由:微软砸25亿美元成立新公司,帮你整合OpenAI、DeepSeek、Gemini等模型,成果归你,不绑定独家。企业客户别错过。原文稍后读已读值得跟进有用关注 微软
20:30官方账号vLLM@vllm_project精选DeepSeek 的 DSpark 投机解码技术现已原生集成到 vLLM 推理框架中。DSpark 是一种半自回归草稿模型,通过非因果滑动窗口注意力并行生成多个 token,单次验证即可保持输出一致,减少解码步数。在 NVIDIA 8×B300 GPU 上,DeepSeek-V4-Pro-DSpark 在 batch size 1 时达到约 250 tokens/s,平均接受长度约 5,且在不同草稿深度下比 MTP 方法接受率高 12-42%。vLLM 通过复用 SparseMLA 后端、捕获完整草稿主干和采样循环到单一 CUDA graph,并支持前缀缓存和 FP8 KV cache。AI模型DeepSeekvLLMDSpark8 个信源在谈事件专题推荐理由:DeepSeek 把 DSpark 开源自带进 vLLM,跑 DeepSeek-V4 实测单卡 250 token/s,比 MTP 快 12-42%,想搞投机解码的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
12:42IT之家(博客/媒体)精选7月2日,美团内部下发通知,要求所有业务团队停止使用豆包大模型,并规划迁移至自研LongCat及DeepSeek等模型,无法迁移需提交原因经单独审批。今年4月,美团已限制阿里云Qwen模型使用,需X3级别审批。LongCat是美团2023年启动研发的大语言模型,最新LongCat-2.0为万亿参数模型(总参数1.6T,平均激活约48B),预训练数据超30T tokens,原生支持1M上下文。该模型基于五万卡国产算力集群训练,已对外开源。行业美团豆包大模型LongCat-2.03 个信源在谈事件专题推荐理由:美团自研LongCat-2.0万亿参数模型来了,内部禁用豆包和Qwen,全面转向自家开源大模型,值得看看。原文稍后读已读值得跟进有用关注 美团
10:13官方一手arXiv: DeepSeek@Zewen Liu该论文提出了EPC(评估者偏好耦合)协议,这是一种RFC风格的标准化协议,用于隔离和测量LLM代理系统中评估者偏好动态的四个阶段。协议包含了执行器和评估器配置、策略与任务设计、TTRL更新规则以及gamma、JSD、ECE、Brier等度量指标的计算方法。同时发布版本化的参考快照v1.0,包含GPT-4o、Qwen、DeepSeek等八个评估器条件的122次独立实验重复测量结果,并标注了版本标识符、API端点与测量日期。该协议、参考快照及实现代码已作为开放基础设施发布,旨在支持第三方复现、跨评估器比较以及检测专有评估器无声更新导致的测量衰减。论文EPCGPT-4oQwen推荐理由:这篇论文搞了个标准协议EPC,专门用来测LLM代理系统里评估器偏好怎么耦合的,还附带了GPT-4o、Qwen、DeepSeek等8个评估器的大规模实测数据,方便你复现和对比。原文稍后读已读值得跟进有用关注 EPC
18:17IT之家(博客/媒体)瑞银分析师与十几位企业IT负责人交流发现,约六成企业已出台管控措施收紧AI开支。词元调用成本成为核心顾虑,Uber运营总监称AI回报率微薄。短期内OpenAI、Anthropic等模型厂商将承受最大压力,而DeepSeek等开源模型和中国本土大模型有望成为受益者。谷歌推出了Gemini 3.5 Flash模型,Anthropic发布了Claude Sonnet 5以降低成本。分析师认为这是“良性调整阵痛”,企业从盲目试水转向高效利用。行业DeepSeekOpenAIAnthropic10 个信源在谈事件专题推荐理由:瑞银说六成公司正在砍AI预算,但DeepSeek这类开源模型反而可能更受欢迎。如果你关心企业怎么省AI开支,这篇报告有具体数据和趋势。原文稍后读已读值得跟进有用关注 DeepSeek
16:07官方一手pandaily@contact@pandaily.com (Pandaily)88°DeepSeek完成70亿美元融资,这是中国AI领域单轮最大融资。资金将用于采购国产AI芯片、扩大团队至5000人,并加速通用人工智能(AGI)研发。该公司计划在2027年前建成10万卡国产算力集群。行业DeepSeek融资国产芯片推荐理由:DeepSeek拿了大钱要搞国产芯片和AGI,这轮融资70亿美元是历史级别的,值得关注。原文稍后读已读值得跟进有用关注 DeepSeek
18:20掘金本周最热@CodeSheepDeepSeek首次公开发布大规模招聘公告,计划将所有部门规模扩大至少一倍,放出7大类33个岗位,所有岗位均接受实习。公告明确不招销售、市场和公关岗位,重心全在研发和产品。团队招聘核心原则为看能力而非经验,强调长期主义、热爱和去KPI化。新成立的Agent Harness团队由90后量化专家崔添翼负责,致力于将大模型能力转化为Agent产品。行业DeepSeek招聘Agent Harness推荐理由:DeepSeek破天荒大规模招人了,所有部门翻倍,33个岗位全收实习,连Agent Harness团队都缺人。想去搞AGI的赶紧看看!原文稍后读已读值得跟进有用关注 DeepSeek