6月18日
09:21
09:21官方一手arXiv: DeepSeek@Yifu Ding, Jiacheng Wang, Ge Yang, Yongcheng Jing, Jinyang Guo, Xianglong Liu, Dacheng Tao
精选
该论文针对混合专家(MoE)模型部署时内存和推理开销大的问题,提出一种结构剪枝框架。方法将剪枝比率分配转化为通道分数覆盖最大化问题,通过归因近似高效求解。在DeepSeek和Qwen MoE模型上实验,结合4-bit量化后,50%或25%结构化剪枝仍保持模型准确率。在Qwen3-30B-A3B上,内存占用减少5.27倍,优于现有基线。
推荐理由:想省显存又怕掉精度?这篇论文用通道级剪枝加4-bit量化,把MoE模型体积砍到1/5还能保住性能,DeepSeek和Qwen都能用。
00:35
00:35Geek@geekbb
从2022年期待本地运行ChatGPT-3.5,到2026年DeepSeek、Qwen、GLM、Kimi每月发布旗舰模型。本地部署模型列表包括GLM-4、DeepSeek R1/V3、Qwen3、Kimi-K2、GPT-oss-120b、Qwen3.7-Plus、Kimi-K2.7、Deepseek-V4、GLM-5.2等九个版本。迭代速度远超预期,社区感叹没有尽头。
推荐理由:这帖子把2022到2026国产模型进化史盘得清清楚楚,DeepSeek、Qwen、GLM、Kimi每月一个旗舰,本地部署清单都快十个版本了,AI发烧友必看。
6月17日
09:55
09:31
09:31官方一手arXiv: DeepSeek@Esteban Schafir, Xu Zheng, Hojat Allah Salehi, Zhuomin Chen, Mo Sha, Wei Cheng, Dongsheng Luo
精选
DecoSearch是一个无需训练的Text-to-SQL框架,通过轻量级Schema Selector修剪数据库模式,LLM Judger判断查询是否需要分解为DAG子问题。在BIRD上达到70.53%执行准确率,在Spider上达88.31%,使用DeepSeek作为骨干模型,比训练无关基线消耗少一个数量级的token。该方法还可作为模型无关包装器,一致提升微调后的SQL生成骨干性能。
推荐理由:DecoSearch不用训练就能把自然语言转SQL,在BIRD和Spider上准确率分别超70%和88%,比同类方法省十倍token。想提升SQL生成效率可以看看。
09:31
09:31官方一手arXiv: DeepSeek@Siyue Chen, Yifu Guo, Yuquan Lu, Zishan Xu, Jiaye Lin, Jianbo Lin, Siyu Zhang, Cheng Yang, Junxin Li, Yujia Li, Yu Huo, Ruixuan Wang
该论文提出了LLM代码推理的内部生命周期概念:模型先在早期层中酝酿答案,使其线性可解,然后在后期层分化为四种解析结果——已解析、过度处理、错误解析、未解析。研究对Qwen、Llama、DeepSeek三个架构的16个模型进行了6类代码推理任务的层析探针和上下文剥离解码(CSD)实验。结果显示已解析平均仅41.5%,且函数调用任务中,调用深度从1层增至3层时已解析率从61.1%骤降至2.5%。所有模型的酝酿持续时长稳定在24%-42%,但解析成功率随模型能力和规模变化。
推荐理由:这篇论文用层析探针找到了LLM做代码推理时“酝酿”到“解析”的秘密,发现即便准确率相近,内部失败模式也截然不同,值得想理解推理本质的人读。
03:38
6月16日
18:28
18:28官方账号Decoder@Jonathan Kemper
73°
中国AI初创公司DeepSeek在首次外部融资轮中筹集超过50亿人民币(约7.4亿美元),公司估值达到500亿美元。这是DeepSeek首次接受外部投资,此前主要依赖内部资金。该轮融资由多家机构参与,显示出市场对DeepSeek技术实力的认可。

推荐理由:DeepSeek第一次拿外部钱,融了74亿美元,估值冲到500亿,看看这家中国AI新势力怎么做到。
10:47
10:47官方一手arXiv: DeepSeek@Haolong Qian, Xianliang Yang, Yinuo ma, Lirong Che, Feng Lu, Ye Guo, Lei Song, Jiang Bian, Chun Yuan
论文在Qwen2.5、LLaMA-3和DeepSeek三个系列上发现:用小模型自身生成并通过拒绝采样选取的轨迹,比用更强Oracle模型精炼的高奖励数据,能更有效提升数学推理。Oracle精炼虽修复逻辑,但引入分布偏移,增加小模型适应成本,抵消了逻辑改进的收益。作者提出风格对齐精炼(Style-Aligned Refinement),保留小模型原生轨迹风格同时融入Oracle逻辑修复,降低适应成本并恢复下游效用。该发现挑战了数学推理蒸馏中依赖奖励模型分数选择数据的常规做法。
推荐理由:这篇论文揭穿了一个直觉错误:你以为给小白模型喂“学霸笔记”能变强,结果效果还不如它自己瞎写的解题草稿。原因是学霸的思路和它不匹配,硬学反而费劲。
6月12日
15:57
15:57官方一手pandaily@contact@pandaily.com (Pandaily)
五款中国AI助手——豆包、通义千问、DeepSeek、Kimi和联想天禧——在2026年世界杯预测中展开了一场非传统对决,各自被赋予独特的‘球迷人格’,结果差异巨大。豆包采用玄学预测,DeepSeek押注黑马,通义千问则依赖数据分析。这场实验展示了不同AI在预测任务中的风格差异,也揭示了AI在体育预测中的局限性和趣味性。

推荐理由:想看看AI怎么用不同风格预测世界杯?做体育数据分析或AI应用开发的团队,点开看看豆包的玄学、DeepSeek的黑马和通义千问的数据流,会有启发。
6月11日
6月9日
09:53
09:53官方一手pandaily@contact@pandaily.com (Pandaily)
DeepSeek 在 5 月录得 5.41 亿月访问量,继续稳居中国 AI 产品榜首。与此同时,百度在搜索、长内容及对话式 AI 领域的多个产品出现明显复苏迹象。这一数据表明中国 AI 市场竞争格局正在变化,DeepSeek 保持领先,而传统巨头百度正通过 AI 整合重新夺回用户。

推荐理由:中国 AI 产品月活排名洗牌,DeepSeek 持续领跑,百度 AI 产品回暖值得关注——做市场分析或关注国内 AI 竞争格局的读者可以点开看看具体数据。
09:52
09:52官方一手pandaily@contact@pandaily.com (Pandaily)
宁德时代(CATL)已投资DeepSeek的首轮融资,标志着这家电池巨头正式进军AI领域。创始人曾毓群正将战略重心转向AI数据中心能源基础设施,已投入超过10亿美元用于AIDC(AI数据中心)相关投资。此举将电池制造与AI算力需求结合,为能源与AI的融合开辟新路径。

推荐理由:CATL投资DeepSeek意味着电池巨头开始押注AI能源基础设施,做AI基础设施或能源管理的从业者值得关注这一跨界动向。
6月5日
19:26
12:07
12:07官方账号arXiv cs.AI@Jui-Hui Chung, Ziyang Cai, Zihao Li, Qishuo Yin, Rohit Agarwal, Simon Park, Rodrigo Porto, Narutatsu Ri, Ziran Yang, Shange Tang, Xingyu Dang, Hongzhou Lin, Mengdi Wang, Danqi Chen, Chi Jin, Liam H Fowl, Sanjeev Arora
精选83°
Goedel-Architect 是一个基于 Lean 4 的智能体框架,通过生成和精炼“蓝图”(定义和引理的依赖图)来简化形式化定理证明。它先根据自然语言证明生成蓝图,然后并行证明每个引理节点,失败节点会驱动全局蓝图精炼,避免了传统递归分解的低效循环。使用开源模型 DeepSeek-V4-Flash 作为骨干,在 MiniF2F-test 上达到 99.2% pass@1,在 PutnamBench 上达到 75.6% pass@1。结合自然语言证明引导,可解决更难的题目,如 IMO 2025 的 4/6 和 Putnam 2025 的 11/12。该框架在开源管道中实现了最先进性能,且成本比同类开源方案低 500 倍。
事件专题

推荐理由:形式化定理证明一直门槛高、成本高,Goedel-Architect 用蓝图+精炼策略大幅提升效率,做数学证明或形式化验证的团队值得关注,开源且成本极低。
6月3日
11:49
11:49Geek@geekbb
精选
Ore Code 是一款专为 DeepSeek 设计的桌面端 AI 编码工作台,支持 macOS 和 Windows。它聚焦长上下文编码、结构化工具调用、本地项目上下文理解,并集成了 MCP 协议、技能和自动化功能。该项目已在 GitHub 开源,旨在为开发者提供更高效的 AI 辅助编程体验。
事件专题

推荐理由:如果你在用 DeepSeek 做编码,Ore Code 把长上下文、工具调用和项目上下文整合到了桌面端,省去来回切换的麻烦,做 AI 编程的开发者可以直接下载试试。