10:26官方一手arXiv: DeepSeek@Marina Lepp, Joosep Kaimre该研究评估了ChatGPT-5.2、DeepSeek-V3、Gemini 2.5 Flash、Claude Sonnet 4.5和M365 Copilot五个生成式AI系统,使用某大学入门OOP课程的编程测试和考试任务。AI生成的代码按与学生相同的评分标准评判,并与历史学生结果及上一年度发现对比。所有AI系统均获得高于学生平均分的成绩,在较长编程任务上常拿满分,但偶尔产生无法编译的代码,在接口、抽象类和部分继承相关任务上仍表现不佳。与上一年度相比,各系统在多数测评中明显进步,但存在若干重复性错误模式。论文ChatGPT-5.2DeepSeek-V3Gemini 2.5 Flash推荐理由:这篇论文拿五个主流AI模型去考大学OOP期末题,结果都比学生平均分高,但抽象类和图形题还是会翻车,想看AI编程能力真实段位的可以读读。原文稍后读已读值得跟进有用关注 ChatGPT-5.2
10:15官方账号arXiv cs.LG@Zewen Jin, Shen Fu, Zeping Duan, Shannon Wang, Weihao Wu, Chengjie Tang, Congkun Ai, Ping Gong, Zijian Dai, Youhui Bai, Cheng LiDeaMoE是一种解码高效混合专家架构,将专家按专业领域分组为部门,同部门专家共享大部分参数,并各自保留少量私有参数。它采用定制两阶段路由策略,避免冗余加载,大幅提升大模型解码效率。相比vanilla MoE,DeaMoE每步加载权重最多减少50.9%,7B模型在A40上端到端TPOT加速1.33倍。在微基准测试中,DeepSeek-V3在A40和H100上分别达到2.00倍和1.97倍的峰值加速。AI模型DeaMoEMoEDeepSeek-V31 个信源在谈事件专题推荐理由:DeaMoE让MoE小批量解码少搬权重、跑得更快,7B模型在A40上TPOT提速33%,DeepSeek-V3加速近2倍。原文稍后读已读值得跟进有用关注 DeaMoE
12:29官方一手arXiv: DeepSeek@Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song论文在专家并行MoE服务中发现,GPU吞吐量并不由token数或激活专家数单独决定:约156-168 token以下是显存权重流主导,以上则按128-tile对M维度取整。据此提出TEMPO调度器,将每批调度建模为固定费用makespan问题,在毫秒级求解;在8卡Testbed A上,相对最优固定基线最多提升15.5%,其余场景差距在1%以内。端到端测试中,Qwen3-235B吞吐提升4-6%、p99延迟降低约15.6%,DeepSeek-V3则未见收益。TEMPO论文强调这是阶段图预测的结果,并非普适胜利。论文TEMPOMoE专家并行推荐理由:如果你在做MoE推理,TEMPO这个调度器在内存/算力瓶颈混合时能比常规方案快15.5%;不过DeepSeek-V3那种通信瓶颈场景它不灵。原文稍后读已读值得跟进有用关注 TEMPO
12:25官方一手arXiv: DeepSeek@Junhao Wei, Yanxiao Li, Haochen Li, Yifu Zhao, Dexing Yao, Baili Lu, Zikun Li, Yapeng Wang, Sio-Kei Im, Dingcheng Yang, Xu Yang精选ARIES-Mission2是一个零样本视觉-语言-动作(VLA)框架,将视觉语义感知与物理路线优化解耦。它用DeepSeek-V3解析自然语言任务,并用Molmo-7B进行零样本目标定位,再通过地理插值将像素坐标转为GPS航点。在UAV-VLPA-nano-30基准上,该框架的飞行距离为62.43公里,比未优化的VLA基线(79.66公里)缩短21.6%,比人工规划(69.00公里)缩短9.5%。30个任务总耗时575.40秒,平均每任务19.18秒,约为人类专家规划速度的3.6倍。其中TSP求解器每任务仅需0.16秒,而VLM推理占据主要耗时。AI模型ARIES-Mission2DeepSeek-V3Molmo-7B推荐理由:这个框架让无人机看卫星图就能自动规划路线,比人工规划快3.6倍,飞行距离还缩短近10%,适合大规模任务。原文稍后读已读值得跟进有用关注 ARIES-Mission2
17:47官方一手arXiv: DeepSeek@Xucheng Yu, Emily Knox, Haohan Wang一项基于40,800组问答的系统实验发现,主流大模型对受限书籍的拒绝率仅为0.07%。实验覆盖400本书、17种提示设计和六大前沿模型,包括Claude Sonnet 4.5、GPT-4o和DeepSeek-V3。模型差异体现在警告语言上,警告率提升8-15个百分点,犹豫标记提升2-5个百分点。提及性内容的频率是最强信号,差距达33-52个百分点。提示框架可让警告率差距变化最多19个百分点。论文Claude Sonnet 4.5GPT-4oDeepSeek-V3推荐理由:这篇论文用四万组问答测了六大模型,发现它们很少拒绝聊敏感书,但会用警告和犹豫来暗示,想了解内容审核现状可以看看。原文稍后读已读值得跟进有用关注 Claude Sonnet 4.5
18:42官方一手arXiv: DeepSeek@Linhao Wu, Yizhou Chen, Zhen Yang, Pengyu Xue, Dan HaoCausalRepair是一个基于对话的自动程序修复框架,通过双切片策略构建最小因果上下文。静态切片净化测试语义,动态切片基于执行轨迹捕获精确运行时依赖。在Defects4J V1.2、V2.0和Defects4J-Trans上使用DeepSeek-V3评估,正确修复313个缺陷,优于ReinFix和TSAPR,平均修复成本降至0.029美元。论文CausalRepairDeepSeek-V3Defects4J推荐理由:想搞LLM自动修bug的可以看看,CausalRepair用双切片把上下文搞干净了,修复数比ReinFix多,成本还低。原文稍后读已读值得跟进有用关注 CausalRepair
12:00官方一手arXiv: DeepSeek@En-Ming Huang, An-Cheng Chang, Bai-Cheng Jeng, Shih-Hao Hung, H. T. Kung混合专家(MoE)推理中专家GEMM的形状随运行时路由分布变化,现有系统使用静态令牌数桶选择融合内核,忽略每专家路由分布。论文提出分布感知框架,结合Effective Experts指标与Dirichlet逆向建模生成可控路由分布,并开发DA-MoE运行时系统,可在GPU上根据路由直方图与离线调优分布匹配选择近最优融合内核,无需CPU-GPU同步。在HumanEval-X服务轨迹上,DA-MoE在DeepSeek-V3和Kimi K2上将几何平均融合MoE延迟分别提升1.16倍和1.29倍,峰值加速达1.40倍和1.56倍。论文DA-MoEDeepSeek-V3Kimi K2推荐理由:论文提出了DA-MoE,根据路由分布动态选最优内核,在DeepSeek-V3和Kimi K2上延迟最高降低56%,做MoE推理的同学可以关注这个优化思路。原文稍后读已读值得跟进有用关注 DA-MoE
11:00elvis@omarsar0精选Google、哈佛、UC Berkeley联合发布JAXBench,包含50个JAX工作负载,基于Llama-3.1、DeepSeek-V3、Mixtral、Mamba-2、AlphaFold2等真实架构。通过Gemini 3 Flash结合TPU文档优化,正确率从5.8%提升到37.3%,解决48个基准,速度提升1.28倍。束搜索进一步提速至1.36倍。研究表明正确率是文档问题,速度是搜索问题。论文JAXBenchGemini 3 FlashTPU推荐理由:Google的新研究发现,给模型喂对TPU文档,比堆参数管用。JAXBench测50个真实负载,结果很实在。原文稍后读已读值得跟进有用关注 JAXBench
23:52官方账号NVIDIA AI@NVIDIAAI83°NVIDIA Blackwell Ultra 在预训练 671B 参数的 DeepSeek-V3 模型上达到每 GPU 1648 TFLOPS 的性能。这一数字约为上一代 GPU 性能的 3 倍。该成果通过 Megatron-Core、TorchTitan 和 JAX 等框架的协同设计与持续软件优化实现。Blackwell Ultra 在该基准测试中刷新了世界纪录。AI模型Blackwell UltraDeepSeek-V3NVIDIA8 个信源在谈事件专题推荐理由:NVIDIA 的 Blackwell Ultra 训练 DeepSeek-V3 671B 比上一代快 3 倍,每 GPU 跑到 1648 TFLOPS,优化太狠了。原文稍后读已读值得跟进有用关注 Blackwell Ultra
11:42官方一手arXiv: DeepSeek@Changzheng Ma精选73°论文揭示Megatron-Core中MLA吸收模式被禁止训练的原因:在DeepSeek-V3规模(n_h=128, seq=16384, SP=8)下,其激活内存比显式形式膨胀20-34%,最高达9.2 GB(eager kernel)或19.2 GB(fused kernel)。该限制在A100上交叉验证,原因在于中间变量维度为n_h×d_kv而非每头K/V。论文提出LAGA方法,在8x Ascend 910B上保持吸收模式的潜变量通信,但本地重建每头K/V:通信削减1.98倍,内存仅增加0.5%,SP=1时位精确,SP=2-8时误差≤1e-3,注意力块吞吐提升1.04-1.06x(单节点)和1.07-1.24x(跨节点)。论文MLAMegatron-CoreLAGA推荐理由:这篇论文解释了为什么Megatron-Core的MLA吸收模式在训练时会导致内存暴增,还给出了一个叫LAGA的修复方法,通信更省,速度和内存几乎没损失。原文稍后读已读值得跟进有用关注 MLA
09:38官方账号arXiv cs.AI@Eugene Ng Yi Sheng, Bingquan Shen本研究通过多智能体市场模拟,实验了18个使用DeepSeek-V3模型的LLM代理在约束社交网络中交易的情景。在200轮实验中比较了8种机制,发现Mediation机制表现最佳。通过迭代优化提示的LLM驱动攻击进行对抗性测试,最强攻击(v6)仅使诚实代理效用降低13.3%,无法导致市场崩溃。研究证实Mediation机制在持续对抗压力下仍能维持市场稳定。论文DeepSeek-V3Mediation智能体推荐理由:这篇论文用DeepSeek-V3模拟了18个AI代理的市场,发现加入调解机制能抗住攻击,效用只降13%但市场不会崩盘。原文稍后读已读值得跟进有用关注 DeepSeek-V3
09:49官方一手arXiv: DeepSeek@Anna ChornaSPLIT基准测试包含500个提示,覆盖压力、恐慌、孤独、内部流离失所和紧张五类。评估了Gemini-2.5-Flash、LLaMA-3.3-70B-Instruct和DeepSeek-V3三个模型。结果显示DeepSeek-V3在转向乌克兰语时保持稳定,而前两个模型性能下降。人类和AI评估者在共情和自然度上弱一致,但在文化基础上分歧明显。研究强调生成乌克兰语文本不等于提供乌克兰语情感支持。论文SPLITGemini-2.5-FlashLLaMA-3.3-70B-Instruct推荐理由:新基准SPLIT专门测LLM跨语言共情,发现DeepSeek-V3在乌克兰语上最稳,文化基础评价人和AI有分歧。原文稍后读已读值得跟进有用关注 SPLIT
09:47官方一手arXiv: DeepSeek@ Yonghui, Huang, Lin Ma, Amjed Tahir, Qian Zhang, Liwen Xiao, Lysa Xiao研究发现,在对六个LLM模型(包括DeepSeek-V3、Llama-3.1-8B等)进行26,016次多轮编程测试中,40%至73%的任务在8轮对话中丢失了之前正确的行为。论文构建了542个基于HumanEval+和MBPP+的任务,并扩展为8轮需求演化链。手动分析384个失败案例后,确定了跨轮冲突是主要失效模式。Verification Gate策略(对先前测试进行新代码验证并回滚重试)能将DeepSeek-V3的最终轮质量从75.8%提升至87.9%,Llama-3.1-8B从31.6%提升至47.3%。论文LLM编程助手回归累积推荐理由:这篇论文揭示了多轮编程时模型容易忘掉之前写对的东西,甚至四成以上任务会翻车。他们发现一个验证门控策略能显著改善,值得做AI编程工具的人看看。原文稍后读已读值得跟进有用关注 LLM
10:06官方一手arXiv: DeepSeek@Yanglin Yan, Zicheng Xie, Tianchen Gao, Rui Pan, Hansheng Wang本文提出一种基于LLM的语义对齐框架,将期刊推荐转化为稿件内容与期刊范围描述的语义匹配问题。该框架无需任务特定训练,可直接利用LLM从标题、摘要、关键词和候选期刊信息中推断适合性。实验使用DeepSeek-V3在49个统计及相关领域期刊的23,609篇文章上进行,Top-3、Top-5和Top-10准确率分别为40.23%、53.67%和70.05%。加入参考文献信息普遍提升推荐性能,重复运行的平均Top-5 Jaccard相似度达84%,且框架能生成可解释的推理输出。论文DeepSeek-V3语义对齐期刊推荐推荐理由:这篇论文用DeepSeek-V3搞期刊推荐,不用训练直接匹配,23,609篇文章上Top-5超53%,比传统方法更灵活还带解释。原文稍后读已读值得跟进有用关注 DeepSeek-V3
12:03官方一手arXiv: DeepSeek@Xiang-Jun Ou, Shuang Liang, Xin-Yu Hu, Rong-Hao Huang, Jing Wang, Shao-Qun Zhang该研究提出一种粒度不确定性分类法,将LLM不确定性归因于输入级、参数级、词元级和解码过程四个源头。研究者将现有21种不确定性量化方法分为贝叶斯、集成、共识和单次推理四类,并在Qwen3、Llama 3.2和DeepSeek-V3三个模型家族上,使用TriviaQA、GSM8K和HumanEval基准进行实验。结果显示,共识方法(Deg和EigV)一致优于其他方法,且更大模型规模与更低不确定性估计相关。该工作为量化LLM不确定性提供了系统诊断工具。论文LLM不确定性量化Qwen31 个信源在谈事件专题推荐理由:这篇论文把LLM不确定性拆成四个层面,测了21种方法在多个基准上的效果,结论是共识方法最稳,模型越大越不模糊。原文稍后读已读值得跟进有用关注 LLM
12:00官方一手arXiv: DeepSeek@Yuhan jiang, Peng Luo, Liqiu Meng精选新基准Lost in Aggregation将迷宫导航分解为Fine(局部通行)、Meso(交叉口拓扑)和Macro(全局方向)三个认知层级。在1050个拓扑标注迷宫(3x3至30x30共7种尺寸、3个难度级别)上评估GPT-4o、DeepSeek-V3和Llama-3.3-70B。结果发现:端到端导航在10x10以上几乎完全失败,但单独测试各层级时模型在30-75%水平。首错分析定位59%失败在Meso层级、39%在Fine层级,全局方向仅1%。层次化规划(仅在交叉口查询LLM、配合显式单元格提示)将GPT-4o在中等尺寸上的成功率提升最多92个百分点,但30x30时又遇到扩展瓶颈。基准代码和迷宫已开源。AI模型Lost in AggregationGPT-4oDeepSeek-V3推荐理由:想知道LLM为什么在导航任务中迷路吗?这个基准把问题拆成三个层级,告诉你59%的锅在交叉口选择,39%在局部感知,方向判断几乎不犯错。对做空间推理的开发者非常有用。原文稍后读已读值得跟进有用关注 Lost in Aggregation
09:24官方一手arXiv: DeepSeek@Serena A. Hoffstedde, Machiko Hirota, Akshara Nadayanur Sathis Kanna, Rihito Kotani, Ujwal Kumar, Gabriele Trovato, Phan Xuan Tan该研究使用60份日本履歴書格式简历、12个基于语言性别信号的名字对,以及Claude Sonnet 4.6、GPT-4o、DeepSeek-V3、Gemini 2.5 Flash、Llama 3.3 70B五个SOTA模型,进行了43200次API调用。交叉随机效应线性混合模型确认所有五个模型均存在显著亲女性偏见。提示级性别中立指令未能有效减少偏见。移除名字几乎完全消除了女性效应,表明名字是主要性别通道。隐私过滤器与GPT-4o安全过滤器的不兼容导致42%的请求被拒绝。论文GPT-4oDeepSeek-V3Claude Sonnet 4.6推荐理由:这篇论文用43200次测试发现,五个主流LLM在日文简历上全有亲女性偏见,改提示没用,删名字才行,看清AI招聘的坑。原文稍后读已读值得跟进有用关注 GPT-4o
07:25IT之家(博客/媒体)83°英伟达在MLPerf Training 6.0七项基准测试中全部夺魁,Blackwell平台成为唯一全覆盖的提交系统。全新GB300 NVL72相比GB200 NVL72同等规模带来1.6倍训练速度提升。CoreWeave使用基于Spectrum-X以太网的GB300 NVL72系统,在8192块GPU规模下将DeepSeek-V3 671B训练耗时缩短至2.02分钟。本次测试首次引入DeepSeek-V3 671B和GPT-OSS-20B两个MoE工作负载,刷新了大规模训练效率纪录。AI模型NVIDIABlackwellDeepSeek-V39 个信源在谈事件专题推荐理由:英伟达Blackwell平台在MLPerf上把DeepSeek-V3 671B训练时间压到2分钟,比上代快60%,性能真狠。原文稍后读已读值得跟进有用关注 NVIDIA
09:42官方一手arXiv: DeepSeek@Yixuan Wang, Yiyang Zhou, Yiming Liang, Congyu Zhang, Fuxiao Liu, Jiawei Zhou, Huaxiu Yao精选72°论文提出ASSAY框架,通过随机遮蔽测量技能库中每个技能的因果贡献,发现个体技能对某些任务类型有帮助但对其他任务有害,全局筛选效果欠佳。ASSAY在AppWorld和tau-bench两个基准上,对DeepSeek-V3、GPT-4.1等7个基础模型进行测试。在AppWorld最难分岔上,DeepSeek-V3达到69.3%任务目标完成率,相对提升47.4%,超越所有已发表方法包括权重微调方法。在tau-bench零售环境中,GPT-4.1相对提升8.7%,超越o4-mini、o1和GPT-4.5。消融实验表明主要增益来自推理时按任务遮蔽技能,而非全局移除坏技能。论文ASSAYDeepSeek-V3GPT-4.1推荐理由:一篇教你如何让AI智能体更聪明的研究:不用改权重,光靠整理技能库就能让DeepSeek-V3和GPT-4.1冲上榜单第一,方法还开源了。原文稍后读已读值得跟进有用关注 ASSAY
09:46官方一手arXiv: DeepSeek@Xu-Jing Ye, Yuan-Gen Wang, Ruping WangL-VARC是一种新框架,通过语言引导的LUPI分支增强视觉推理,解决ARC任务中纯语言模型参数大、纯视觉模型过拟合的问题。它利用DeepSeek-V3压缩语义,用CLIP对齐视觉与语义特征,训练后丢弃语言分支,仅保留18M参数的轻量模型。实验表明,L-VARC在ARC任务上超越现有最佳方法,代码已开源。论文视觉推理ARCLUPI推荐理由:ARC是AGI的关键测试,L-VARC用语言引导视觉推理,18M参数就能超越SOTA,做视觉推理或小模型研究的开发者值得一试。原文稍后读已读值得跟进有用关注 视觉推理
10:11官方一手arXiv: DeepSeek@Megan Frisella, Shubham Tiwari, Andy Ruan, Yi Pan, Parker Gustafson, Mat Jacob, Gilbert Bernstein, Stephanie Wang精选Piper 是一种用户可控的分布式训练系统,通过将训练策略与运行时实现解耦,解决了现有系统难以适应新策略或集成先进策略的问题。用户只需通过少量模型注释和调度指令声明训练策略,系统自动编译为设备执行计划。Piper 使用统一中间表示(IR)表示所有计算和通信,支持数据、流水线、专家并行及 ZeRO 等优化。实验表明,Piper 在常见策略上保持性能,同时通过联合调度计算和通信(如 DeepSeek-V3 的 DualPipe)实现额外性能与内存效率提升。论文分布式训练并行策略中间表示推荐理由:Piper 解决了分布式训练中策略与实现绑定的痛点,做大规模模型训练或并行策略研究的开发者可以直接用这套框架灵活组合新策略,省去手动调优的麻烦。原文稍后读已读值得跟进有用关注 分布式训练
12:38官方一手arXiv: DeepSeek@Ali Şenol, Garima Agrawal, Huan Liu精选当前LLM评估主要依赖最终答案正确率,忽略了推理过程的质量。本研究提出一个多维度行为框架,从正确性、一致性、鲁棒性、逻辑连贯性、效率和稳定性六个维度衡量推理质量。实验发现,逻辑连贯性与正确性正交(r=-0.172),即正确答案可能来自不连贯推理。该框架还暴露了排名反转:DeepSeek-V3在准确率优先下排名第二,但在法律/合规权重下排名第五。该框架为模型部署决策提供了更全面的信号,特别适用于需要审计推理过程的场景。论文推理模型评估框架逻辑连贯性推荐理由:这个框架解决了「只看答案正确率」的评估盲区,做模型选型或合规审计的团队会发现,原来高分模型可能推理过程一团糟——建议点开看看你的模型在哪个维度翻车。原文稍后读已读值得跟进有用关注 推理模型