10:14官方一手Pandaily@contact@pandaily.com (Pandaily)精选iFLYTEK承认国内加速器在长文本训练上落后Nvidia H200达5倍,转而优化架构、算子、内存和框架,以华为Ascend 910B上的Spark X2-Flash证明方法。AI模型iFLYTEK架构优化算力限制6 个信源在谈事件专题推荐理由:iFLYTEK用Spark X2-Flash在华为Ascend 910B上优化架构,应对算力限制,值得看看他们的解决方案。原文稍后读已读值得跟进有用关注 iFLYTEK
11:39官方账号arXiv cs.LG@Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne LiuRecirculation技术为现成基础模型提供推理时架构增强,在Gemma3系列上实现困惑度降低23%。该方法在生成过程中几乎不增加延迟,但在预填充阶段需要串行处理。自适应变体在冻结原始模型权重的同时仅需轻微调整超参数,在GSM8k基准测试上准确率提高21%。该技术通过利用模型自身特性指导架构修改,实现了训练-free的显著性能提升。论文RecirculationGemma3推理模型1 个信源在谈事件专题推荐理由:研究人员提出Recirculation技术,让Gemma3模型困惑度降23%,准确率提21%,还不增加推理延迟。原文稍后读已读值得跟进有用关注 Recirculation
10:45官方账号arXiv cs.AI@Sajad Movahedi, Vera Milovanović, Shlomo Libo Feigin, Alexander Theus, Thomas Hofmann, Valentina Boeva, T. Konstantin Rusch, Antonio Orvieto循环架构通过循环利用层数为组合推理任务提供逐步推理的归纳偏置。随着循环深度增加,信号传播问题加剧,影响模型性能。本文提出FPRM,一种基于Transformer的固定点推理模型,采用预归一化层和残差缩放解决信号传播,并以固定点收敛作为端到端停止机制。FPRM在Sudoku、Maze、状态跟踪和ARC-AGI基准上验证了有效性。论文FPRMTransformer固定点推理推荐理由:这篇论文提出了FPRM,用固定点收敛让循环推理深度自适应任务难度,在Sudoku和ARC-AGI上效果不错,适合关注推理架构的人。原文稍后读已读值得跟进有用关注 FPRM
01:25berryxia@berryxia精选73°Sebastian Raschka发布《Recent Developments in LLM Architectures》,用可视化方式拆解Gemma 4到DeepSeek V4的硬核优化。文章指出长上下文瓶颈已从“能否支持更多token”转向“如何聪明分配计算”,这些优化已在生产环境落地。正在做长上下文模型、Agent或RAG的团队,这篇文章的视觉图和效率对比特别值得细读。论文长上下文架构优化Gemma 41 个信源在谈事件专题推荐理由:长上下文竞争已从堆token转向架构优化,做Agent或RAG的团队可以从Gemma 4到DeepSeek V4的真实方案中直接借鉴效率提升思路。原文稍后读已读值得跟进有用关注 长上下文