模型Agent 与开发者00:26韩国Upstage发布Solar Mini 4模型Upstage的Solar Mini 4虽参数量大但激活参数少,性能介于Qwen 3.6和3.8之间,专为自动化任务设计。#Solar Mini 4#Upstage#Qwen#韩国AIGorden Sun@Gorden_Sun原文稍后读已读值得跟进有用关注 Solar Mini 4
论文Agent 与开发者10:21LoopCD提升循环Transformer解码效率LoopCD让循环Transformer在不增加计算成本的情况下大幅提升解码质量,还能减少计算量。#LoopCD#Looped Transformers#对比解码#参数效率1 个信源在谈事件专题aarXiv cs.LG@Weihao Liu 等 8 人2 个信源在谈原文稍后读已读值得跟进有用关注 LoopCD
模型Agent 与开发者12:40Looped Diffusion Transformer研究发布OpenAI团队发布Looped-DiT,260M参数模型性能超越6.5倍大模型,计算效率提升4.9倍。#Looped-DiT#Diffusion Transformer#文本到图像#推理模型aarXiv cs.LG@Yong Xien Chng 等 10 人原文稍后读已读值得跟进有用关注 Looped-DiT
论文Agent 与开发者精选73°09:36RiLM: 通过测地线解码实现高效语言建模研究人员提出RiLM模型,用测地线解码替代传统输出层,小模型性能翻倍。#RiLM#语言模型#参数效率#测地线解码aarXiv cs.AI@Fang Li原文稍后读已读值得跟进有用关注 RiLM
模型Agent 与开发者78°22:52Ox Alpha模型实为Zai的GLM-5.3-FlashZai的GLM-5.3-Flash模型就是之前爆火的Ox Alpha,320B参数但成本仅0.09美元,还用国产硬件跑通了。#GLM-5.3-Flash#Zai#Ox Alpha#开源模型DeepLearning.AI@DeepLearningAI原文稍后读已读值得跟进有用关注 GLM-5.3-Flash
论文精选73°10:11LRNBA神经网络压缩框架发布MIT团队发布LRNBA框架,用共享神经基压缩网络,参数相同下网络更深更宽,训练更稳定。#LRNBA#神经网络压缩#参数效率#RNNaarXiv cs.LG@Binshuai Wang原文稍后读已读值得跟进有用关注 LRNBA
模型中美对照13:49Qwen3.8-27B 模型展现强大能力阿里发布的 Qwen3.8-27B 虽参数量不大,但在笔记本就能跑出惊艳效果,10个案例展示实际能力。#Qwen3.8-27B#开源模型#参数效率#基准测试AI Will@FinanceYF5原文稍后读已读值得跟进有用关注 Qwen3.8-27B
论文17:41HYDRA:KAN的双曲动态表示架构这篇论文提出HYDRA,给KAN“减负”,参数更省还不掉点,双曲空间让表示更可解释。做KAN相关研究的可以看看。#HYDRA#KAN#双曲空间#参数效率aarXiv cs.LG@Zhao Su 等 7 人原文稍后读已读值得跟进有用关注 HYDRA
论文12:02QFedAgent:量子增强的个性化联邦学习用于多智能体活动识别这篇论文用72个量子参数做融合,比经典方法少30倍,准确率还97.7%,适合关注联邦学习参数效率的人。#QFedAgent#联邦学习#量子电路#活动识别aarXiv cs.LG@Quoc Bao Phan, Tuy Tan Nguyen原文稍后读已读值得跟进有用关注 QFedAgent
论文精选10:45Looped World Models:循环架构实现100倍参数效率的世界模型这篇论文用循环架构解决了世界模型长程预测的计算瓶颈,参数省了100倍还能自适应深度,做仿真和规划的研究者值得看。#LoopWM#世界模型#循环架构#参数效率aarXiv cs.AI@Hongyuan Adam Lu 等 31 人原文稍后读已读值得跟进有用关注 LoopWM