AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:香农容量×
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
5月25日
11:12
11:12arXiv cs.AI@Xu Ouyang, Deyi Liu, Yuhang Cai, Jing Liu, Yuan Yang, Chen Zheng, Thomas Hartvigsen, Yiyuan Ma
精选
现有的大语言模型缩放定律(如单调幂律)无法解释灾难性过训练和量化退化等非单调现象。研究者提出香农缩放定律,将LLM训练建模为噪声信道上的信息传输,基于香农-哈特利定理,将模型参数映射为信道带宽,训练token映射为信号功率。该理论揭示了LLM的香农容量:若缩放模型或数据时未保持足够信噪比,噪声放大将导致性能从单调提升转为U形退化。在Pythia和OLMo2上的实验验证了该定律,其预测准确率优于经典缩放定律,并能外推到未见模型。
论文缩放定律香农容量噪声信道LLM训练理论框架

推荐理由:香农缩放定律统一解释了LLM训练中的非单调退化现象,做模型缩放和训练优化的研究者可以直接用这个框架预测性能拐点,避免盲目增加计算量。
原文
精选全部日报登录