朋友,这篇论文挺有意思的,作者发现用循环结构(looping)来改写模型架构,能显著提升计算效率。比如他们用7.4B模型就达到了GPT-3 13B的性能,但算力只用了1/20,这个方法挺有启发性的。
#计算效率
共 15 条 · 7 天 0 条 · 30 天 1 条
信息流里打上「计算效率」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月17日
研究显示循环结构可改变模型缩放指数,提升计算效率
9月7日
9月2日
9月1日
LoGo: Token-Level Dynamic Local-Global Attention
LoGo让模型智能决定哪些token需要全局注意力,大幅提升长文本处理效率,比传统Transformer更聪明。
8月26日
7月18日
6月19日
Anjney Midha:GPU利用率95%即“故障”,AI竞争进入计算网格时代
想知道为什么买更多 GPU 不灵了?Anthropic 是怎么靠文化和准备搞定编码的?AMP 创始人讲得特别透,全是内行视角的干货。
6月18日
6月12日
Pythagoras-Prover:高效形式化证明,4B模型超越DeepSeek-Prover-V2-671B
形式化证明领域终于有了计算高效的实用方案——4B 模型就能超越 671B 巨无霸,做定理证明或形式化验证的团队可以直接用,省下大量算力成本。
Llama小模型训练动力学研究:固定Token预算下性能先升后降
这篇论文戳破了「更多Token=更好模型」的直觉,做小模型训练或资源受限场景的开发者会看到训练轨迹比终点指标更关键,建议点开看看如何用间隔遥测避免白费算力。
6月8日
论文10:35
Sgatlin:稀疏门控线性专家提升Transformer计算效率与可解释性这项研究用极简设计同时提升了Transformer的计算效率和可解释性,做模型压缩或可解释性研究的团队值得关注,尤其是对MoE稀疏化方向感兴趣的开发者可以看看。
6月2日
论文12:02
PINN残差引导自适应网格细化,提升有限差分求解器效率做偏微分方程数值模拟的团队,可以用PINN残差替代传统误差估计器来指导网格自适应,显著节省计算资源——60个自由度就能达到192个自由度的精度,值得在工程仿真中试试。
5月29日
5月21日