14:49官方账号Latent Space (swyx)(博客/媒体)Muse推出Glimmer和Spark两款开源权重模型,主打个人超级智能。Glimmer可在单张RTX 3090上运行,降低了本地部署门槛。Spark定位更高性能,面向更复杂任务。此举被视为美国开源模型阵营的一次小胜。AI模型MuseGlimmerSpark推荐理由:Muse开源了Glimmer和Spark,Glimmer一张3090就能跑,想本地玩大模型的可以看看。原文稍后读已读值得跟进有用关注 Muse
11:11官方账号arXiv cs.LG@Ali Asaria, Tony Salomone, Deep Gandhi精选论文发现消费级Ampere GPU上扩散Transformer的INT8量化常因反量化回bf16而无法利用INT8张量核心。作者为Ideogram 4.0线性层设计了一个融合Triton INT8 GEMM内核,在Ampere张量核心上执行int8×int8→int32,并在epilogue中折叠逐token×逐通道反量化和偏置。该内核实现2.8-4.2倍于bf16的GEMM加速,并保持余弦相似度1.0且无NaN。端到端测试中,在单张RTX 3090上768px分辨率获得约9-10%提速,1024px生成耗时156.5秒,优于NF4(164.5秒)和FP8(172.9秒)基线,且PickScore/CLIPScore无质量损失。论文Ideogram 4.0RTX 3090INT82 个信源在谈事件专题推荐理由:INT8反超FP8,单卡RTX 3090跑1024px扩散模型原文稍后读已读值得跟进有用关注 Ideogram 4.0