11:26官方账号arXiv cs.LG@Anubhav Lakra, Yue FengCACHE-UK是一种针对量化金融大模型的稳定性感知记忆编辑框架。它在4-bit量化的OpenLLaMA-3B上,使用rank-1 LoRA扰动将编辑限制在低秩适配器子空间,并引入金融领域优先级模块和闭环稳定性控制器。在包含88,021篇英国金融文档的语料上,CACHE-UK将知识退化相对降低11-17%,测试泛化率达28%,比最强适配基线高6个百分点。绝对泛化率仍然较低。论文CACHE-UKOpenLLaMA-3B4-bit量化推荐理由:CACHE-UK给量化小模型做连续记忆编辑,在4-bit下比现有方法少掉11-17%的知识,泛化率还高6个点。原文稍后读已读值得跟进有用关注 CACHE-UK
16:38官方一手Hugging Face: Blog(博客/媒体)精选Hugging Face 宣布将 Nunchaku 推理引擎集成到 Diffusers 库,支持 4-bit 量化扩散模型。开发者可以直接用 Diffusers API 加载 Nunchaku 格式的模型。该方案能将模型显存占用降低约 75%,同时保持生成质量。目前主要适配 Stable Diffusion 系列模型。AI产品NunchakuDiffusersHugging Face推荐理由:Hugging Face 把 Nunchaku 的 4-bit 量化推理直接塞进 Diffusers 了,以后用 SD 省一半显存,笔记本也能跑。原文稍后读已读值得跟进有用关注 Nunchaku
12:51官方账号Cohere@cohere精选Cohere宣布其首个开源智能体编码模型的4-bit量化版本已可用。该量化版模型体积显著缩小,可在Mac上本地运行。用户可通过链接获取模型权重。此次发布使得开发者能够更便捷地在个人设备上运行智能体编码模型。AI模型Cohere4-bit量化智能体推荐理由:Cohere把自己最新的编程智能体模型压缩到4-bit,Mac上就能跑,本地开发效率直接拉满!原文稍后读已读值得跟进有用关注 Cohere
00:47berryxia@berryxia88°NVIDIA研究员Yukang Chen开源了LongLive 2.0,这是全球首个端到端支持4-bit量化的超长视频生成基础设施,覆盖训练和推理全流程。核心技术包括FP4量化和并行加速,在5B模型上实现45.7 FPS的实时生成速度。该工具支持真实视频训练、few-step蒸馏、多shot训练/推理、序列并行、NVFP4 KV cache和异步VAE解码部署。此前长视频生成面临速度慢或长度受限的问题,LongLive 2.0将4-bit长视频实时生成能力推向开源社区。AI产品NVIDIALongLive 2.04-bit量化2 个信源在谈事件专题推荐理由:做视频生成或AI基础设施的开发者终于有了一个能跑长视频的4-bit开源方案,NVIDIA把训练到推理的整套加速打法打包好了,建议直接试代码。原文稍后读已读值得跟进有用关注 NVIDIA