17:32官方账号阿里通义 Qwen@Alibaba_Qwen精选Qwen3.8-27B现可在笔记本上本地运行,Atomic Chat发布了Dynamic GGUF量化版本。量化范围从8位(28.9GB)到1位(8.5GB)。其中AD-IQ3_S能在16GB MacBook Air上运行,与BF16原版有92.4%的token一致性。该模型已开始融入工作和日常生活。AI模型Qwen3.8-27BAtomic Chat量化6 个信源在谈事件专题推荐理由:阿里官方转发,Atomic Chat把Qwen3.8-27B量化到1位,8.5GB就能跑,16GB MacBook Air上还能保持92.4%的一致性。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
01:59官方账号阿里通义 Qwen@Alibaba_QwenQwen3.8-27B 是阿里 Qwen 团队的新模型,Unsloth 已支持其在 17GB 内存下通过 Dynamic GGUF 格式本地运行。Unsloth 还上传了 NVFP4 量化版本,模型文件已发布到 Hugging Face 的 unsloth/Qwen3 仓库。官方称该模型在同尺寸中表现最强,但原文没有给出具体基准分数。用户可以参考 Unsloth 文档中的运行指南来部署。AI模型Qwen3.8-27BUnslothQwen4 个信源在谈事件专题推荐理由:Qwen3.8-27B 现在靠 Unsloth 动态量化,17GB 内存就能跑,还有 NVFP4 量化版,适合本地尝鲜。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
17:47官方账号arXiv cs.LG@Junyi Ye, Ivy Gateri Wanjiku该论文系统研究了后训练量化(PTQ)中激活值校准对S&P 500横截面波动率预测的影响,涵盖7种神经网络架构、8个walk-forward测试年(2018-2025)和560个训练模型。结果显示,8比特下校准影响很小,但4比特时校准成为预测性能的主要决定因素。在默认abs-max校准下,静态4比特量化权重和激活值会使受影响架构的全精度平均信息系数损失11-62%。改用百分位校准可恢复四种受影响最严重架构中53-94%的退化。论文指出激活值校准是金融预测中可靠4比特PTQ的一级部署决策,剩余退化严重时可选用8比特激活值或仅权重4比特量化。论文PTQ量化金融预测推荐理由:论文用560个模型实测了4比特量化在S&P 500波动率预测上的效果,发现校准方式能决定性能好坏,做量化部署的可以看看。原文稍后读已读值得跟进有用关注 PTQ
17:44官方账号arXiv cs.LG@Zhiqiang Que, Chang Sun, Haiyang Wang, Dinesh Pamunuwa, Roshan Weerasekera, Qijia Tang, Bakhtiar Zadeh, Wayne Luk, Maria SpiropuluFQTree是一种针对提升决策树(BDT)的细粒度量化感知训练算法,配套QXGB框架可自动生成低延迟硬件实现。它采用硬件导向的叶值量化方案,结合全局量化步长与树级移位,实现紧凑的非负整数叶表示、受控裁剪和偏差折叠。该量化在训练过程中逐步应用,使后续树能适应已量化集成模型的误差。在JSC、MNIST和NID数据集上,相比现有FPGA BDT设计,FQTree将LUT使用量减少26%至57%,同时保持或提升准确率。AI模型FQTreeQXGB决策树推荐理由:FQTree把提升决策树的量化做到硬件级,在FPGA上能省26-57%查找表,精度还不掉,做边缘部署的可以看看。原文稍后读已读值得跟进有用关注 FQTree
18:10官方账号arXiv cs.LG@He-Yen Hsieh, H. T. KungReRound是一种后训练量化方法,针对标准RTN在量化接近区间中点的权重时固有的中点模糊性问题。它训练一个条件扩散模型生成低比特权重的连续重建,作为确定舍入方向的引导信号。ReRound引入容差度量,对中点附近权重用扩散重建,对边界附近权重用RTN,并通过扫描容差参数选择与原始全精度权重奇异值最匹配的候选。在3比特和4比特量化下,ReRound在小型LLM上持续优于RTN,且精度超过多种无校准方法,与依赖校准的方法相当,推理时无额外开销。该方法适用于LLM之外的AI模型,论文聚焦于小型LLM。论文ReRound量化扩散模型推荐理由:如果你在做低比特量化,ReRound用扩散模型解决RTN的中点模糊,3/4比特下比RTN更准,还不用校准数据,值得看看。原文稍后读已读值得跟进有用关注 ReRound
10:49官方一手arXiv: DeepSeek@Matteo Grella精选PTQTP将LLM权重矩阵分解为两个三元平面,本研究首次将尺度比固定为3的约束引入其求解器,使分解坍缩为统一九级量化器。两个三元平面无损折叠为4位码平面,作为持久服务表示,磁盘字节、专家缓存和内核输入均为4.0625位/权重块。该方法应用于DeepSeek-V4-Flash-0731的284B-A13B MoE模型,在64GB笔记本上从MXFP4权重一次性量化并流式加载专家。与4.5位Q4_K基线相比,在5/5测试中匹配官方API(Q4_K为4/5),MMLU子集得分86对84,解码速度快6.7%,文件小9%。尽管权重重建误差和困惑度更高,但参考保真度无显著差异。论文PTQTPDeepSeek-V4MoE推荐理由:这篇论文把PTQTP量化器约束成九级格式,在DeepSeek-V4上做到和官方API几乎一样准,还快6.7%、文件小9%,适合搞MoE推理优化的朋友看。原文稍后读已读值得跟进有用关注 PTQTP
11:16AI Engineer@aiDotEngineer71°Qwen 27B在RTX 3090上超过了21个月前发布的Llama 405B。GLM 5.2通过保护超权重,从1.5TB压缩到250GB。Cognition用前沿模型规划、廉价模型执行,将Fable级智能成本降低40%。OpenRouter的自动路由在两年后因openclaw的十分钟心跳找到用途。EXO Labs与NVIDIA合作三周,让DGX Spark提速10倍。AI模型QwenLlamaGLM 5.24 个信源在谈事件专题推荐理由:本地AI真的起来了,27B的Qwen能打赢405B的Llama,GLM 5.2还能压到250GB,普通显卡就能跑。原文稍后读已读值得跟进有用关注 Qwen
06:38Latent.Space@latentspacepod精选在latent.space的推理工程大师课中,Baseten的Philip Kiely与@waterloo_intern讲解了模型训练后如何变成快速可靠的产品。他们指出量化误差可以相互抵消,从而解锁更高吞吐量。推理团队目前仍能挖掘20%–200%的性能增益。视频生成面临二次注意力扩展的瓶颈。GLM-5.2还使用自身重写并优化了服务自己的GPU内核。技巧GLM-5.2Baseten推理优化推荐理由:Baseten工程师讲推理优化,量化误差能抵消,GLM-5.2自己优化自己,还有20-200%提速空间。原文稍后读已读值得跟进有用关注 GLM-5.2
11:31官方账号arXiv cs.LG@Idan Roth, Lutz LampeGQ-FSL在联邦分割学习(FSL)中引入随机量化,对客户端和服务器的子模型使用非对称精度,从而解耦设备能耗与全局收敛损失。该方法建立了参数化能耗模型,并推导了数据异构下的理论收敛界。通过联合优化DNN分割点和精度级别,GQ-FSL在满足准确率约束的前提下最小化总系统能耗。实验显示,相比量化联邦学习和全精度FSL,GQ-FSL显著提升能效,支持在资源受限设备上部署大型DNN。论文GQ-FSL联邦学习量化推荐理由:这个新框架把联邦学习和分割学习结合起来,用量化省电,还能控制精度,比传统方法更适合手机这类设备跑大模型。原文稍后读已读值得跟进有用关注 GQ-FSL
12:32官方账号arXiv cs.LG@Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar FarukMixFrag提出一种面向视觉Transformer的脆弱性引导混合精度训练后量化框架。它通过计算全精度与量化输出分布的KL散度来估计各组件量化脆弱性,并将位宽分配建模为多选择背包问题。在ImageNet-1K上,MixFrag在多种ViT架构下取得有竞争力的分类精度。在COCO目标检测与实例分割任务中,MixFrag在MP3/MP3设置下比此前最优方法提升高达9.6 AP。论文MixFrag量化视觉Transformer推荐理由:MixFrag用KL散度定位模型里对量化最敏感的部分,再把位宽分配变成背包问题。在COCO上比之前最好的混合精度PTQ方法涨了9.6 AP,跑ViT的可以看看。原文稍后读已读值得跟进有用关注 MixFrag
11:47向阳乔木@vista8量化技术通过将模型权重从 fp16 或 fp32 转换为 int4 或 int8 精度,可大幅降低显存占用。例如,int4 量化能将 70B 参数模型从约 140GB 显存降至约 35GB。int8 量化在保持较高精度的同时,显存消耗减少约 50%。该技术让消费级 GPU 也能运行大规模模型。技巧量化int4int8推荐理由:刚学 AI 的赶紧看这条,int4/int8 量化能帮你省下几块显卡的钱,3080 跑 70B 模型不是梦。原文稍后读已读值得跟进有用关注 量化
12:07IT之家(博客/媒体)精选乌克兰开发者 Slava S 发布 ESP32-AI 项目,在乐鑫 ESP32-S3 开发板(8MB PSRAM、16MB 闪存)上部署了 2890 万个参数的本地 AI 模型,此前该板 AI 参数上限仅 26 万。开发者采用 Google Gemma 的 Per-Layer Embeddings 技术,模型经 4-bit 量化后文件大小为 14.9MB,嵌入表存入 16MB 闪存,每生成一个 Token 只需读取少量数据。该模型无法支持聊天或编程,但可离线生成咖啡配方(豆、研磨、配比、水温)。AI产品ESP32-AIESP32-S3乐鑫2 个信源在谈事件专题推荐理由:一个 ESP32-S3 板子就能跑 2890 万参数模型,还能离线下咖啡配方,小硬件玩大模型的天花板又高了。原文稍后读已读值得跟进有用关注 ESP32-AI
06:02AI Engineer@aiDotEngineer精选Google AI Edge团队指出边缘AI的真正瓶颈是RAM而非算力,且手机厂商今年缩减RAM、6GB树莓派涨价2.5倍。2B参数的Gemma经2.9-bit量化后可在树莓派上达到约8 tokens/秒,在高通NPU上足以处理几帧视觉。更小的500M至50M参数模型能覆盖老旧设备,通常需微调而非提示。微调后的Gemma在10个动作中实现超86%的函数调用准确率,配合语音模型可完成语音到函数调用。已有一款离线语音听写应用投产,基于两个sub-billion Gemma模型,无需订阅且能去除口头禅。AI模型GemmaGoogle AI EdgeRaspberry Pi推荐理由:Google工程师讲透了边缘AI的内存瓶颈,用小模型做智能体实际可行,还给了离线语音应用的真实案例。原文稍后读已读值得跟进有用关注 Gemma
11:38官方账号arXiv cs.LG@Yann Bouquet, Alireza Khodamoradi, Kristof Denolf, Mathieu SalzmannKroQuant提出一种Kronecker结构可逆变换,对每个32元素激活块进行在线量化,参数少于per-channel缩放的一半。在MI350 GPU上,KroQuant量化核比SmoothQuant核快14%。在PixArt-Σ、SANA和FLUX.1-schnell上以W4A4(MXFP4e2)量化,KroQuant在MJHQ-30K和SDCI上输出比SVDQuant和LoRaQ更接近FP参考,同时保持或提升图像质量。该方法通过离线LoRaQ权重校准吸收残差权重量化误差。论文KroQuant量化扩散模型推荐理由:这篇论文发了KroQuant,用Kronecker结构做激活变换,W4A4量化又快又准,比SVDQuant和LoRaQ结果好,还省参数。原文稍后读已读值得跟进有用关注 KroQuant
11:36官方一手arXiv: OpenAI@Navnit Shukla, Kamal Pandey, Omsankar Tiwari精选TurboVec基于TurboQuant的4-bit标量量化,在DBpedia OpenAI嵌入基准(d=1536, 100K-999K向量)上,Recall@5比同内存的FAISS PQ高8.5-8.9个百分点。对比HNSW(R@5=0.991)和IVF-PQ(R@5=0.840),TurboQuant无需训练即达更高召回。在Snowpark Container Services上,100K向量中位数延迟11ms,而暴力扫描为707ms。内核级过滤在10-1000租户下Recall@10为0.86-0.93,远高于后过滤的0.09-0.19。量化设计使成员推断准确率降至随机水平(50.0%),而PQ为57.3%。论文TurboVecTurboQuantRAG推荐理由:TurboVec用一种新量化方法让企业RAG检索又快又安全,召回比FAISS PQ高近9个点,还能防隐私泄露。原文稍后读已读值得跟进有用关注 TurboVec
00:10AI Engineer@aiDotEngineer精选在 AIE Europe 会议上,Google DeepMind 团队展示了一个完整微调流程:以 Gemma 270M 模型为起点,通过生成合成任务数据、LoRA 微调、int4 量化,最终部署到 Pixel 手机上。整个流程仅需 21 分钟,准确率从 46% 提升至 90%,推理速度达到 2000 tokens/s。该方法对比 1500 美元的线下 AI 训练营有显著效率和成本优势。技巧GemmaLoRA量化推荐理由:Google 工程师教你怎么在手机上 21 分钟微调一个小模型,从 46% 干到 90%,比花 1500 美元买课还快。原文稍后读已读值得跟进有用关注 Gemma
10:18IT之家(博客/媒体)PrismML 的原生 1-bit 模型压缩技术可将模型体积压缩至全精度的 1/14,内存占用降低超 90%。基于该技术的 Bonsai 27B 模型(基于 Qwen 3.6 27B)从约 54GB 缩减至不足 4GB,可在 12GB 内存的 iPhone 15 及后续机型上原生运行。推理速度提升最高 8 倍,能耗降低 75%-80%,精度在 1-bit 下保留 90% 基准得分。苹果公司正在评估 PrismML 技术,会谈可能涉及授权或收购。AI模型PrismMLBonsai 27B苹果推荐理由:PrismML 这技术能把 27B 模型塞进 iPhone,内存从 54G 砍到 4G 不到,苹果都在看,手机跑大模型要成真了。原文稍后读已读值得跟进有用关注 PrismML
08:40berryxia@berryxia73°PrismML推出Bonsai 27B模型,可在iPhone 17 Pro上直接运行,内存占用低于5GB。这是首个在手机端运行的27B参数级模型。演示视频显示实时响应且可用。通过量化技术将内存压缩至极致,同时保持模型可用性。该模型表明27B规模的大模型开始走进个人设备。AI模型PrismMLBonsai 27BiPhone 17 Pro1 个信源在谈事件专题推荐理由:27B的模型在手机上跑,内存不到5GB,PrismML的Bonsai做到了。以后手机AI不连网也能用大模型了。原文稍后读已读值得跟进有用关注 PrismML
02:16官方账号Clement Delangue@ClementDelangue精选Clement Delangue 转推了 SpiritBun 的 VBR(Variable Bit Rate)KV 缓存格式。该格式在会话增长过程中逐层动态量化 KV 缓存,在 VRAM 限制内最大化生成质量。目前代码已合入主分支并可用。AI模型VBRKV缓存量化推荐理由:SpiritBun 搞了个新 KV 缓存格式 VBR,逐层动态量化,在显存限制内榨出最高质量,已开源可用。原文稍后读已读值得跟进有用关注 VBR
17:43Hunyuan@TXhunyuan腾讯混元发布了Hy3模型的1-bit和4-bit量化版本,原始模型为295B参数的MoE架构,在同等规模中性能最佳,可媲美万亿参数旗舰模型。量化后模型可在单张GPU上运行,支持llama.cpp和MTP(多令牌预测)。模型采用Apache 2.0协议,对商用友好,并提供两周免费API试用。AI模型Hy3Tencent量化推荐理由:腾讯混元把295B的旗舰模型量化到1-bit和4-bit,单卡就能跑,还免费两周API,适合做智能体。原文稍后读已读值得跟进有用关注 Hy3
09:29官方账号arXiv cs.LG@Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier该论文系统评估了量化LLM在2、3、4、8比特位宽下的可靠性,涵盖不确定性、校准和鲁棒性三个维度,使用了六种不同量化方法。研究发现,模型性能随总比特数单调提升,但可靠性缩放呈非线性,4比特量化模型达到可靠性峰值。实验还表明,量化增强了LLM对字符级和词级自然扰动的鲁棒性。论文LLM量化可靠性推荐理由:论文用实验告诉你,4比特量化的LLM最靠谱,比8比特还稳,想省资源又想要可靠性可以照这个选。原文稍后读已读值得跟进有用关注 LLM
08:05andrew chen@andrewchenAndrew Chen预测消费级显卡2029年可运行Fable级别模型,依据是LLM知识压缩比约400:1,量化至4-bit后达1600:1。Densing Law显示模型能力每3.3个月翻倍,27B参数模型已接近几年前更大模型。当前27B参数量化版已能在32GB显存GPU运行,且每年效果提升。AI模型消费级GPUFableDensing Law推荐理由:Andrew Chen用Densing Law和量化数据推测,消费级显卡跑顶级模型可能只需几年,感兴趣可以看看他的推导。原文稍后读已读值得跟进有用关注 消费级GPU
12:12官方账号arXiv cs.AI@Baha Rababah, Cuneyt Gurcan Akcora, Carson K. Leung该论文提出了正确性一致性(correctness agreement)指标,用于衡量基础模型与量化变体在正确预测上的重叠程度。在8-bit至2-bit的多种量化方案下,发现即使任务性能看似保持,中等量化也会导致行为分歧。分析表明查询和键投影的敏感性高于值和输出投影,揭示了低比特宽度的非线性断点。这些发现指出仅依赖准确率和困惑度会掩盖量化的真实影响。论文LLM量化模型评估推荐理由:这篇论文用新指标发现,量化后的模型即使分数不变,行为也可能跑偏,搞模型部署的同学建议看看。原文稍后读已读值得跟进有用关注 LLM
11:32官方账号arXiv cs.AI@Donghyun Lee, Jitesh Chavan, Duy Nguyen, Sam Huang, Liming Jiang, Priyadarshini Panda, Timo Mertens, Saurabh ShuklaOrbitQuant提出一种数据无关的权重量化方案,通过随机置换块Hadamard(RPBH)旋转将激活值变换到归一化旋转基,使各坐标分布固定无需重新拟合校准数据。在FLUX.1、Z-Image-Turbo、Wan 2.1、CogVideoX四个模型上,该方法在多个低位宽设定下达到后训练量化(PTQ)最佳效果,并将图像扩散Transformer的PTQ推进到W2A4可用质量。同一量化器可直接从图像迁移到视频,无需针对每种模态调整。AI模型OrbitQuant扩散Transformer量化推荐理由:想给图像或视频扩散模型做低位量化?OrbitQuant不需要每换一个模型或任务就重跑校准,FLUX.1、Wan 2.1上表现都很能打,W2A4也有可用效果。原文稍后读已读值得跟进有用关注 OrbitQuant
23:29官方账号LMSYS Org (SGLang)@lmsysorg76°NVIDIA推出Qwen3.6-27B-NVFP4模型,采用4位浮点量化,模型大小仅为BF16版本的约1/2.5。该模型在MMLU Pro基准上达到86.3分,与FP8版本性能几乎无损。上下文长度完整保留262K。SGLang已提供Day-0支持,并附带cookbook。AI模型Qwen3.6-27B-NVFP4NVIDIASGLang9 个信源在谈事件专题推荐理由:NVIDIA新出的Qwen3.6-27B模型,4位量化体积小很多但精度没怎么降,SGLang直接就能用,可以去试试。原文稍后读已读值得跟进有用关注 Qwen3.6-27B-NVFP4
05:48@koltregaskes@koltregaskes精选79°OpenAI近期通过纯软件优化将推理成本降低了约50%,工程师利用更好的批处理和KV-cache管理提升了GPU利用率。该优化已部署到ChatGPT的登录用户流量中,GPU需求降至仅数百块。部分人猜测这是通过量化实现,并可能关联到近期ChatGPT质量下降的投诉。行业OpenAI推理成本KV-cache10 个信源在谈事件专题推荐理由:OpenAI没换硬件,靠软件就把推理成本砍了一半。这对模型成本和用户体验可能都有影响,值得了解。原文稍后读已读值得跟进有用关注 OpenAI
17:26berryxia@berryxiaUnsloth团队将GLM-5.2模型压缩至1-bit量化版本,在Mac Studio M3 Ultra(256GB RAM)上实现约21 tok/s的推理速度。该量化模型在创意输出任务(如HTML/设计生成)上,能与Claude Opus和GPT-5.5正面对比且不落下风。这显示极端量化后的大模型仍能保留较强表现,展示了开源模型通过优化缩小与闭源前沿模型在实际可用性上的差距。AI模型UnslothGLM-5.2量化推荐理由:Unsloth把GLM-5.2压到1-bit,Mac Studio上跑21 tok/s,创意性居然不输Claude Opus,本地部署党有福了。原文稍后读已读值得跟进有用关注 Unsloth
10:38官方账号arXiv cs.LG@Kamar Hibatallah Baghdadi, Kawther Guoual Belhamidi, Sara Belhadj, Aissa Boulmerka, Nadir FarhiHiReLC是一个分层集成强化学习框架,用于深度神经网络的自动联合量化与结构化剪枝。低层智能体按块独立选择位宽、剪枝保留比、量化类型和粒度,高层智能体基于Fisher信息估计协调全局预算分配。框架使用轻量MLP代理进行奖励塑造,降低策略评估成本。在Vision Transformer和CNN基准上,实现参数存储压缩比5.99-6.72倍,一个设定下准确率提升3.83%,其他设定准确率下降0.55-5.62%。论文HiReLCVision TransformerCNN推荐理由:这个框架能自动给神经网络做剪枝和量化,压缩比达到6倍多,准确率几乎不掉,适合做模型部署。原文稍后读已读值得跟进有用关注 HiReLC
09:43官方一手arXiv: DeepSeek@Fengfeng Liang, Yuechen Zhang, Jiaya Jia精选Block-GTQ是一种针对RoPE注意力机制的KV缓存量化位分配方法,基于TurboQuant-MSE构建。它在每个层和注意力头上计算RoPE块的能量得分,通过贪心分配整数位宽。在2和3比特每维度仅量化键的实验中,Block-GTQ在10个模型上使每层平均绝对误差降低32-80%,并赢得全部367个层比较。在Llama-3.1-8B-Instruct上以K2V2配置,NIAH六任务平均从70.6提升至97.4,LongBench英文平均从36.87提升至53.31。在DeepSeek-R1-Distill-Qwen-7B上以K3V2配置,AIME 2024/2025得分51.7/37.5,接近fp16的54.2/37.9,而均匀量化降为0.0/0.0。在H800上对Qwen2.5-3B-Instruct实现3.24倍压缩,128K上下文比fp16 FlashAttention2快1.34倍,峰值内存从56.31GB降至19.85GB。论文Block-GTQRoPEKV缓存量化推荐理由:这篇论文用RoPE感知的位分配方案,在KV缓存量化上显著提升长上下文检索和推理,效果逼平fp16,值得研究量化的朋友细读。原文稍后读已读值得跟进有用关注 Block-GTQ
09:21官方一手arXiv: DeepSeek@Yifu Ding, Jiacheng Wang, Ge Yang, Yongcheng Jing, Jinyang Guo, Xianglong Liu, Dacheng Tao精选该论文针对混合专家(MoE)模型部署时内存和推理开销大的问题,提出一种结构剪枝框架。方法将剪枝比率分配转化为通道分数覆盖最大化问题,通过归因近似高效求解。在DeepSeek和Qwen MoE模型上实验,结合4-bit量化后,50%或25%结构化剪枝仍保持模型准确率。在Qwen3-30B-A3B上,内存占用减少5.27倍,优于现有基线。论文MoE结构剪枝量化推荐理由:想省显存又怕掉精度?这篇论文用通道级剪枝加4-bit量化,把MoE模型体积砍到1/5还能保住性能,DeepSeek和Qwen都能用。原文稍后读已读值得跟进有用关注 MoE
14:05berryxia@berryxia78°Unsloth团队用Dynamic 2-bit方案将1万亿参数的Kimi K2.7 Code模型压缩48%,重要层保留更高精度。量化后模型仅需325GB RAM/VRAM即可本地运行,推理速度达40+ tok/s。全精度版本需要610GB显存。该优化并非粗暴量化,而是保留了模型的推理效率,尤其适合长程任务、复杂推理和agent工作流。AI模型Kimi K2.7 CodeUnsloth量化4 个信源在谈事件专题推荐理由:Unsloth把1万亿参数的Kimi K2.7 Code压到325GB本地能跑,速度40+ tok/s,长程推理和agent工作流全闭环,开源社区终于能自己跑了。原文稍后读已读值得跟进有用关注 Kimi K2.7 Code
09:37官方账号arXiv cs.LG@Mariya Pavlova, Harrison Bo Hua Zhu, Elizsveta Semenova, Yingzhen Li该论文提出了一种名为轨迹量化敏感度分数(TQS)的新指标,将时序模型的量化问题重新定义为动力系统的稳定性分析。TQS通过将模型推理视为离散时间动力系统,量化了量化误差在时间步上的传播和放大效应。与传统的后训练量化方法不同,TQS可以独立于量化器选择和位宽分配进行敏感度估计,适用于黑盒或编译后的网络。基于TQS,作者提出了TQS-PTQ框架,无需校准数据或二阶近似即可实现混合精度量化。实验表明,该视角在资源受限场景下提供了稳健且高性能的低精度部署方案。论文量化时序模型动力系统推荐理由:时序模型部署时量化误差会随时间累积,TQS用动力系统理论解决了这一痛点,做边缘设备或IoT部署的工程师可以直接参考。原文稍后读已读值得跟进有用关注 量化
22:52Philipp Schmid@_philschmid精选72°Google 发布了新的 Gemma 4 QAT(量化感知训练)检查点,在保持相似性能的同时,将内存占用降低约 4 倍。该版本引入了一种新的移动端量化格式,将 Gemma 4 E2B 的内存占用降至仅 1GB。QAT 通过在训练过程中模拟低精度运算,实现无损量化,从而得到更小、更快的模型。这些检查点已在 Hugging Face 上提供,可直接运行。AI模型Gemma 4QAT量化1 个信源在谈事件专题推荐理由:做移动端或边缘部署的开发者终于可以跑 Gemma 4 了——内存降到 1GB 意味着手机和 IoT 设备也能用,建议直接去 Hugging Face 拉下来试试。原文稍后读已读值得跟进有用关注 Gemma 4
08:26rohanpaul_ai@rohanpaul_ai精选72°Google 发布了 Gemma 4 的 QAT(量化感知训练)检查点,将最小模型从 11.4GB 压缩至 1.1GB,纯文本版本仅 0.84GB。与传统的 PTQ(训练后量化)不同,QAT 在训练过程中模拟压缩,让模型学会在权重被压缩时保持推理质量。Google 还构建了针对移动端的格式,包括静态激活、通道级量化、目标 2 位量化和 KV 缓存优化,减少手机计算负担,延长长对话的内存使用。这使得 Gemma 4 更容易在手机和笔记本上运行,降低了部署门槛。AI模型Gemma 4量化移动端部署7 个信源在谈事件专题推荐理由:QAT 解决了模型压缩后推理质量下降的痛点,做移动端 AI 部署的开发者可以直接用这些检查点,在手机上跑大模型不再吃内存。原文稍后读已读值得跟进有用关注 Gemma 4
04:43elvis@omarsar0一款名为 standout 的命令行工具可以统计你的 AI 使用情况,生成使用报告和排名。用户只需在终端运行 `npx standout`,即可获得自己的 AI 使用分数和百分位排名。该工具由 Alexis Aftalion 开发,旨在让用户量化自己的 AI 使用习惯。一位用户测试后发现自己位列前 1%,并推荐给其他人。AI产品AI 使用统计命令行工具npx standout推荐理由:想量化自己到底有多重度使用 AI?npx standout 让你一秒看到排名,重度 AI 用户值得一试,看看自己是不是前 1%。原文稍后读已读值得跟进有用关注 AI 使用统计
04:19Paul Couvert@itsPaulAi88°Google 发布了 Gemma 4 QAT 模型,相比前代内存需求降低 3 倍,使得高性能模型能在本地设备上运行。其中 Gemma 4 E4B 模型性能优于 GPT-4o,仅需 2GB RAM 即可在手机上运行。而 Gemma 4 31B 模型(约 Opus 4 级别)现在可以在笔记本电脑上运行。这标志着本地 AI 部署的重大突破,让更多用户无需依赖云端即可使用强大模型。AI模型GoogleGemma 4本地 AI10 个信源在谈事件专题推荐理由:本地 AI 爱好者终于等到了——Gemma 4 QAT 让旗舰级模型跑在手机和笔记本上,做边缘计算或隐私敏感应用的开发者可以直接试试。原文稍后读已读值得跟进有用关注 Google
02:33官方账号Andrew Ng@AndrewYNgAndrew Ng 联合 RedHat 推出新课程,教你如何高效服务大语言模型,以低延迟和合理成本处理大量并发用户。课程核心包括量化降低模型内存占用(如 70B 模型权重约 140GB)以及使用 vLLM 的智能内存管理(如 KV 缓存)来提升并发处理能力。学员将学会量化模型并权衡精度、用 vLLM 部署并观察并发效果、以及基准测试以在速度、成本和精度间做决策。课程适合想优化 LLM 部署的开发者,可直接在 deeplearning.ai 上学习。AI产品LLM 服务量化vLLM推荐理由:做 LLM 部署的开发者终于有了系统课程——量化降内存 + vLLM 处理并发,直接上手就能优化成本,建议点开学。原文稍后读已读值得跟进有用关注 LLM 服务
12:06官方一手arXiv: DeepSeek@Boao Kong, Weichen Jia, Engao Zhang, Guohong Li, Yonghan Dong, Yao Wang, Yaoyuan Wang, Yunke Peng, Kun Yuan低精度训练在降低大模型训练成本的同时,常因少数算子的数值不稳定导致训练失败。论文提出GNMR(梯度范数与均值比)轻量控制器,通过比较当前梯度范数与历史均值,并结合Δ-GNMR检测短窗口内的突变,在固定预算和锁定间隔内执行恢复操作,无需改变数值格式或底层实现。在激活量化、DeepSeek式训练和LLaMA-2 13B微调等场景中,GNMR以稀疏的恢复动作保持高保真质量。该方法为低精度训练提供了一种后端无关的稳定性控制方案。论文低精度训练训练稳定性GNMR推荐理由:低精度训练是降低大模型成本的关键,但数值不稳定常让训练白费。GNMR用轻量控制解决了这个痛点,做大规模训练或量化训练的团队值得关注,可以直接集成到现有流程中。原文稍后读已读值得跟进有用关注 低精度训练
11:58官方账号arXiv cs.LG@Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu精选Ω-QVLA是首个无需训练的后训练量化框架,能将视觉-语言-动作模型的语言骨干和扩散动作头统一压缩至W4A4精度,打破此前认为动作头必须混合精度的认知。它通过复合SVD-Hadamard旋转均衡权重能量并分散激活异常值,结合逐步骤的DiT激活缩放量化吸收去噪步间的动态范围漂移。在LIBERO基准上,Pi 0.5和GR00T N1.5经量化后任务成功率分别达98.0%和87.8%,与FP16参考值持平或略优,静态内存占用降低71.3%。真实机器人操作实验也验证了其流畅精准的控制能力。代码已开源。论文量化VLA模型Pi 0.5推荐理由:做机器人或边缘部署VLA模型的团队终于有了统一量化方案——内存省71%且性能不降,Pi 0.5和GR00T N1.5用户可以直接用代码复现。原文稍后读已读值得跟进有用关注 量化
11:45官方账号arXiv cs.AI@Maoyang Xiang, Bo Wang, Tao Luo精选OrpQuant提出了一种名为正交残差投影(ORP)的算法-硬件协同设计框架,用于解决低比特Power-of-Two(PoT)量化中的低角度分辨率问题。该方法通过双基几何投影自适应合成更高分辨率的残差格点,仅使用移位和加法操作,避免了乘法器。在LLaMA-2-7B上,3比特量化(W3/A16)下困惑度达到6.10,与AWQ等MAC密集型方法相当,且全模型校准仅需约15分钟。在28nm工艺下,RTL综合表明ORP有效缓解了密集乘法器树的时序瓶颈。该工作适用于LLM和ViT的边缘部署。论文量化边缘部署LLM推荐理由:OrpQuant解决了低比特量化中特征流形退化的问题,做边缘部署的开发者可以直接用这个15分钟校准的方案替代传统MAC密集型方法,硬件效率显著提升。原文稍后读已读值得跟进有用关注 量化