AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:量化/低比特×
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
6月2日
11:10
11:10arXiv cs.AI@Ekaterina Alimaskina, Darya Rudas, Denis Shveykin, Gleb Molodtsov, Pavel Vasiliev, Aleksandr Beznosikov
精选72°
该研究揭示了大型推理模型在极端低比特(2-bit)量化推理时,并非单纯降低答案准确率,而是产生更长的推理轨迹,包括重复循环、预算耗尽、延迟决策和未闭合推理段,导致端到端速度不升反降。作者针对 Qwen3-8B 和 Qwen3-32B 模型,提出了两种轻量级控制方法:FP16 规划(为 2-bit 模型提供短的高精度大纲)和循环救援(检测重复轨迹并回退或提前提交答案)。在 MATH-500 上,循环救援将 Qwen3-8B 准确率从 17.2% 提升至 74.2%,规划加循环救援将 Qwen3-32B 从 65.0% 提升至 87.2%。研究表明,将低比特推理失败视为可控生成病理,通过轻量检测和选择性 FP16 支持,2-bit 推理可以恢复准确率并保持真实端到端加速。代码已开源。
论文推理模型量化/低比特Qwen3失败模式开源/仓库

推荐理由:做推理模型量化和部署的团队终于有了针对 2-bit 失败模式的系统解法——不是简单降精度,而是用 FP16 规划和循环救援来修复生成过程,Qwen3 用户可以直接复现并提升准确率。
原文
精选全部日报登录