用小模型加速大模型推理的投机解码原来有安全漏洞,这篇论文定位到问题出在前几个 token,SecureSD 只需对早期 token 加严验证就能补上,做推理部署的可以看看。
#LLM推理
Cerebras 的 CEO 亲自讲清楚自家芯片为什么比 GPU 快 2500 倍,关键就在权重存在 SRAM 而不是 HBM,听完就懂。
Google 这篇论文拆了 serverless CPU 跑量化小模型的延迟构成,55-70% 耗在加载权重,加内存到 8 GB 就能让推理快近一倍,部署前值得看。
一篇挺有意思的论文:同样的模型和提示,BF16 和 FP16 居然输出不一样,作者还给出了低于 4% 延迟开销的修复方法。
Datawhale 和 RadixArk 联合发起的开源课程,教你从零手搓 mini-sglang,最后能对照真实 SGLang 源码提 PR,适合想深入了解 LLM 推理引擎的人。
这篇论文用严格实验告诉你,LLM在约束推理上的表现和求解器难度不是一码事。他们控制密度、比较两类公式,发现准确率差距和求解器冲突量几乎不相关,甚至反着走。
这篇论文展示了PagedWeight方法,能在MoE模型服务里动态量化权重,省内存还保准,比之前的方法效果明显更好。
FreqDepthKV在长上下文推理中将KV缓存压缩3.9倍,同时保持任务精度,比此前压缩方法更稳定,适合内存受限场景。
本地部署LLM的开发者终于有办法解决队头阻塞了——Clairvoyant用极低开销预测请求长度,短查询不再被长任务堵死,Ollama/llama.cpp用户可以直接集成试试。
FlexNPU 解决了LLM推理中prefill和decode阶段资源冲突的痛点,做模型部署和推理优化的团队可以直接参考其动态调度思路,尤其适合使用华为Ascend NPU的开发者。
vLLM 是目前最主流的 LLM 推理框架之一,这门课直接教你量化、部署和基准测试,做模型部署或推理优化的工程师值得花时间学。
如果你在做LLM推理或搜索增强的AI系统,这篇论文指出了隐式搜索历史的瓶颈,并提供了一个简单有效的改进方向——显式父指针。做推理模型或规划算法的开发者值得一看。
斯坦福AI Lab的论文列表是了解AI前沿趋势的绝佳窗口,做LLM推理、智能体或AI安全的研究者值得点开看看,说不定能找到灵感或合作方向。
做MARL研究的团队终于有了一个利用LLM推理能力来设计通信协议的实用方案,LMAC直接解决了部分可观测性下的信息瓶颈问题,值得在实验环境中试试。
该演讲聚焦于真实部署中的推理优化和引擎设计,对于从事 LLM 服务化、推理加速的工程师和架构师具有直接参考价值。
Dooly通过结构感知的冗余消除,显著降低了LLM推理配置探索的开销,对需要评估多种硬件、引擎和模型组合的从业者具有实用价值。