研究发现 LLM 推理输出随数值精度变化:BF16 与 FP16 会产生不同结果
一篇挺有意思的论文:同样的模型和提示,BF16 和 FP16 居然输出不一样,作者还给出了低于 4% 延迟开销的修复方法。
一篇挺有意思的论文:同样的模型和提示,BF16 和 FP16 居然输出不一样,作者还给出了低于 4% 延迟开销的修复方法。
做向量搜索的团队常被内存预算卡住,这个案例直接展示了 FLAT + FP16 + mmap 的组合拳如何把 139GB 需求压到 600MB,适合资源受限的单机部署场景,值得参考。