12:45量子位@思邈AI SSD正将大模型推理的存储范式推向新阶段。它让算力、网络、内存与存储围绕每个Token协同工作。这改变了传统推理中存储作为独立环节的定位。行业AI SSD大模型推理存储推荐理由:AI SSD把存储和算力绑到每个Token上,和传统盘级方案思路不一样,搞推理的可以看看。原文稍后读已读值得跟进有用关注 AI SSD
11:47向阳乔木@vista8量化技术通过将模型权重从 fp16 或 fp32 转换为 int4 或 int8 精度,可大幅降低显存占用。例如,int4 量化能将 70B 参数模型从约 140GB 显存降至约 35GB。int8 量化在保持较高精度的同时,显存消耗减少约 50%。该技术让消费级 GPU 也能运行大规模模型。技巧量化int4int8推荐理由:刚学 AI 的赶紧看这条,int4/int8 量化能帮你省下几块显卡的钱,3080 跑 70B 模型不是梦。原文稍后读已读值得跟进有用关注 量化
11:07量子位@梦瑶NVIDIA在ComputeX发布的RTX Spark芯片已在Bilibili World上展出真机。该芯片将CPU和GPU直接封装在一起,采用统一内存架构。在笔记本平台上,RTX Spark可运行120B参数的大模型,无需依赖云端。展示表明其AI推理性能接近桌面级GPU。AI产品RTX SparkBilibili World黄仁勋4 个信源在谈事件专题推荐理由:老黄把CPU和GPU焊在一起了,笔记本就能离线跑120B的模型,想玩本地大模型可以关注这个新硬件。原文稍后读已读值得跟进有用关注 RTX Spark