#本地部署
MSI 给 DGX Spark 平台加了 64 GB 内存版 EdgeXpert,1.2 kg 就能本地跑千亿参数模型,企业私有化部署可以看看。
284B 的 DeepSeek V4 Flash 量化到 1.6 bit 只要 60GB,配 128GB 内存的 Surface Laptop Ultra 就能本地跑,视频都放出来了。
有 Intel Arc Pro B70 的朋友可以试试这个开源工具,现在能直接用 vLLM 跑本地模型了,不用折腾命令行。
12GB 显卡也能跑 125B 的 Qwen3.8-Flash-Next 了,Strata 开源,RTX 5070 上 94 词元/秒,配置门槛和 GitHub 链接都在文里。
Atomic Chat 把 NVIDIA TensorRT 接进自家引擎,RTX 5090 上跑 Qwen 系列模型比 llama.cpp 快一倍多,本地部署党可以看看实测数据。
有人在 DGX Spark 上重跑了 GPT-4o 的文字加法实验,Qwen3.8 27B 开推理后 169 次只错 2 次,还能看到逐位进位的思考过程。
不想云端模型动不动拒答的话,这个用 480KB 控制向量改 Qwen3.8-Flash-Next 的法子挺有意思,12GB 显存就能跑。
12G显存的电脑也能跑125B的Qwen3.8-Flash-Next了,Strata把常用专家放显卡、全量放内存,项目已在Github开源。
有人把 iPhone 17 Pro Max 插到 MacBook 上当外挂算力,跑 Qwen3.8-27B 预填充快了 44%,软件已开源叫 backburner,动手党可以试试。
12GB 显存就能跑千亿参数模型,Strata 靠 MoE 冷热分离把专家塞进内存,5070 上实测 94 token/s,家用显卡玩家可以折腾了
一个玩家用单张消费卡跑出比多数 API 还快的推理速度,靠的是 Qwen Flash 的模型设计和 Strata 流水线架构,文章讲清了原理,本地部署党别错过。
Unsloth 把 Laya 决策模型做到了 4GB 内存就能本地跑,还能无缝替换 Jev API。做分类决策类应用的朋友可以看看,文章里 confidence 和 probabilities 的坑讲得很实用。
ACEMAGIC 的 F9A 用锐龙 AI Max+ 495 塞进 1.4kg 机身,192GB 内存能分 160GB 给显存,本地跑大模型不用租云 GPU,6499 美元。
极摩客出了台 192GB 内存的迷你工作站,搭载 AMD 锐龙 AI Max+ PRO 495,号称能本地跑 320B 的模型,早鸟 6599 美元,想在家玩大模型可以看看。
铭凡这台迷你工作站把 192GB 内存塞进小机身,能分 160GB 当显存跑大模型,多机还能组机架,51999 元。
有人在GitHub开源了个叫Colibrì的玩法,不用GPU,把SSD当显存就能在笔记本上跑GLM的7000亿参数模型,感兴趣的可以照着README敲6行命令试试。
Liquid AI 出了个 DSpark 加速器,16GB 的 Mac 就能跑 LFM2.5-VL-3B,M5 芯片上解码快最多 3.13 倍,输出还不变。
一个才 9.7 MB 的小适配器,挂在 Bonsai 2 27B 上就能去掉拒绝回答,MMLU 几乎不掉分,16 GB 的 MacBook 也能跑。
雷神的 2L 迷你工作站,锐龙 AI Max+ 395 加 128GB 大内存,25499 元到手,想本地跑大模型可以看看。
有人用 24G 内存的 MacBook Pro 本地跑 Qwen-Image-2.1,一张图要等 5-6 分钟,没显卡想本地跑生图的先看这个再决定。
朋友分享了自己用Qwen 3.8 27B和Deepseek v4搭建的本地AI实验环境,适合想快速测试不同大模型性能的用户参考。
Apodex团队开源的Apodex 1.1 mini模型和Agent Harness框架,支持本地部署,功能强大,适合科研和任务执行。与同类产品相比,Apodex在内容准确性和交付质量上表现更优。
Ollama官方说deepseek v4 flash跑得最好,本地想试的话有qwen3.8优化版,但注意qwen慢30倍贵4.5倍,小样本测试。
阿里官方转发,Atomic Chat把Qwen3.8-27B量化到1位,8.5GB就能跑,16GB MacBook Air上还能保持92.4%的一致性。