微软把 llama.cpp 和 GGUF 模型直接接进了 Win11 的 Windows ML,以后从 Hugging Face 下个模型就能在本地跑,还配了文本生成和语音识别 API。
#本地推理
一个开源项目把阿里 Qwen 的 125B 模型量化后塞进了 12GB 显存的消费级显卡,每秒还能跑几十个 token,本地部署玩家可以看看它怎么分配显存和内存。
NVIDIA 出了台 1 PetaFLOP 的桌面机,64GB 内存,两台还能组 128GB 集群,想在家微调模型的开发者可以看看。
MiniCPM5-2B 出了 4-bit 量化版,权重才 1.61 GB,T4 上能跑 70 tokens/s,想在自己机器上跑小模型可以试试。
有人把决策模型打包成了 Ollaya,本地跑 GLiClass、Laya 这些模型,还带 TypeSafe API,做分类和路由的可以试试。
Perplexity Windows app 新增 Portable Computer 功能,支持本地推理,需 NVIDIA RTX 显卡 24GB 显存或更高。该功能允许用户在本地运行模型,无需云端连接。
Perplexity 为 Mac 开发了专用推理引擎 Lily,比 MLX-LM 快 23%-35%,专为 Qwen3.6-35B-A3B 和 Apple Silicon 优化。
NAS 用户看过来,威联通 Qsirch 升级了,本地跑 VLM 和 LLM,搜文件视频不用传云端,隐私和速度都照顾到。
Ollama 和 Intel 合作,让开源模型在 Core Ultra Series 3 上跑本地推理,隐私又好用。
想本地跑Bonsai-27B?用PrismML的llama.cpp加上1位量化,速度起飞,还能直接用OpenAI API调用。
教你用Qdrant EDGE和Google LiteRT搭一个完全离线的RAG系统,文档问答、个人助理全在本地跑,再也不用担心隐私和联网了。
想在Mac上本地跑大模型、不用联网?这个工具能从Hugging Face下模型,用MLX推理,还直接开个OpenAI API,当本地服务使。
本地运行 LLM 的开发者终于有了速度新选择——DiffusionGemma 的 4 倍加速意味着更流畅的交互体验,用 atomic[.]chat 的团队可以直接在单卡上体验,值得一试。
Mac 开发者终于能在本地跑最新大模型了,DiffusionGemma 和 North Mini Code 都支持 Day-0 运行,做本地 AI 实验的可以直接装来玩。
本地 AI 推理终于有了速度突破——DiffusionGemma 让低带宽设备也能高效运行,做边缘部署或本地应用的开发者可以直接从 Hugging Face 下载试试。
做特殊教育NLP或低资源语言模型微调的团队,这篇论文提供了一个可复现的CGFD流程,直接解决了繁体中文IEP生成的数据稀缺和隐私问题,值得点开看具体实现。
做本地 AI 部署或移动端推理的开发者,终于有了官方 QAT 方案——Gemma 4 压缩到 1GB 以下还能保持推理质量,建议直接下载检查点试试。
做AI应用或本地推理的开发者,这个测试直接告诉你Nemotron 3 Ultra能以十分之一成本达到GPT-5.5级别的效果,值得在项目里试试。
无编码器架构让多模态模型不再依赖专用编码器,16GB 笔记本就能跑全模态 AI,做本地 AI 应用或边缘计算的开发者可以直接试试。
本地跑 120B 模型终于有正经硬件了——Surface RTX Spark Dev Box 把 AI 开发环境打包成 100W 的桌面盒子,做模型微调或智能体开发的团队可以直接关注,省去搭服务器和配环境的麻烦。
Google 把模型、推理引擎和开发工具链打包成一套方案,做端侧 AI 或隐私敏感应用的开发者可以直接在笔记本上跑 Agentic 工作流,建议试试 AI Edge Gallery 的代码生成功能。
多模态模型终于能跑在普通笔记本上了,做本地 AI 应用或边缘计算的开发者可以直接下载试试,性能还接近两倍大的模型。
Perplexity 的混合 AI 系统解决了本地与云端资源分配难题,做 AI 应用开发或关注隐私与效率平衡的团队值得关注,可以直接尝试优化工作流。
本地跑大模型或做 AI 渲染的团队,这台 128GB 内存的迷你工作站比同配置笔记本便宜不少,接口也够全,值得关注。
Ollama 与 NVIDIA 联手,让本地 AI 推理性能跃升到 petaflop 级别,做本地模型部署的开发者可以直接在 RTX Spark 上跑模型,值得关注。
雷神把本地大模型推理的门槛打下来了——M7000用SSD扩展显存跑120B模型,做AI开发或本地部署的团队可以直接考虑,性价比比传统工作站高出一截。
迷你主机终于能塞进桌面级显卡和处理器了,做本地 AI 推理或轻量渲染的开发者可以直接考虑,3.46L 体积放桌面不占地方。
本地跑 300B 参数模型不再是梦,做 AI 推理和开发的团队可以直接关注这款 x86 平台,比依赖云端更灵活。
AMD 用 3999 美元硬件替代每月 750 美元云租金的算盘很实在,做本地 AI 推理或模型微调的开发者值得算一笔账——6 个月回本,之后就是纯赚。
Hugging Face 把 DNA 分析从黑盒 API 拉到了本地,做生物信息学或个性化健康研究的开发者可以直接在笔记本上跑基因组模型,值得试试。