8月15日
02:00
02:00官方账号阿里通义 Qwen@Alibaba_Qwen
精选
Hugging Face发布2026年夏季《State of Open Models》报告。报告称,前沿模型规模越来越大,但小模型在实际使用中占主导。Qwen在本地推理使用量上领先,Gemma紧随其后。报告还显示,AI智能体已成为Hub上的重要力量。
推荐理由:Hugging Face报告显示Qwen本地推理排第一、Gemma第二,小模型玩家值得看看。
01:29
01:29官方账号Hugging Face@huggingface
HuggingFace发布2026年夏季开放模型状态报告。报告显示前沿模型规模持续扩大,但小模型仍主导实际部署。Qwen在本地推理使用量上排名第一,Gemma位居第二。AI代理已成为HuggingFace Hub上的重要增长动力。
推荐理由:HuggingFace出了份开放模型夏季报告,告诉你哪些小模型最常用,Qwen和Gemma谁跑得靠前,搞本地部署前先看看。
8月12日
7月21日
04:21
04:21官方账号NVIDIA AI@NVIDIAAI
Poolside的Laguna模型现已可在NVIDIA DGX Spark上本地运行。DGX Spark是NVIDIA推出的桌面级AI超级计算机。这使得Laguna模型能够在个人设备上进行高效推理,无需依赖云服务。具体性能指标尚未公布。
事件专题

推荐理由:Poolside把Laguna模型放进了NVIDIA的DGX Spark小盒子,以后本地跑代码生成模型更方便了。
6月26日
08:00
08:00Qdrant@qdrant_engine
Qdrant联合Kaivid Labs创始工程师Tarun演示如何构建完全离线的RAG系统,使用Qdrant EDGE进行轻量级设备端向量搜索,搭配Google LiteRT通过硬件加速运行语言模型,实现文档问答、个人助理和笔记搜索,无需任何云依赖。活动时间为7月7日,包含现场实操。

推荐理由:教你用Qdrant EDGE和Google LiteRT搭一个完全离线的RAG系统,文档问答、个人助理全在本地跑,再也不用担心隐私和联网了。
6月17日
13:28
13:28Geek@geekbb
精选
介绍了一个工具,可在Apple Silicon Mac上通过MLX框架本地运行大语言模型。用户能从Hugging Face搜索并下载模型,用MLX进行离线推理,并启动一个OpenAI兼容的API服务。这样就能用curl或OpenAI客户端库调用本地模型。
事件专题

推荐理由:想在Mac上本地跑大模型、不用联网?这个工具能从Hugging Face下模型,用MLX推理,还直接开个OpenAI API,当本地服务使。
6月12日
6月11日
6月4日
04:27
04:27官方账号Decoder@Matthias Bastian
78°
Google DeepMind 发布了 Gemma 4 12B 开源模型,原生支持文本、图像和音频处理,仅需 16GB 内存即可在笔记本上运行。该模型在基准测试中几乎与两倍大小的 26B 模型持平,并采用 Apache 2.0 许可证,允许商业使用。这标志着多模态 AI 在消费级硬件上的重大突破,降低了开发者和企业的使用门槛。
事件专题

推荐理由:多模态模型终于能跑在普通笔记本上了,做本地 AI 应用或边缘计算的开发者可以直接下载试试,性能还接近两倍大的模型。
6月3日
5月20日
11:55
11:55官方一手pandaily@contact@pandaily.com (Pandaily)
摩尔线程推出AICUBE,一款面向家庭场景的统一AI中心设备,旨在作为单一设备入口点,整合多种AI功能。该产品预计2026年上市,将集成GPU算力,支持本地AI推理,降低对云端的依赖。此举标志着国产GPU厂商从硬件向消费级AI解决方案的延伸,可能推动家庭AI普及。

推荐理由:摩尔线程从GPU设计跨入家庭AI终端,做智能家居或本地AI应用的开发者值得关注——AICUBE可能成为国产替代的算力入口,2026年上市前建议提前了解生态兼容性。
5月18日
17:12
17:12官方账号AlphaSignal@AlphaSignalAI
76°
本周(5月11日至17日)GitHub 热门仓库包括 DeepSeek 4 Flash 本地推理引擎(支持 Metal 和 CUDA)、更稀疏快速的 Transformer 语言模型、利用 WiFi 信号实现空间感知的 RuView、面向法律工作流的 Claude 插件套件,以及 X 平台开源的 feed 排序算法。这些项目覆盖了模型推理、架构优化、环境感知、行业应用和算法透明化等多个方向,值得开发者关注。
推荐理由:做本地推理或模型优化的开发者可以看看 DeepSeek 4 Flash 和稀疏 Transformer 项目,前者直接提升 Metal/CUDA 部署效率,后者可能改变模型架构设计思路。法律从业者或对行业 AI 应用感兴趣的人,Claude 插件套件提供了现成的 workflow 参考。