17:42IT之家(博客/媒体)74°LM Studio 与苹果在 WWDC 2026 期间合作,用四台 Mac Studio 集群成功运行月之暗面万亿参数大模型 Kimi K2.6。Kimi K2.6 总参数达 1 万亿,采用 MoE 架构,激活参数 320 亿,支持长上下文、多模态输入和智能体任务。四台 Mac Studio 通过 Thunderbolt 5 RDMA 内存共享形成约 1.5TB 统一内存,实现模型推理。演示还展示 LM Link 功能,用户可从 MacBook Neo 或 iPhone 安全远程访问集群模型,数据保持本地处理。在类似配置下,模型生成速度约 28 tokens/s,功耗低于传统 GPU 集群。AI模型Kimi K2.6LM StudioMac Studio推荐理由:LM Studio 用四台 Mac Studio 跑起万亿参数的 Kimi K2.6,还能用 iPhone 远程调用,给消费级本地部署开了个好头。原文稍后读已读值得跟进有用关注 Kimi K2.6
23:57Thomas Wolf@Thom_Wolf开源模型生态欢迎新手尝试Opus 4.8级别的模型。GLM-5.2是ZAI org发布的开放权重模型,可通过Hugging Face页面使用。多个供应商竞争价格,智能体价格便宜。模型可本地运行、微调并构建商业应用,无需许可。HuggingChat提供免费聊天界面。AI模型GLM-5.2Hugging Face开源模型推荐理由:GLM-5.2达到Opus 4.8水平,免费、可本地跑、可微调,比闭源灵活还便宜,快试试!原文稍后读已读值得跟进有用关注 GLM-5.2
08:21IT之家(博客/媒体)73°苹果在WWDC26特别讲座中演示了在4台Mac Studio上通过LM Studio本地运行1万亿参数的Kimi K2.6模型。工程师仅用单条提示词生成了WWDC badge tracker应用,该应用具备3D动画和全息视觉效果。演示使用了低延迟RDMA over Thunderbolt技术,苹果在macOS Tahoe 26.2中引入。Kimi K2.6由月之暗面于2026年4月20日发布,升级了代码编写和Agent集群能力。AI模型Kimi K2.6Mac StudioLM Studio2 个信源在谈事件专题推荐理由:苹果用4台Mac Studio跑万亿参数Kimi K2.6,本地低延迟,一条提示词生成App,开发者必看。原文稍后读已读值得跟进有用关注 Kimi K2.6
14:05berryxia@berryxia78°Unsloth团队用Dynamic 2-bit方案将1万亿参数的Kimi K2.7 Code模型压缩48%,重要层保留更高精度。量化后模型仅需325GB RAM/VRAM即可本地运行,推理速度达40+ tok/s。全精度版本需要610GB显存。该优化并非粗暴量化,而是保留了模型的推理效率,尤其适合长程任务、复杂推理和agent工作流。AI模型Kimi K2.7 CodeUnsloth量化4 个信源在谈事件专题推荐理由:Unsloth把1万亿参数的Kimi K2.7 Code压到325GB本地能跑,速度40+ tok/s,长程推理和agent工作流全闭环,开源社区终于能自己跑了。原文稍后读已读值得跟进有用关注 Kimi K2.7 Code
13:05MiniMax_AI@MiniMax_AIUnslothAI 支持在本地运行 MiniMax 的 M3 模型,用户可通过其优化工具进行部署。M3 是 MiniMax 发布的多模态模型,支持文本、图像和音频处理。UnslothAI 提供高效的本地推理方案,降低硬件门槛。AI模型M3MiniMaxUnslothAI推荐理由:用UnslothAI本地跑M3原文稍后读已读值得跟进有用关注 M3
15:45Hailuo AI@Hailuo_AIMiniMax 发布了 Hub,一个本地 AI Agent 创意工作站,支持从研究、脚本、图像、音乐到最终剪辑的全流程自动化。用户可以通过 Agent 处理繁琐任务,自己掌控创意方向。Hub 提供无限画布、并行项目和批量生成功能,集成顶级模型和自定义技能工具包,并支持本地资产和应用的即时导入导出。7月1日前登录可获3000奖励积分。AI产品MiniMaxAI Agent创意工作站推荐理由:MiniMax Hub 把 AI Agent 从编码转向创意生产,做内容创作、视频制作、多模态项目的团队可以直接用上全流程自动化,省去手动切换工具的麻烦,值得一试。原文稍后读已读值得跟进有用关注 MiniMax
13:52IT之家(博客/媒体)NCASE 发布了其首款 ATX 兼容机箱 P1,采用 36L 紧凑设计,专为个人本地 AI 工作站装机需求打造。该机箱支持 SSI-CEB 主板,可容纳多张 4 槽超厚显卡,并支持 6 颗 180mm 大尺寸风扇及三组冷排,散热能力强劲。P1 提供三种前板版本(蜂窝、百叶防尘、百叶实木),定价分别为 355/275/315 美元。目前详细参数尚未公布,但已引发 AI 硬件爱好者关注。AI产品AI 工作站机箱NCASE推荐理由:AI 工作站装机党终于有了紧凑型机箱选择——36L 体积塞进多张 4 槽显卡和 6 颗大风扇,散热和扩展性兼顾,做本地大模型部署的团队可以关注。原文稍后读已读值得跟进有用关注 AI 工作站
22:46Geek@geekbb一位开发者分享了一个名为 TinyTroupe 的本地网页研究引擎,专为 MCP(模型上下文协议)设计。用户输入问题后,它会自动搜索、排序、抓取网页并提取关键段落,最终生成带来源链接的 prompt,供 LLM 回答。默认使用 SearXNG 搜索,DuckDuckGo 兜底,只需 Docker 即可部署。该项目在 GitHub 上开源,适合需要本地化、可控信息检索的 AI 应用场景。AI产品MCP/工具本地部署网页研究引擎推荐理由:做 MCP 工具或本地 AI 工作流的开发者,这个项目能帮你省掉手动搜索和整理网页的麻烦,直接丢问题就能拿到结构化 prompt,值得抽时间试试。原文稍后读已读值得跟进有用关注 MCP/工具
14:58宝玉@doteybaoyu-design skill 新增支持导入 Figma 本地 .fig 文件,用户可将设计系统的 Figma 文件在本地重建为设计系统,效果与 Claude Design 在线版一致。该功能实现复杂,开发者表示没有 Claude Fable 5 的帮助难以完成。使用方式简单:安装 skill 后,将 Figma 文件路径发送给 skill,导入为 Design System,后续新建设计项目即可直接使用。该更新解决了本地设计系统与 AI 设计工具衔接的问题,适合设计师和前端开发者。AI产品Claude DesignFigma设计系统3 个信源在谈事件专题推荐理由:设计师和前端开发者终于可以在本地用 AI 重建 Figma 设计系统了,效果媲美在线版,而且操作简单——把 .fig 文件路径丢给 skill 就行,值得一试。原文稍后读已读值得跟进有用关注 Claude Design
02:00rohanpaul_ai@rohanpaul_ai83°Google 发布了 DiffusionGemma,一个基于扩散模型的 26B 参数 MoE 开源语言模型,激活参数仅 3.8B。该模型采用 Apache 2.0 许可证,量化后可在 18GB VRAM 内运行。其核心优势在于并行生成 256 个 token,推理速度比传统自回归模型快 4 倍,在 H100 上可达 1000+ tokens/s,在 RTX 5090 上可达 700+ tokens/s。这解决了本地大模型推理慢的痛点,尤其适合单用户场景。AI模型开源/仓库推理模型MoE6 个信源在谈事件专题推荐理由:本地 LLM 用户终于等来速度突破——DiffusionGemma 的并行生成机制让推理快 4 倍,做本地部署或边缘计算的开发者可以直接在 18GB 显存下体验,值得一试。原文稍后读已读值得跟进有用关注 开源/仓库
09:08官方一手arXiv: DeepSeek@Wenxin Wang, Yule Hou, Yu Ji, Peng Qu, Youhui Zhang精选72°本地部署大型混合专家模型(MoE)在服务质量上远不及云端环境,即使低并发场景也存在四大差距:依赖降级模型、无法满足长预填充的30秒TTFT、解码吞吐量低于20 tokens/s、混合负载下并发能力差。本文提出CPU-GPU混合系统,通过流式加载预填充(SLP)将预填充吞吐提升至1200 tokens/s,支持32K提示词在30秒内完成;分布式SLP(DSLP)结合SmallEP专家并行,在双RTX 5090上达到1800 tokens/s和45K提示词;以及零拷贝共享权重的节点内预填充-解码分离、AVX-512优化的FP8 GEMV内核等技术。该系统在消费级CPU-GPU平台上实现了旗舰MoE模型的云级服务质量,无需数据中心基础设施即可获得高质量、低成本的本地推理。论文MoE模型CPU-GPU混合推理优化推荐理由:本地跑MoE大模型终于能追上云端的服务质量了——做本地部署的开发者可以直接参考这套CPU-GPU混合方案,不用再忍受降级模型和低吞吐。原文稍后读已读值得跟进有用关注 MoE模型
07:58berryxia@berryxia78°Kimi 推出新功能 Kimi Work,可在本地桌面同时运行多达 300 个 AI 代理,支持 macOS 和 Windows。这些代理通过 WebBridge 扩展能自主在浏览器中搜索、滚动、点击和输入,完成复杂任务。该功能专为财经场景优化,可直接调用 Yahoo Finance 和世界银行数据,无需额外配置。Kimi Work 还具备记忆系统,能记录用户偏好和决策,逐步提升个性化体验。最终,代理会自动将结果输出为 PPTX、Word、PDF 或 Excel 文件,直接保存到桌面。这标志着 AI 代理从云端依赖转向本地原生协作,显著提升桌面生产力。AI产品KimiAI代理本地部署7 个信源在谈事件专题推荐理由:Kimi Work 把 AI 代理从云端拉回本地,300 个代理并行干活还带记忆,做金融分析或数据整理的团队可以直接上手,省去配置和等待的麻烦。原文稍后读已读值得跟进有用关注 Kimi
04:41kimi_moonshot@kimi_moonshot78°Kimi Work 是一款桌面端本地 AI 智能体,支持最多 300 个 AI 代理并行运行。它通过 WebBridge 扩展可操控浏览器完成搜索、点击等任务,内置金融数据工具(Yahoo Finance、世界银行),无需复杂 API 配置。还具备记忆系统,能记录用户偏好和上下文,提升个性化体验。目前支持 macOS(Apple Silicon)和 Windows,可直接下载试用。AI产品智能体本地部署金融工具7 个信源在谈事件专题推荐理由:本地运行 300 个 AI 代理并行工作,解决了云端依赖和效率瓶颈,做自动化办公或金融分析的团队可以直接上手试试。原文稍后读已读值得跟进有用关注 智能体
21:43LovartAI@lovart_aiIdeogram 4.0 正式发布,官方称其为“世界上最好的开源图像模型”。该模型支持权重下载、用户在自己的数据上进行微调,并可在本地硬件上运行。目前已在所有 Ideogram 套餐和 API 上可用。这一发布意味着开发者可以自由定制和部署高质量的图像生成能力,降低了图像 AI 的门槛。AI模型开源/仓库图像生成Ideogram 4.02 个信源在谈事件专题推荐理由:开源图像模型终于有了新标杆,做图像生成、模型微调或本地部署的团队可以直接下载权重试试,不用再依赖闭源 API。原文稍后读已读值得跟进有用关注 开源/仓库
11:43AI Will@FinanceYF583°Google 发布了 Gemma 4 12B 模型,这是一个支持视觉、音频、推理和智能体能力的多模态 AI 模型。该模型采用 Apache 2.0 开源协议,可以在本地笔记本电脑上运行,无需依赖重型编码器堆栈。这意味着开发者可以在离线环境中部署强大的 AI 功能,同时保持数据隐私。Gemma 4 12B 的发布进一步降低了多模态 AI 的应用门槛,适合个人开发者和中小企业使用。AI模型多模态开源/仓库本地部署推荐理由:多模态模型终于能本地跑了,做边缘计算或隐私敏感应用的开发者可以直接上手试试,Apache 2.0 协议也省了授权烦恼。原文稍后读已读值得跟进有用关注 多模态
11:42AI Will@FinanceYF583°谷歌发布了 Gemma 4 12B,一款轻量级多模态 AI 模型,无需重型编码器栈即可在笔记本电脑上本地运行。该模型支持视觉、音频、推理和智能体四大核心能力,采用 Apache 2.0 开源协议。这降低了多模态 AI 的硬件门槛,让个人开发者和小团队也能在本地部署和实验。对于关注边缘计算和隐私保护的 AI 从业者来说,这是一个值得关注的开源选择。AI模型多模态模型开源/仓库本地部署推荐理由:Gemma 4 12B 让多模态 AI 真正跑在笔记本上,做本地推理、智能体或隐私敏感应用的开发者可以直接拿来用,省去云端依赖。原文稍后读已读值得跟进有用关注 多模态模型
09:36ollama@ollama精选Google 的 Gemma 4 12B 模型已更新至 Ollama,支持所有平台运行。该模型是统一的无编码器多模态模型,专为笔记本电脑设计,在边缘效率与高级推理之间取得平衡,并采用 Apache 2.0 许可。用户可通过 Ollama 在 Claude Code、Hermes Agent、OpenClaw、Codex 等工具中直接调用。AI模型Gemma 4Ollama多模态模型10 个信源在谈事件专题推荐理由:本地运行多模态模型的门槛又降低了——Gemma 4 12B 在 Ollama 上即开即用,做本地 AI 应用或边缘推理的开发者可以直接上手试。原文稍后读已读值得跟进有用关注 Gemma 4
09:34Geek@geekbb精选博主用 Hermes/Hermes Studio 配合 LM Studio 尝试加载 google/gemma-4-12b 模型,在丐版 Mac mini(推测 M2 8GB)上运行失败,即使将上下文拉满也无法启动。该模型大小为 12b 参数,本地部署对显存要求高,低配设备不兼容。建议使用更高配置设备或云端方案。技巧Mac minigoogle/gemma-4-12bLM Studio2 个信源在谈事件专题推荐理由:丐版 Mac mini 别折腾 gemma-4-12b 了原文稍后读已读值得跟进有用关注 Mac mini
08:22berryxia@berryxiaGoogle 昨晚发布了 Gemma 4 12B 多模态大模型,该模型支持文本和图像输入,最低只需 16GB 内存即可运行。这降低了多模态模型的本地部署门槛,适合个人开发者和资源受限的环境。与 Qwen 等同类模型的对比结果值得关注,可能影响开源多模态模型的竞争格局。AI模型多模态模型Gemma 4Google10 个信源在谈事件专题推荐理由:多模态模型本地运行门槛进一步降低,做 AI 应用或本地部署的开发者可以关注 Gemma 4 与 Qwen 的对比,评估是否值得迁移或尝试。原文稍后读已读值得跟进有用关注 多模态模型
05:12ollama@ollamaGoogleDeepMind 的 Gemma 4-12B 模型现已可通过 Ollama 直接使用,支持 MLX 框架。用户可通过 `ollama run gemma4:12b-mlx` 命令快速启动聊天,还支持 Hermes Agent、Claude Code 等工具的集成。这为开发者提供了便捷的本地部署和实验途径,尤其适合在 Apple Silicon 设备上高效运行。AI产品OllamaGemma 4MLX10 个信源在谈事件专题推荐理由:Ollama 让 Gemma 4-12B 的本地部署门槛降到最低,做模型实验或本地 Agent 开发的团队可以直接跑起来,省去繁琐配置。原文稍后读已读值得跟进有用关注 Ollama
02:51官方一手marktechpost@Asif Razzaq88°Google DeepMind 发布了 Gemma 4 12B,一款无编码器的多模态模型,直接将视觉和音频输入送入 LLM 主干,无需传统视觉或音频编码器。该模型原生支持音频理解,可在 16GB 内存的笔记本电脑上本地运行,并采用 Apache 2.0 开源许可。这降低了多模态 AI 的硬件门槛,让开发者能在消费级设备上部署视觉和音频处理能力。Gemma 4 12B 的发布标志着多模态模型向轻量化和本地化迈出重要一步。AI模型多模态模型开源/仓库Gemma 4 12B2 个信源在谈事件专题推荐理由:多模态模型终于能跑在普通笔记本上了,做本地 AI 应用或边缘计算的开发者可以直接下载试用,16GB 内存就能跑视觉+音频推理,开源许可也友好。原文稍后读已读值得跟进有用关注 多模态模型
00:45a16z@a16z精选72°Ideogram 4.0 正式发布,并宣布开源权重。该模型被官方称为“世界上最好的开源图像模型”,支持用户下载权重、在自有数据上微调,并可在本地硬件上运行。目前已在所有 Ideogram 套餐和 API 上可用。这一举措将推动图像生成领域的开源生态发展,为开发者和创作者提供更多自主权和灵活性。AI模型开源/仓库图像生成Ideogram 4.04 个信源在谈事件专题推荐理由:图像生成领域终于有了一个真正能打的开源模型——Ideogram 4.0 权重可下载、可微调、可本地跑,做 AI 图像应用或研究的团队可以直接上手试试。原文稍后读已读值得跟进有用关注 开源/仓库
05:59官方账号NVIDIA AI@NVIDIAAINVIDIA 宣布 DGX Spark 支持 NemoClaw 一键安装路径,用户只需一条命令即可完成模型获取、推理后端配置和运行时部署,大幅简化 AI Agent 的本地化部署流程。此前搭建 Agent 需要手动整合多个组件,耗时且依赖外部云服务。DGX Spark 通过提供可预测的本地算力,消除了对云端的依赖,适合需要长期运行、低延迟的 AI 应用场景。该更新让开发者能快速在本地启动 AI Agent,提升开发效率和部署灵活性。AI产品AI AgentNVIDIADGX Spark10 个信源在谈事件专题推荐理由:NVIDIA 把 AI Agent 的本地部署从繁琐的多步骤压缩成一条命令,做边缘计算或需要私有化部署的团队可以直接上手,省去云依赖和配置烦恼。原文稍后读已读值得跟进有用关注 AI Agent
00:20IT之家(博客/媒体)技嘉在台北电脑展2026上发布了“AI TOP”桌面生态系统,包括三款面向不同市场的AI台式整机:AI TOP 100 B850、AI TOP 100 Z890和AI TOP 500 TRX50。其中,AI TOP 100 B850最高可运行405B参数的大语言模型,兼容100多款AI应用,适合本地部署高智能模型。AI TOP 100 Z890配备雷电5接口,支持串联构建协同计算环境,性能提升最高1.6倍。AI TOP 500 TRX50定位旗舰,搭载24核48线程的AMD锐龙Threadripper PRO处理器,最高可选配768GB DDR5内存,可直接在CPU上运行大模型。这些产品旨在为AI开发者和企业提供高性能的本地AI计算解决方案。AI产品AI桌面生态系统技嘉大语言模型推荐理由:本地部署大模型的门槛又降低了——技嘉这三款整机直接解决了硬件兼容和性能瓶颈问题,做AI推理或模型微调的团队可以省去自己攒机的麻烦,值得关注。原文稍后读已读值得跟进有用关注 AI桌面生态系统
01:03Y Combinator@ycombinatorKugelAudio 推出了支持 30 多种语言和方言的多语言语音 AI,用户可以在自己的 Kubernetes 集群中本地部署。该 AI 能自然处理电话号码、电子邮件和混合语言文本,完全在本地运行,无需依赖云端服务。这对于需要数据隐私和低延迟的语音应用场景具有重要意义。AI产品语音 AI多语言Kubernetes推荐理由:对于需要本地部署语音 AI 的团队,KugelAudio 解决了数据隐私和语言多样性的痛点,做语音应用或客服系统的开发者可以直接在自己的集群中试试。原文稍后读已读值得跟进有用关注 语音 AI
18:03IT之家(博客/媒体)雷神在AI工作站新品发布会上推出Master T系列塔式工作站,覆盖旗舰到入门产品线。旗舰级Master T9000系列可选96核AMD锐龙Threadripper PRO 9995WX处理器和四卡AMD Radeon AI PRO R9700,FP8稀疏算力达3096 TFLOPS,可满足70B模型全精度推理。Master T7000系列可选锐龙9 9950X3D2处理器,单卡提供766 TFLOPS AI算力。这些工作站面向AI开发和高性能计算场景,提供本地化部署能力。AI产品AI工作站雷神AMD推荐理由:雷神这次把AI工作站的门槛拉高了——四卡R9700能跑70B模型全精度推理,做本地大模型部署的团队可以直接考虑,省去云端算力成本。原文稍后读已读值得跟进有用关注 AI工作站
14:05IT之家(博客/媒体)PrismML 发布 Bonsai Image 4B 系列图像生成模型,包含 1-bit 和 Ternary 两个版本,专为本地设备优化。该模型基于 LUX.2 Klein 4B 构建,通过二值/三值权重大幅压缩体积,1-bit 版 Transformer 仅 0.93GB,内存占用降至 1.5GB。在 iPhone 17 Pro Max 上生成 512×512 图像仅需 9.4 秒,Mac M4 Pro 上约 6 秒,速度比全精度模型快 5.6 倍。质量方面,Ternary 版在 1.21GB 体积下保留约 95% 的准确性,1-bit 版在不足 1GB 下保留约 88%。这标志着高质量图像生成模型首次在手机上实现实时可用。AI模型图像生成模型压缩本地部署推荐理由:手机端终于能跑正经的图像生成模型了,做移动端 AI 应用或创意工具的开发者可以直接在 iPhone 上体验,9.4 秒出图的速度已经可用。原文稍后读已读值得跟进有用关注 图像生成
16:18向阳乔木@vista8一位用户用中文克隆的声音,将经典电影英文台词翻译成日语、法语、德语,并通过开源TTS模型合成语音。结果声音自然,情绪传递到位,支持14种语言。该模型可本地部署,质量不错,适合制作AI播客、睡前故事、广告宣传等。试玩地址已公开,开源社区又多了一个高质量TTS选项。AI产品TTS/语音合成开源/仓库多语言推荐理由:开源TTS又多了一个高质量选项,做多语言语音合成、AI播客或本地部署的开发者可以直接试玩,效果自然到让人惊喜。原文稍后读已读值得跟进有用关注 TTS/语音合成
16:06官方一手marktechpost@Michal SutterOmniVoice Studio 是一个完全本地运行的开源语音工具,无需 API 密钥、云账户或订阅。它支持语音克隆、视频配音、实时听写和说话人分离,覆盖 646 种语言的文本转语音。项目还提供 MCP 服务器,可与 Claude、Cursor 等客户端集成。这为追求隐私和低成本的语音处理需求提供了强大替代方案。AI产品语音克隆开源/仓库MCP/工具8 个信源在谈事件专题推荐理由:做语音应用或内容创作的团队终于有了本地可用的开源方案,隐私安全且零成本,建议试试集成到工作流中。原文稍后读已读值得跟进有用关注 语音克隆
10:16官方一手Pandaily@contact@pandaily.com (Pandaily)精选字节跳动开源了原生多模态模型Lance,可在40GB显存上本地运行。该模型发布一天内登上了Hugging Face趋势榜。Lance支持图像、文本等多种模态的联合理解与生成。AI模型LanceByteDance多模态推荐理由:字节开源40GB可跑的多模态模型原文稍后读已读值得跟进有用关注 Lance
03:37官方一手marktechpost@Michal Sutter精选72°腾讯开源了 TencentDB Agent Memory,一个完全本地的 AI 智能体记忆系统,采用 MIT 许可证。该系统结合了符号短期记忆(将冗长的工具日志压缩为紧凑的 Mermaid 任务画布)和四层长期记忆金字塔(L0 对话 → L1 原子 → L2 场景 → L3 人格)。它作为 OpenClaw 插件和 Hermes Docker 镜像提供,默认在本地 SQLite + sqlite-vec 上运行,并使用混合 BM25 + 向量检索与 RRF 融合。腾讯自己的基准测试显示,在 WideSearch 上使用 OpenClaw 时,令牌减少 61.38%,相对通过率提升 51.52%,PersonaMem 准确率从 48% 提升到 76%。AI产品智能体记忆系统开源/仓库7 个信源在谈事件专题推荐理由:腾讯开源的四层本地记忆管线解决了智能体长期记忆的痛点,做本地 AI 应用或智能体开发的团队可以直接集成,建议试试这个 MIT 许可的方案。原文稍后读已读值得跟进有用关注 智能体
08:20berryxia@berryxiaStable Audio 3 官方版发布,支持在本地 Mac 电脑上运行音乐生成模型,利用苹果统一内存架构优势。在 M5 Pro 上可实现 59 倍实时速度,LoRA 微调不到 1 小时完成,提供 Sm 和 Medium 两种模式。通过一行命令即可安装 MLX 优化版,让音乐创作不再依赖云端。官方鼓励社区折腾,适合快速出 demo、训练风格或在离线环境下作曲。AI产品Stable Audio 3音乐生成本地部署推荐理由:音乐创作者和 AI 爱好者终于能在本地 Mac 上跑音乐模型了,LoRA 微调不到 1 小时,适合快速出 demo 或训练个人风格,建议有 Mac 的开发者直接试。原文稍后读已读值得跟进有用关注 Stable Audio 3
13:17官方账号Clement Delangue@ClementDelangueHuggingFace CEO Clement Delangue 在Dell Technologies World主题演讲中宣布,与Dell合作推动基于HuggingFace开源模型的本地AI部署。他认为,本地AI相比云API更便宜、更快、更安全,是应对今年GPU短缺的重要方案。该合作旨在让企业能够更便捷地在本地运行开源模型,减少对云端GPU的依赖。行业开源模型本地部署GPU短缺推荐理由:GPU短缺是今年AI部署的最大瓶颈之一,本地AI方案能直接帮企业省钱、提速、保安全,做企业AI落地的团队值得关注。原文稍后读已读值得跟进有用关注 开源模型
10:16官方账号arXiv cs.AI@Jon Saad-Falcon, Avanika Narayan, Robby Manihani, Tanvir Bhathal, Herumb Shandilya, Hakki Orhun Akengin, Gabriel Bo, Andrew Park, Matthew Hart, Caia Costello, Chuan Li, Christopher Ré, Azalia Mirhoseini精选72°OpenJarvis 是一种新的个人AI系统架构,旨在解决现有AI堆栈(如OpenClaw、Hermes Agent)严重依赖云端模型的问题。当前,将本地模型直接替换云端模型会导致准确率下降25-39个百分点。OpenJarvis 将个人AI系统分解为五个可独立优化的原语(智能、引擎、智能体、工具与记忆、学习),并引入LLM引导的规范搜索,让云端模型在搜索时提出编辑建议,但只接受不降低性能的修改,最终推理完全在设备上运行。实验表明,OpenJarvis 在8个基准测试中的4个上匹配或超越云端准确率,平均仅落后3.2个百分点,同时将API成本降低约800倍,端到端延迟降低4倍。论文个人AI本地部署OpenJarvis1 个信源在谈事件专题推荐理由:做本地AI部署或隐私敏感应用的开发者,OpenJarvis 提供了一种不牺牲性能就能在设备上运行个人AI的方案,值得深入研究其架构和优化方法。原文稍后读已读值得跟进有用关注 个人AI
12:55官方账号NVIDIA AI@NVIDIAAINVIDIA AI 高管在社交平台分享了一次令人惊叹的本地 AI 体验:他仅通过手机向本地运行的 121B 模型(DGX Spark)提问,Hermes 智能体便自主完成了 8 个测试用例,全部通过。整个过程无需编写一行代码,完全由模型自主完成。这展示了大型模型本地部署的潜力,意味着开发者未来可能只需描述需求,AI 就能自动完成测试、调试等任务。AI产品NVIDIADGX SparkHermes 智能体推荐理由:本地运行 121B 模型并自主完成测试,这对追求隐私和低延迟的开发者来说是个震撼的 demo——你只需提问,AI 就能搞定一切,建议点开看看未来已来的样子。原文稍后读已读值得跟进有用关注 NVIDIA