13:28Geek@geekbb精选介绍了一个工具,可在Apple Silicon Mac上通过MLX框架本地运行大语言模型。用户能从Hugging Face搜索并下载模型,用MLX进行离线推理,并启动一个OpenAI兼容的API服务。这样就能用curl或OpenAI客户端库调用本地模型。技巧MLXHugging FaceOpenAI兼容API本地推理教程2 个信源在谈推荐理由:想在Mac上本地跑大模型、不用联网?这个工具能从Hugging Face下模型,用MLX推理,还直接开个OpenAI API,当本地服务使。原文
14:06IT之家(博客/媒体)精选72°苹果在 WWDC 上推出 CoreAI 引擎,接替服役 9 年的 CoreML,主打端侧大模型推理。首批基准测试显示,在 M4 Mac 上运行 Qwen3 0.6B 小模型时,CoreAI 解码速度是 MLX 的 2.47 倍,iPhone 17 Pro 上为 1.6 倍。但在 80 亿参数模型上,CoreAI 仅比 MLX 快 5%,优势随模型规模增大而收窄。持续负载测试中,CoreML 配合神经引擎在温控降频场景下性能保持率反超 GPU 路线。横向对比,谷歌 LiteRT-LM 运行 Gemma 时内存占用仅为苹果 MLX 的 1/4.5,显示针对特定模型优化的重要性。AI产品苹果CoreAI端侧推理MLXQwen3推荐理由:苹果端侧 AI 架构迎来重大更新,CoreAI 在小模型推理上显著提速,做本地 AI 应用或模型部署的开发者值得关注,尤其是 M4 Mac 用户可以直接感受到更快的响应。原文
09:17berryxia@berryxia精选72°开发者 Prince Canuma 在 Google 发布 DiffusionGemma 和 Cohere North Mini Code 当天,就将这两个模型移植到了 Mac 的 MLX 框架中,实现零等待本地运行。DiffusionGemma 采用新架构,可生成 256 token 整块,支持双向注意力和迭代自纠错,26B MoE 仅激活 3.8B,量化后 18GB 内存即可运行。North Mini Code 30B MoE 只需 3B 激活参数,BF16 下推理速度达 66 tok/s。这得益于与 Google DeepMind 和 Cohere 的深度合作,实现了 Day-0 支持。用户可通过 mlx-vlm v0.6.3 一键安装体验。AI产品MLXDiffusionGemmaCohere North Mini Code本地推理开源/仓库推荐理由:Mac 开发者终于能在本地跑最新大模型了,DiffusionGemma 和 North Mini Code 都支持 Day-0 运行,做本地 AI 实验的可以直接装来玩。原文
AITOP5月29日 08:02Opus 4.8发布:编程助手的“静默时刻”,是解放开发者,还是新门槛?🔥Anthropic 把 AI 编程的“确认键”彻底删掉了!Claude Code 搭载全新 Opus 4.8 模型,长时间任务不跑偏、不废话、不中断,像一个资深工程师一样默默干活,从功能开发到漏洞清扫全包圆,你在旁边喝茶等结果就行。过去 AI 写代码三步一问“这样可以吗”,现在它直接交完整交付物……自主编程的最后一层窗户纸,被捅破了。做自动化开发和代码审查的团队,这个模型建议直接上手,效率差距肉眼可见……
16:20Geek@geekbb精选一款名为 Ari 的开源 macOS 菜单栏 AI 启动器发布,使用 Swift 语言构建,基于 MLX 框架在 Apple Silicon 芯片上本地运行语言模型。它让用户无需联网即可在菜单栏快速调用 AI 能力,保护隐私且响应迅速。项目已托管在 GitHub,适合 macOS 开发者或注重隐私的 AI 用户尝试。AI产品开源/仓库macOSMLXApple Silicon本地 AI推荐理由:macOS 用户终于有了一个本地化、轻量的 AI 入口,无需联网即可在菜单栏调用模型,隐私敏感或离线场景下的开发者值得一试。原文