Meta 出了个新模型 Muse Spark 1.1,Agent 任务特别能打,价格还便宜,适合做工具调用和自动化流程的开发者,coding 虽不是最强但够用。
Mark Zuckerberg 时隔三年再次在X发帖,官宣 Meta 发布新模型 Muse Spark 1.1,主打强 agentic 和强 coding 能力,并提供极低价格。该模型支持 1M token 上下文窗口、子 agent 并行委派以及跨端 GUI 操作。在 Agent 类基准中,MCP Atlas(规模化工具调用)88.1 分领先第二名约 6 分,JobBench(专业工具使用)54.7 分较前代 17.0 暴涨约 3.2 倍。但 coding 方面 Terminal-Bench 80.0 分落后于 GPT 5.5 的 83.4 分,SWE-Bench Pro 61.5 分低于 Opus 4.8 的 69.2 分。低定价策略使其对成本敏感的开发者具有吸引力。
小扎,对,就是 Meta 创始人 Mark Zuckerberg 23.07 后时隔三年,小扎再次在 X 发帖,官宣 Meta 新模型「Muse Spark 1.1」发布:强 agentic + 强...
小扎,对,就是 Meta 创始人 Mark Zuckerberg 23.07 后时隔三年,小扎再次在 X 发帖,官宣 Meta 新模型「Muse Spark 1.1」发布:强 agentic + 强 coding + 低价格,并通过全新的 Meta Model API 首次向开发者开放。 产品能力:以 Agentic 为核心卖点 · Agentic 性能与工具调用 —— 模型的主战场 · 长程任务 —— 1M token 上下文窗口 · 子 agent 并行委派 —— 可将执行分派给并行运行的 sub-agents · 跨端 GUI 操作 —— 训练用于 desktop / mobile / browser 的计算机界面操作 基准数据中,Agent 类 6 项中有 4 项领先: · MCP Atlas(规模化工具调用)88.1,领先第二约 6 分 · JobBench(专业工具使用)54.7,较前代 17.0 暴涨,碾压竞品(最高仅 48.4) · Humanity's Last Exam 62.1、Finance Agent v2 57.2 均为榜首 · 仅在 Toolathlon 与 OSWorld 略逊于 Opus 4.8 Muse Spark → Muse Spark 1.1 的提升幅度 JobBench:17.0 → 54.7,~3.2× DeepSWE 1.1:10.0 → 53.3,~5.3× 竞争格局:强在 Agent,coding 仍次于一梯队 客观来看,Muse Spark 1.1 并非全方位领先: · Coding:Terminal-Bench 80.0(GPT 5.5 为 83.4)、SWE-Bench Pro 61.5(Opus 4.8 为 69.2)、DeepSWE 53.3(GPT 5.5 为 67.0)——在复杂软件工程上仍落后 Anthropic 与 OpenAI 的旗舰。 · Multimodal:CharXiv 88.4、BabyVision 76.3,均略低于 Opus 4.8 / GPT 5.5。 但结合"very low price"的定价策略,这构成一个清晰的差异化定位:在 agentic 维度逼近或超越旗舰,在 coding/multimodal 维度做到"够用且便宜",对成本敏感的开发者与企业具有显著吸引力。 Mark Zuckerberg @finkd (1) Today we're releasing Muse Spark 1.1 -- a strong agentic and coding model at a very low price. It's available through our new Meta Model API and in Meta AI. 🔗 View Quoted Tweet 💬 2 🔄 0 ❤️ 0 👀 207 📊 2 ⚡