别只盯着 token 价格了,Arize 和 Fireworks 测了 10 个模型的 2400 次 agent 运行,发现按任务难度的路由能省钱又提高成功率。Kimi K3 还追平了 GPT-5.5。
#Fireworks AI
Fireworks 用1000个智能体任务实测了 Kimi K3 和 Fable,发现按任务路由能省50倍成本,还能保持93%准确率。K3 在安全和长循环上更强。
Thinky Machines 开源了 975B MoE 多模态模型 Inkling,Apache 2.0 随便用,适合微调,直接在 Fireworks 上跑。
Fireworks AI 的 GLM 5.2 Fast 跑到了 400tok/s,4 天干完一个月活,才花 218 刀。想试试在 Claude Code 里提速的,直接 FireConnect 走起。
Cognition分享了他们怎么跨三大洲四个数据中心做RL训练,用紧耦合trainer加分布式异步推理,还靠压缩权重差异同步,做到稳定rollout。做大规模RL的值得看看。
Fireworks AI 在微软 Foundry 上推出了 GLM 5.2,还支持用 FireConnect 路由到 Codex、OpenCode,搞工作流开发能快不少,试试呗。
Fireworks AI 把强化学习里最头疼的数值一致性问题搞定了,还能直接托管GLM 5.2,省去自己搭基础设施的麻烦。
LangChain搞了个低成本trace judge,用阿里Qwen微调,性能不输顶级模型还便宜100倍,做trace监控的可以看看。
Step 3.7 Flash 以 400 tokens/s 的速度刷新了推理效率,做实时 AI 应用或智能体开发的团队可以直接在 Fireworks AI 上试用,省去自建推理基础设施的麻烦。
法律 AI 团队终于有了可落地的降本增效方案——路由+微调开源模型比纯用前沿模型便宜 11 倍还更准,做垂直领域 AI 应用的开发者可以直接参考 Harvey 的实践。
Fireworks AI 的演示直击 AI 落地的核心痛点——定制化和推理性能,做 AI 工程化的团队值得一看,能学到如何把模型从实验推到生产级规模。
AI 应用开发者终于可以在 Microsoft Foundry 上直接使用 Fireworks AI 的推理服务,部署效率会大幅提升,做企业级 AI 应用的建议去 MSBuild 展位看看。
企业 AI 团队终于有了从测试到生产的统一路径——Foundry 上的高性能推理直接降低了延迟和成本,做模型部署的开发者值得关注即将上线的演示视频。
Step 3.7 Flash 通过原生效率设计解决了 KV-cache 成本痛点,做智能体应用的开发者可以直接用 Fireworks AI 一键部署,值得试试。
AI 推理市场正在爆发,Fireworks 的 4 倍增长说明高性能推理服务需求旺盛。做模型部署或推理优化的团队值得关注其技术路径和招聘动向。
对于正在搭建内部知识系统或优化推理管线的 AI 工程师,这场 Meet Up 的议题直接命中痛点——大规模上下文层和智能体闭环是当前企业落地的关键,值得关注后续分享。
Qwen 3.6 27B 的托管微调服务让开发者无需自建基础设施即可定制模型,做垂直领域应用或私有化部署的团队可以直接用,省去大量工程成本。
做 AI 推理部署的团队终于有了兼顾性能和治理的选项——Fireworks AI 在 Azure 上直接可用,建议有生产环境需求的点开看看。
做 Vibe Coding 的开发者终于可以自己掌控模型迭代节奏——Fireworks 让 Gemma 4 Dense 的微调变得触手可及,想摆脱“等别人发新版本”的团队可以直接上手试试。