01:59AI Will@FinanceYF5Harvey提出‘Moneyball’策略,利用领域专家建立法律评测集,与新型实验室合作,通过模型路由和SLA为60国提供服务,强调关键环节预算投入而非规模扩张。论文HarveyAI研究预算Moneyball策略推荐理由:Harvey的策略值得学习,用有限的预算做出世界级AI研究,不局限于大模型实验室的规模。原文稍后读已读值得跟进有用关注 Harvey
00:54techcrunch@Ram IyerRamp 公司推出了名为 Router 的 AI 模型路由服务。该服务允许用户和公司通过 API 使用和切换各种大语言模型。Router 是一个专用的模型路由器产品。AI产品RampRouter模型路由推荐理由:Ramp 推出了 Router,能让公司通过 API 切换不同的大语言模型,不用再自己写路由代码了。原文稍后读已读值得跟进有用关注 Ramp
04:16a16z@a16zOpenRouter作为高效中立的路由层,借助Ori Eval工具,基于对prompt和业务需求的逐步理解,动态为用户选择最佳模型和供应商。该系统能在秒级内完成模型路由决策,满足实时需求。其发展路径类似Stripe,成为企业间交换价值的网络。AI产品OpenRouter模型路由AI工具推荐理由:a16z支持的OpenRouter现在能根据你的prompt和业务需求自动选模型,像Stripe换美元一样换模型,比手动选更方便快捷。原文稍后读已读值得跟进有用关注 OpenRouter
06:26官方账号Latent Space (swyx)@Richard MacManusGlean CEO Arvind Jain在访谈中解释了模型路由如何帮助组织控制AI成本。他指出,前沿模型的高成本和开源模型的普及推动了模型路由的需求。Glean通过大规模人工反馈循环来改进其路由系统,确保为每个任务选择最合适的模型。这种方法在降低成本的同时,保持了输出质量。AI产品Glean模型路由成本控制推荐理由:想知道怎么省AI成本?Glean CEO讲了他们怎么用模型路由挑最合适的模型,还有人工反馈怎么让路由越用越准。原文稍后读已读值得跟进有用关注 Glean
06:57Jerry Liu@jerryjliu0精选Jerry Liu在X上表示,LLM路由优化应放在harness层而不是网关层。每个端到端任务都需要不同的LLM组合与harness逻辑,才能优化准确率和成本。仅在网关层优化LLM组合,会丢失harness中的上下文,只优化到LLM补全层。而在harness层优化LLM选择,可以在智能体循环中预先做出最优决策。技巧模型路由Harness智能体推荐理由:Jerry Liu 说路由优化放 harness 层比网关层划算,能更好平衡准确率和成本,跑智能体任务的人值得看。原文稍后读已读值得跟进有用关注 模型路由
03:33官方账号NVIDIA AI@NVIDIAAI71°NVIDIA发布开源库NeMo Switchyard,用于智能体工作流中的模型路由。该库允许复杂推理和规划步骤调用前沿模型,高容量专门执行使用Nemotron Lightning。开发者可自定义路由策略,在成本和性能间灵活取舍。AI产品NVIDIANeMoSwitchyard3 个信源在谈事件专题推荐理由:NVIDIA出了个开源的模型路由库Switchyard,能让工作流里复杂步骤用强模型、简单步骤用轻量模型,省成本。原文稍后读已读值得跟进有用关注 NVIDIA
03:14OpenRouter@OpenRouterAIOri DeepSeek 在每次启动时自动刷新 OpenRouter 目录,新模型无需手动修改配置即可出现。添加 /fast 参数可启用速度优先的路由选择。添加 /zdr 参数可将会话限制在零留存提供商。该功能由 OpenRouter 在社交平台介绍。技巧Ori DeepSeekOpenRouter模型路由推荐理由:OpenRouter 推荐了 Ori DeepSeek,每次启动自动拉新模型,加 /fast 或 /zdr 就能控制路由和留存,挺省心。原文稍后读已读值得跟进有用关注 Ori DeepSeek
02:46OpenRouter@OpenRouterAIOpenRouter将/model改为账户的模型目录,自动应用用户的护栏配置,并在每次注册表刷新后过滤掉非OpenRouter提供商。用户可添加/speed on启用速度优先路由,或添加/zdr on启用零保留提供商。这些路由设置在当前会话中持续生效。AI产品OpenRouter模型路由零保留推荐理由:OpenRouter把/model变成你的专属目录,加/speed选最快路由,加/zdr选零保留,设置一次会话内都管用。原文稍后读已读值得跟进有用关注 OpenRouter
16:02官方一手marktechpost@Asif Razzaq精选NVIDIA推出开源MoE模型Nemotron 3.5 Lightning,总参数量30B,激活参数仅3B,专为智能体执行层设计。同时发布NeMo Switchyard模型路由器,可将每个执行步骤路由到成本最低且能力足够的模型。该组合旨在降低智能体推理成本,提升执行效率。Nemotron 3.5 Lightning基于开源许可发布,开发者可自由使用。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA开源了30B MoE,激活才3B,跑起来便宜,还配了个路由器帮你省钱,搞智能体的可以看看。原文稍后读已读值得跟进有用关注 Nemotron
22:01官方账号NVIDIA AI@NVIDIAAI精选NVIDIA发布NeMo Switchyard,一个用于模型路由的开源库。该库允许在智能体工作流中为不同步骤选择不同模型,例如用前沿模型处理复杂推理和规划,用Lightning模型处理高容量、专业化执行。这能优化成本和性能。更多信息见官方链接。AI产品NVIDIANeMo Switchyard模型路由10 个信源在谈事件专题推荐理由:NVIDIA出了个新开源库,能让智能体工作流里不同步骤用不同模型,省钱又高效,搞Agent的可以看看。原文稍后读已读值得跟进有用关注 NVIDIA
01:26OpenRouter@OpenRouterAI精选OpenRouter 的 Auto Router 完成重大升级,现在根据每类任务的市场实际使用情况选择模型。当热门工作负载迁移到新模型时,路由器会在数天内跟进。官方还发布了基准测试和更多说明。用户无需手动指定模型,系统会自动匹配当前更优的选择。AI产品OpenRouterAuto Router模型路由推荐理由:OpenRouter 把自动路由改成按市场实际数据走,哪种模型跑任务用得多就帮你选,不用手动换模型。原文稍后读已读值得跟进有用关注 OpenRouter
01:25OpenRouter@OpenRouterAIOpenRouter 新增 openrouter/auto 模型字符串,可在任何常规模型字段中使用。用户可附带 cost_tier 和允许的模型列表来控制成本和范围。该功能不收取额外费用,按实际运行模型的标价计费。标准 Guardrails 仍然生效,且支持自定义允许的模型清单。AI产品OpenRouteropenrouter/auto模型路由推荐理由:OpenRouter 出了个 auto 模式,填模型名的地方写 openrouter/auto 就能自动挑模型,还能限价和指定名单,不额外收费。原文稍后读已读值得跟进有用关注 OpenRouter
18:04shao__meng@shao__mengCursor 团队发布 Router 两周后,Auto Intelligence 与 Auto Balance 两档路由配置均获提升。Auto Intelligence 的用户满意度超过 Fable 级别,成本降低 68%,其中上线后又额外下降 18%。Auto Balance 表现优于 Opus 4.8,成本降低 41%,满意度提升 3%。Cursor 还公开了 4 种模型的属性与使用方案对比表。AI产品CursorCursor Router模型路由6 个信源在谈事件专题推荐理由:Cursor 路由发布两周,Auto Intelligence 成本砍掉 68%,还公开了 4 种模型的调度思路,管 AI 预算的可以抄作业。原文稍后读已读值得跟进有用关注 Cursor
21:15官方一手Cloudflare Blog@Ming LuCloudflare 将 Workers AI 与 AI Gateway 整合为单一控制平面。开发者通过统一绑定就能访问托管 GPU 和外部模型提供商。新控制面统一了计费、可观测性和动态路由。模型优先路由功能可根据请求自动选择执行位置,简化弹性 AI 应用的构建。AI产品CloudflareWorkers AIAI Gateway推荐理由:Cloudflare 把 Workers AI 和 AI Gateway 合成一个控制台,计费监控路由全统一了,做 AI 后端的人可以少折腾几个系统。原文稍后读已读值得跟进有用关注 Cloudflare
11:05AI Engineer@aiDotEngineerAI Engineer World's Fair 2026 的 Local AI Track 已开始直播,由 NVIDIA 赞助,主题是“前沿智能正变成你拥有的东西”。首场 State of the Union 由 Joseph O'Fowa、Alex Ochema、Ahmad Osman 和 Matthew Berman 主讲。Osmantic 团队在 Desktop Frontier 环节讨论桌面端 AI,Local Models 环节由 Vincent Weisser 等探讨本地模型。Compression at the Edge 环节由 Daniel Han Chen 等讲解边缘压缩,Model Routing 环节由 Walden Yan 等讨论模型路由。全程可在这条推文附带的 YouTube 链接观看。行业AI Engineer World's Fair 2026NVIDIA本地模型7 个信源在谈事件专题推荐理由:AI Engineer 大会的 Local AI 专场正在直播,讲桌面端、本地模型、边缘压缩和模型路由,想围观最新方向就看这个。原文稍后读已读值得跟进有用关注 AI Engineer World's Fair 2026
02:18AI Engineer@aiDotEngineer精选来自NVIDIA、Cognition和OpenRouter的三位代表,在一场视频对谈中剖析了模型路由的现状。他们讨论了何时在多个模型间切换、如何组合调用,并分享了各自的判断准则。OpenRouter作为实际的路由服务,提供了落地案例。这场讨论对NVIDIA生态下的AI工程师优化模型调用成本与效果有直接参考价值。技巧OpenRouterNVIDIACognition推荐理由:想搞明白什么时候该换模型、怎么把多个模型串起来用?看NVIDIA、Cognition和OpenRouter这几个人聊,比你自己摸索快。原文稍后读已读值得跟进有用关注 OpenRouter
09:30官方账号arXiv cs.AI@Ishaan Bhola, Adithyan Krishnan, Mukunda NSSuperScout 先用 7B 的 SuperScout-7B 搜索代码仓库,生成经过沙箱验证的交接报告,再由路由器把任务分给四个前沿修复模型。在 SWE-bench Pro 的 Python 切片(266 个任务)官方预算档下,SuperScout 解决 159 个,最佳单模型解决 158 个,单次解决总成本约为后者的五分之一。在同一个 266 任务的 SWE-bench Pro 上,去掉路由器、只用最便宜修复模型加交接报告,成绩与路由系统并列,说明交接报告而非路由决策带来了成绩。配对校准研究(N=99)显示,交接报告让三个较便宜修复模型提升、最强模型略降,但各修复模型效应仅有方向性;搜索器的隐藏状态改善了成本路由,而交接报告文本本身没有。SuperScout-7B 的搜索计算在每个任务上只增加不到半美分 GPU 时间。论文SuperScoutSWE-bench Pro代码智能体推荐理由:7B搜索器先看仓库再路由,SWE-bench Pro追平最强模型,成本降五分之一,换新修复模型不用重训。原文稍后读已读值得跟进有用关注 SuperScout
04:40elvis@omarsar0Sapiom宣布完成3500万美元A轮融资,投资方包括Dragonfly、Accel和Anthropic。公司同步推出三款产品:成本感知模型路由器、Agent Studio构建工具,以及带类型化步骤图和完整追踪的Runtime。Sapiom称首要目标是降低智能体运行成本,让智能体在运行中通过统一接口支付搜索、抓取、模型访问或邮件服务。AI产品SapiomAgent Studio智能体9 个信源在谈事件专题推荐理由:做智能体的人看看:Sapiom拿了3500万美元,三件套直接管成本、搭流程、出追踪,比裸调API省心多了。原文稍后读已读值得跟进有用关注 Sapiom
02:17elvis@omarsar0Not Diamond Code 是一款面向长周期编码智能体的模型路由器,原生支持 Claude Code。它在每轮会话前自动选择模型和推理强度,并通过隐私保护的本地代理运行,请求仍由用户自己的网关执行。官方基准显示,其效果接近 Opus 4.8 Xhigh,成本降低 39%-61%。Not Diamond 还称,这种路由方式可在不影响质量的情况下将编码成本削减 20%-65%。AI产品Not DiamondClaude Code模型路由推荐理由:Claude Code 用户想省钱?这个路由器每步自动挑模型和推理档,官方说质量接近 Opus 4.8 Xhigh,成本能降四到六成。原文稍后读已读值得跟进有用关注 Not Diamond
00:57Julien Chaumond@julien_cNot Diamond 发布 Code,号称世界最强大的智能模型路由器,专为长时程编码代理设计。该路由兼容 Claude Code 等网关或框架,可为每个步骤选择最佳模型和推理力度。官方称其能将成本降低 20-65%,同时不影响输出质量。AI产品Not DiamondClaude Code模型路由推荐理由:新出的 Not Diamond Code 能在编码代理跑每一步时自动选最合适的模型,省 20-65% 的钱,效果还不打折。原文稍后读已读值得跟进有用关注 Not Diamond
23:03官方账号Decoder@Matthias BastianSakana AI更新了Fugu Ultra AI路由器至v1.1版本,声称性能比v1.0提升最多7.9个点。新版本添加了一个Claude Code兼容的端点。Sakana声称v1.1在基准测试中击败了Fable 5,尽管Fable 5并未包含在路由器的模型池中。该服务仍不支持欧盟地区,且独立验证尚未进行。AI模型SakanaFugu UltraFable 510 个信源在谈事件专题推荐理由:Sakana的新版Fugu Ultra v1.1性能提升7.9分,还多了Claude Code接口。没把Fable 5放池里就说能赢,挺有意思的。原文稍后读已读值得跟进有用关注 Sakana
11:21shao__meng@shao__mengCursor 发布 Router 功能,基于 60 万+ 条真实请求训练的分类器,按任务复杂度、上下文等维度自动路由到合适模型。Intelligence 模式下成本比 Fable 5 低约 60%,单次 commit 成本 $6.76,而 Fable 5 为 $12.69。企业客户相比全量 Opus 4.8 节省 30–50% 且质量无下降。缓存感知设计计入 prompt cache 失效成本,使数据更可信。AI产品CursorCursor Router模型路由7 个信源在谈事件专题推荐理由:Cursor 出了个路由器,自动帮你选模型,省 30–60% 的钱,质量还不掉。想省钱又不想折腾的赶紧试试。原文稍后读已读值得跟进有用关注 Cursor
08:35berryxia@berryxiaCursor今天宣布推出智能模型路由器功能,能根据任务类型自动选择最合适的模型。例如,简单任务会调用轻量模型,复杂任务则切换为强模型。官方称此举可减少高达60%的token消耗和成本,无需用户手动切换。该功能今天正式上线,开发者可立即体验。AI产品Cursor编程助手模型路由7 个信源在谈事件专题推荐理由:Cursor现在能自动帮你选最省钱的模型,写代码能省60%的token费,不用自己纠结了。原文稍后读已读值得跟进有用关注 Cursor
05:39elvis@omarsar0Cursor 发布 Router 功能,可根据任务自动选择最合适的 AI 模型。该功能将所有查询路由至单一模型时可节省 60% 成本,同时保持前沿质量。Router 支持自定义路由规则,满足不同场景的权衡需求。目前该功能为 Cursor 编辑器内置,暂未开源。AI产品CursorRouter模型路由7 个信源在谈事件专题推荐理由:Cursor 出了个 Router,能自动帮你挑最合适的模型,据说能省六成钱。想自定义路由规则也可以,挺实用的。原文稍后读已读值得跟进有用关注 Cursor
03:49Guillermo Rauch@rauchgVercel CEO Guillermo Rauch 在 X 上发帖询问用户为何使用其他 AI 模型路由/网关而非 Vercel AI Gateway。帖子获得 36 条回复、6 次转发、96 个点赞和 34 次分享。Rauch 称“同时押注每个模型”(Bet on every model at once),并附上产品链接。该帖子聚焦于 AI 网关市场竞争动态。行业VercelAI Gateway模型路由推荐理由:Vercel 老大直接问用户为什么不选自家 AI Gateway,想了解行业怎么选的就看看这个帖子。原文稍后读已读值得跟进有用关注 Vercel
07:09elvis@omarsar0精选Ramp 发布了 Ramp Router,一个模型路由服务,允许在智能体工作流的不同步骤中使用不同模型。该服务基于 Ramp 三年前为 7 万客户构建的内部 LLM 路由器,现通过 OpenAI 兼容端点开放给所有人。Ramp Router 支持 GPT、Claude、Gemini、Grok、Qwen、DeepSeek、Kimi、GLM 等模型,可根据请求自动选择最优模型,在降低成本的同时保持性能,且无需重写应用代码。AI产品RampRamp Router模型路由10 个信源在谈事件专题推荐理由:Ramp 把内部跑了几年的模型路由拿出来,一个接口就能自动选最合适的模型,省钱又省心,适合做智能体开发的人试试。原文稍后读已读值得跟进有用关注 Ramp
17:39IT之家(博客/媒体)Anthropic高管在红杉资本《Training Data》播客中表示,企业不应因成本上升而减少AI使用。Claude平台产品负责人Angela Jiang称,部分客户因预算限制削减投入,但这是错误做法。平台工程负责人Katelyn Lesse建议通过优化策略(如用更低成本模型替代Opus)实现相同结果,而非设定上限。Anthropic正考虑在Claude生态内推出模型路由功能。同时,OpenAI CEO奥特曼宣称GPT-5.6 sol在相同任务下价格仅为Anthropic Fable 5的一半,引发价格竞争。行业AnthropicClaudeOpenAI10 个信源在谈事件专题推荐理由:Anthropic高管劝你别因为省钱就砍AI投入!他们分享了如何更聪明地用Claude,比如换模型、路由调度,还有和OpenAI的价格战内幕。原文稍后读已读值得跟进有用关注 Anthropic
01:11elvis@omarsar074°DeepMind 新论文提出 LLM 路由器的两个关键属性:行为分化(模型间输出不同)和表面形式重写稳定性(同一查询的不同表述应路由到同一专家)。实验表明,仅看准确率和成本可能掩盖无意义的路由(如冗余模型池或分配不一致)。论文编号 arxiv.org/abs/2607.09197,提供实用检查方法。论文DeepMind模型路由LLM推荐理由:DeepMind 这篇论文告诉你,别被路由器的漂亮数字骗了——模型都答一样或乱分配,路由就是摆设。原文稍后读已读值得跟进有用关注 DeepMind
00:36OpenRouter@OpenRouterAIOpenRouter 发布 ~x-ai/grok-latest 端点,当前指向 Grok 4.3,用户无需修改代码即可在 Grok 4.5 上线后自动升级。该端点始终路由到最新版 Grok,开发者只需一次集成即持续获取后续迭代。实测通过 openrouter.ai/~x-ai/grok-latest 可直接调用,并支持未来版本无缝切换。AI产品GrokOpenRouter自动升级推荐理由:用 OpenRouter 这个新端点,不用改一行代码就能自动用上最新 Grok 模型,省心省力。原文稍后读已读值得跟进有用关注 Grok
12:08Ethan Mollick@emollickEthan Mollick 提出,前沿模型(如 GPT-4、Claude 3)未来可充当“路由器”,自行将复杂任务分解并委派给更廉价的模型执行。这种架构让单一智能体调用多个专用模型,有望降低总体推理成本。Mollick 认为目前的模型能力被低估,未来将出现“智能规划器 + 廉价执行器”的组合。行业前沿模型智能体模型路由推荐理由:前沿模型不做所有事,而是当领导安排任务给便宜模型——这个思路很有意思,值得看看原文稍后读已读值得跟进有用关注 前沿模型
15:01Jerry Liu@jerryjliu0精选Cognition 的 Devin Fusion 采用混合模型架构,引入“sidekick” 小模型与前沿模型并行运行。前沿模型负责任务规划、进度监控和最终审查,小模型处理具体工作。这种设计在保证智能的同时避免不必要的 frontier 模型开销,并确保所有子代理能利用累积上下文缓存。该方法能提升缓存命中率,降低推理成本。技巧Devin FusionCognition模型路由推荐理由:Cognition 的 Devin Fusion 用一个小模型当副手,让主力模型专心做决策,省资源还提高缓存效率,做多代理系统的人值得看。原文稍后读已读值得跟进有用关注 Devin Fusion
16:18Geek@geekbb精选网友分享的 Gentle-AI 配置串联 11 个不同职能的智能体,使用低成本 Flash 模型处理大部分上下文,仅在设计(Qwen)和编码(Kimi Code)等关键环节调用高性能模型。每日成本控制在 4~7 美元,并通过多智能体对齐审查显著降低幻觉率。该 per-phase model routing 策略可适配 15 种 AI 编程工具。技巧Gentle-AIQwenKimi Code推荐理由:挺实用的配置:11个智能体分工,Flash模型省成本,Qwen和Kimi Code干重活,每天才4-7美元,还降幻觉。原文稍后读已读值得跟进有用关注 Gentle-AI
01:46elvis@omarsar0AI 研究员 Omar 指出,随着超级强大的 AI 模型即将发布,当前最大的错误是锁定单一供应商。他建议从成本和工程角度出发,规划如何利用多种模型组合,包括开源模型。通过模型路由(routing)将任务分配给最适合的模型,能获得灵活性、数据控制权和用例自由。这对 AI 工程师和研究者来说,是未来工程化的关键策略。行业模型锁定模型路由开源模型推荐理由:Omar 点破了模型锁定的风险,做 AI 工程和选型的团队值得花时间规划模型路由策略,避免被单一供应商绑架。原文稍后读已读值得跟进有用关注 模型锁定
23:46elvis@omarsar0Elvis 在推文中警告,未来几周将发布超级强大的 AI 模型,可能带来能力阶跃变化。他建议不要锁定单一供应商,而应从工程角度考虑如何组合使用多种模型(包括开源模型),以便随时切换并利用各自优势。对于编程智能体,开源模型已与前沿模型相当。他推荐将 AI 模型路由作为工程重点,以高效分配任务。行业AI模型模型路由开源模型推荐理由:Elvis 点出了 AI 模型即将爆发的关键节点,做 AI 工程和智能体开发的团队应该立刻开始规划模型路由策略,避免被单一供应商绑定。原文稍后读已读值得跟进有用关注 AI模型
18:42Julien Chaumond@julien_cCoinbase CEO Brian Armstrong 在 X 上分享了对模型路由趋势的看法,认为对智能的需求近乎无限,但未来 12-18 个月内,80% 的工作负载将运行在便宜 99% 的模型上,仅 20% 需要最新高端模型。他类比高端 MacBook 或游戏 PC 的配置比例,指出价格下降速度远超摩尔定律,因此瓶颈将是能源和算力而非模型本身。Coinbase 正积极将提示路由到更便宜的模型,在 token 使用量指数增长的同时保持成本基本持平。行业模型路由成本优化Coinbase推荐理由:做 AI 应用或负责成本优化的团队,这条关于模型路由的洞察直接关系到你的预算和架构选择——Coinbase 已经验证了在 token 使用暴增时成本可控的路径,值得参考。原文稍后读已读值得跟进有用关注 模型路由
13:30Jerry Liu@jerryjliu0精选Jerry Liu(LlamaIndex 创始人)认为,AI 创业公司将在“模型路由即服务”领域积累大量价值,这不仅是 OpenRouter 这样的通用路由,还包括垂直化的智能体和基础设施。他以文档基础设施(解析、提取、搜索)和网络搜索(Exa/Parallel)为例,说明在准确性与成本的帕累托曲线上找到最佳点既重要又困难。Brian Armstrong 补充说,未来 80% 的工作负载将运行在便宜 99% 的模型上,只有 20% 需要最新高端模型,而 Coinbase 已通过路由提示词到更便宜的模型来保持成本稳定。这揭示了模型路由作为降低 AI 应用成本、提升效率的关键基础设施,对开发者和创业公司是巨大机会。行业模型路由AI 基础设施成本优化推荐理由:模型路由是 AI 应用降本增效的关键,做 AI 产品、智能体或基础设施的团队值得关注——它可能成为下一个像 API 网关一样的基础设施层。原文稍后读已读值得跟进有用关注 模型路由
08:42elvis@omarsar0AI专家警告,未来几周将有超级强大的AI模型发布,模型能力可能迎来阶跃式变化。最大的错误是锁定单一供应商,应从成本和工程角度考虑组合使用多种模型(包括开源模型)。对于编程智能体,开源模型已与前沿模型相当。建议提前规划任务路由策略,AI模型路由是高回报的工程方向。行业AI模型模型路由开源模型推荐理由:AI能力即将跃升,锁定单一供应商是最大风险——做AI工程和智能体开发的团队,现在就该规划模型路由策略,建议点开看看具体怎么准备。原文稍后读已读值得跟进有用关注 AI模型
03:09Jerry Liu@jerryjliu0精选LlamaIndex 创始人 Jerry Liu 指出,没有前沿实验室能独占成本、延迟与精度的帕累托前沿所有点,开源模型在成本上可低数个数量级。他观察到组织对模型路由和成本优化的兴趣激增,原因包括企业更谨慎管理成本,以及 AI 初创公司寻求构建护城河和提高毛利率。他引用 Chamath 的数据对比:每月 10 亿 token 输入/输出场景下,GPT-5.5 Pro 成本约 10.5 万美元,而 DeepSeek V4 Pro 仅需 5220 美元,能力差距远小于价格差距。Jerry 认为,随着控制平面(如 Software Factory)普及,前沿实验室收入增速将下降,开源模型收入将飙升。行业开源模型成本优化模型路由推荐理由:Jerry Liu 用真实成本数据揭示了模型选择的巨大经济差异,做 AI 应用选型或成本控制的团队值得仔细看——选对模型能省下 20-40 倍 token 成本。原文稍后读已读值得跟进有用关注 开源模型
23:42OpenRouter@OpenRouterAIOpenRouter 的 Pareto Router 目前每天处理近 10 亿 tokens,而 Auto Router 处理 120 亿 tokens。Pareto Router 专为编程场景设计,用户只需设定智能水平和成本上限,系统会自动选择最佳模型。这为 AI 编程用户提供了一种高效节省成本的方式,同时 Workspaces 功能支持设置最大使用量。该工具被评价为最被低估的 AI 编程成本节省方案。AI产品OpenRouterPareto Router编程助手推荐理由:AI 编程用户想省成本又不想牺牲效果,Pareto Router 直接帮你选最优模型,比手动调模型省心太多,建议试试。原文稍后读已读值得跟进有用关注 OpenRouter
19:13小互@imxiaohu国内团队开源了 OpenSquilla,用 Python 重写了“小龙虾”项目,解决了其 Token 消耗高、不按规则执行和安全问题。它集成本地小模型,对请求进行智能路由:简单任务派给便宜模型,复杂任务才用顶级模型,类似医院分诊。官方测试显示,25 个任务混合使用 Opus 4.7、GLM 5.1 和 DS4 Flash,成本从 6.2 美元降至 0.68 美元,效果几乎一致。此外,它还能根据对话语义只注入匹配度最高的 Skill,避免将所有 Skill 描述塞入上下文,100 次对话可省 100 万 Token。AI产品开源/仓库Token 优化模型路由推荐理由:AI 调用成本高、Token 浪费严重的团队终于有了实用解法——OpenSquilla 智能路由能省 90% 费用,做多模型编排或 Skill 密集型应用的开发者值得立刻试试。原文稍后读已读值得跟进有用关注 开源/仓库