01:14官方一手AWS Machine Learning Blog@Aakanksha Veesam精选Amazon Bedrock实现查询感知上下文压缩,通过在主模型回答前过滤检索到的片段,减少输入令牌和成本,同时保持答案质量。AI模型RAGAmazon Bedrock查询感知压缩推荐理由:Amazon Bedrock新技巧降低RAG成本,提升效率。原文稍后读已读值得跟进有用关注 RAG
02:19lmarena.ai@lmarena_ai精选Agentic AI 会话中缓存失效后发送简单的“hi”可能花费 1 美元。这是因为系统需要重新处理百万级 token 的上下文,而非仅处理当前输入。即使发生 1 个 token 的工具调用,cache miss 也需为上下文支付全额价格。Claude Code/Codex 可能会在 200-300K token 处进行上下文压缩以控制成本。技巧Agentic AIClaude Code智能体推荐理由:揭秘 Agentic AI 缓存失效为何要 1 美元,Claude Code 怎么省钱。原文稍后读已读值得跟进有用关注 Agentic AI
15:08shao__meng@shao__meng71°Claude Code 成本由模型、输入输出类型和提示词缓存决定,其中输出 token 价格约为输入的 5 倍,thinking token 占输出大头。缓存读取仅 0.1× 价格,但切换 /model、/effort 或开启 Fast mode 会击穿缓存,导致全价重新 prefill。会话中读过的文件和命令输出会在每轮重复计费,第 40 轮需重读前 39 轮,长会话成本超直觉。建议任务间用 /clear、@提及文件省去 Read 调用、给命令加静默参数,并在缓存 1 小时过期前用 /compact 压缩。技巧Claude CodeSubagent编程助手推荐理由:这篇把 Claude Code 的省钱门道讲透了:缓存怎么省、什么时候切模型便宜、哪些命令输出是隐形开销。适合天天用 Claude Code 写代码的人照着调。原文稍后读已读值得跟进有用关注 Claude Code
19:47小互@imxiaohu72°OpenAI发布GPT-5.6构建者指南,教开发者将Agent账单从33美元降至1.33美元。指南涉及模型选择、推理档位和三个新API开关的具体配置。6家创业公司提供了线上实测数据。核心思路是改用中小型号并优化架构,无需无脑上旗舰模型也能达到同等效果。技巧GPT-5.6OpenAI智能体10 个信源在谈事件专题推荐理由:想省Agent成本?OpenAI官方指南给了具体配置和实测数字,照着改就能把账单砍到零头。原文稍后读已读值得跟进有用关注 GPT-5.6
03:06Harrison Chase@hwchase17LangChain作者Harrison Chase提出一个省token的技巧:在调用昂贵Agent前,先让轻量分类器判断输入是否值得运行。只有分类器判定满足条件时,才启动完整Agent流程。这能避免把简单任务也丢给重型模型,烧掉大量token。该建议是对SrinathJ“不是人人都能烧万亿token”的回应。技巧智能体轻量分类器成本优化推荐理由:LangChain作者分享:跑贵Agent前先用便宜分类器筛一道,省token,简单任务不用烧钱。原文稍后读已读值得跟进有用关注 智能体
00:41Harrison Chase@hwchase17UnifyGTM 联合创始人兼 CTO Heggie Connor 做客 Max Agency 播客,分享产品上线前的成本优化经验。团队在发布前两周将运营成本削减了 90% 至 95%。他解释了为何他们的子代理只是一个函数调用。访谈可在 Apple Podcasts、Spotify 和 YouTube 上收听。技巧Max AgencyUnifyGTM智能体推荐理由:UnifyGTM CTO在Max Agency播客里讲,上线前两周砍掉90-95%成本,子代理就一个函数调用,挺有意思。原文稍后读已读值得跟进有用关注 Max Agency
18:04shao__meng@shao__mengCursor 团队发布 Router 两周后,Auto Intelligence 与 Auto Balance 两档路由配置均获提升。Auto Intelligence 的用户满意度超过 Fable 级别,成本降低 68%,其中上线后又额外下降 18%。Auto Balance 表现优于 Opus 4.8,成本降低 41%,满意度提升 3%。Cursor 还公开了 4 种模型的属性与使用方案对比表。AI产品CursorCursor Router模型路由6 个信源在谈事件专题推荐理由:Cursor 路由发布两周,Auto Intelligence 成本砍掉 68%,还公开了 4 种模型的调度思路,管 AI 预算的可以抄作业。原文稍后读已读值得跟进有用关注 Cursor
09:40shao__meng@shao__meng81°Databricks 根据自身实践和 Stripe、Coinbase、Uber 的经验,总结出四个降低 AI 编程成本的杠杆:迁移到开源/低成本模型、动态路由、渐进式摩擦和削减 Token 开销。实测中,任务级路由让成本下降 30% 以上,上下文压缩让 Token 量减少近 50%,组合策略最高可省 90%。Stripe 测试 Opus 4.7 后认为其性价比不足,拒绝上线。Databricks 将 Unity AI Gateway 和 Omnigent 以开源或免费形式放出。技巧DatabricksOmnigentUnity AI Gateway推荐理由:Databricks 把自家压成本的套路公开了:换便宜模型、动态路由、限流、砍上下文,最高省 90%,还开源了工具。原文稍后读已读值得跟进有用关注 Databricks
11:54量子位@克雷西精选一家拥有亿级日活App的出海AI团队,因推理成本倒挂陷入算力压力。他们通过重构为跨云架构,将GPU集群规模砍掉75%。文章拆解了这套跨云方案的实施路径,以及如何应对出海场景下的“三重算力锁链”。技巧跨云架构推理成本GPU集群推荐理由:一家出海AI团队靠跨云架构把GPU集群砍掉75%,推理成本倒挂的解法都拆开了,做AI应用的真该看看。原文稍后读已读值得跟进有用关注 跨云架构
11:32shao__meng@shao__meng精选在 chatbot 阶段只需关注每个 token 的单价,而 agent 任务会进行多轮 loop、tool call 和代码执行,总 token 消耗与轮数影响更大。Cline 指出,仅比较 DeepSeek V4-Flash 与 Fable 的每 token 价格会误导,因为轮次增多可能导致单任务总成本更高。计算单个任务成本需综合 token 消耗总数、每 token 成本和缓存比例。ArtificialAnlys 的报告显示,DeepSeek 完成相同基准任务的总成本比 Fable 低 105 倍。技巧DeepSeek V4-FlashClineFable10 个信源在谈事件专题推荐理由:选 agent 模型别光看 token 单价,这帖讲了 task 成本公式,实测 DeepSeek 比 Fable 总成本低 105 倍。原文稍后读已读值得跟进有用关注 DeepSeek V4-Flash
06:09elvis@omarsar0omarsar0在推文中称,DeepSeek V4-Flash等模型的token效率被低估,建议更激进地尝试不同测试框架。他提醒,DeepSeek V4-Flash的每token价格虽便宜,但多轮交互可能使单任务总成本更高。@ArtificialAnlys报告称,DeepSeek完成与Fable相同的基准任务时,总成本仅为Fable的1/105。AI模型DeepSeek V4-FlashFabletoken效率10 个信源在谈事件专题推荐理由:别光看每token单价:DeepSeek V4-Flash跑同基准总成本比Fable低105倍,这条推文有数据。原文稍后读已读值得跟进有用关注 DeepSeek V4-Flash
14:14官方账号Latent Space (swyx)(博客/媒体)OpenAI将GPT 5.6价格下调20%-80%。由于GPT 5.6的递归自我优化,GPT 5.4的智能成本在4个月内下降了13倍。蒸馏技术在其中起到关键作用。AI模型GPT 5.6GPT 5.4模型蒸馏10 个信源在谈事件专题推荐理由:GPT 5.6大幅降价,最高降八成,四个月前GPT 5.4的算力成本现在只要十三分之一,做AI应用的成本压力能小不少。原文稍后读已读值得跟进有用关注 GPT 5.6
23:13Ideogram@ideogram_aiP-Image-Ideogram是Ideogram与PrunaAI合作开发的图像生成模型系列,追求质量、速度和成本的最佳平衡。该系列提供四种质量模式,支持原生1K和2K分辨率生成,每张图像最低仅需0.003美元。模型现已通过API及合作伙伴平台上线。AI模型P-Image-IdeogramIdeogramPrunaAI1 个信源在谈事件专题推荐理由:Ideogram和PrunaAI合作的新图像模型P-Image-Ideogram,四种模式可选,原生2K,每张图最低3厘钱,API已开放,快去试试。原文稍后读已读值得跟进有用关注 P-Image-Ideogram
10:30官方账号Simon Willison@simonw精选GPT-5.6 通过 Codex 分析生产流量、改进负载均衡、重写 GPU kernel 和运行数百次推测解码实验,将端到端服务成本降低 20%。推测解码使 token 生成效率提升超 15%。这些优化为 OpenAI 每月节省数十亿美元成本。AI模型GPT-5.6Codex推理模型10 个信源在谈事件专题推荐理由:GPT-5.6 自己优化自己,服务成本降了20%,生成效率提了15%,省下来的钱都能买好几个数据中心了。原文稍后读已读值得跟进有用关注 GPT-5.6
12:27官方一手歸藏(guizang.ai)@op7418精选Codepilot 推出了 Subagent 功能,允许用户在一个聊天中启用多个由不同模型驱动的子智能体。例如可用 Grok 检索 Twitter 信息、DeepSeek 生成文案、K3 生成网页、GLM 5.2 统筹。该设计旨在发挥各模型长处,同时减少昂贵模型的消耗,降低使用成本。技巧CodepilotGrokDeepSeek推荐理由:Codepilot 这个 Subagent 功能真香,一个聊天里混用 Grok、DeepSeek、GLM 5.2 等模型,各取所长还省钱,试试看。原文稍后读已读值得跟进有用关注 Codepilot
15:03IT之家(博客/媒体)Runway 推出 Media Router,将模型选择标准归纳为质量、处理速度、成本三项。系统根据单次请求优先级自动切换模型,场景分为高速生成、低速高质、质量中等低成本。该服务已在开发者平台 Runway Dev 上线,支持生成图片、视频和音频,可调用 Seedance、GPT Image 2、ElevenLabs 等模型。AI产品RunwayMedia Router多模型推荐理由:Runway 搞了个新工具 Media Router,能根据场景自动帮你选最合适的模型,省心又省 token。原文稍后读已读值得跟进有用关注 Runway
11:21shao__meng@shao__mengCursor 发布 Router 功能,基于 60 万+ 条真实请求训练的分类器,按任务复杂度、上下文等维度自动路由到合适模型。Intelligence 模式下成本比 Fable 5 低约 60%,单次 commit 成本 $6.76,而 Fable 5 为 $12.69。企业客户相比全量 Opus 4.8 节省 30–50% 且质量无下降。缓存感知设计计入 prompt cache 失效成本,使数据更可信。AI产品CursorCursor Router模型路由7 个信源在谈事件专题推荐理由:Cursor 出了个路由器,自动帮你选模型,省 30–60% 的钱,质量还不掉。想省钱又不想折腾的赶紧试试。原文稍后读已读值得跟进有用关注 Cursor
08:35berryxia@berryxiaCursor今天宣布推出智能模型路由器功能,能根据任务类型自动选择最合适的模型。例如,简单任务会调用轻量模型,复杂任务则切换为强模型。官方称此举可减少高达60%的token消耗和成本,无需用户手动切换。该功能今天正式上线,开发者可立即体验。AI产品Cursor编程助手模型路由7 个信源在谈事件专题推荐理由:Cursor现在能自动帮你选最省钱的模型,写代码能省60%的token费,不用自己纠结了。原文稍后读已读值得跟进有用关注 Cursor
06:42官方一手marktechpost@Michal SutterCursor将Cursor Router正式面向Teams和Enterprise计划开放。该系统根据查询、上下文、任务复杂度和领域对每个请求进行分类,并路由到最合适的模型。在线A/B测试显示前沿质量输出成本节省60%,三个早期企业账户与Opus 4.8相比节省30-50%。Cursor Router旨在在不牺牲编码质量的前提下大幅降低模型调用开销。AI产品CursorCursor Router编程助手7 个信源在谈事件专题推荐理由:Cursor出了个Router,自动判断你的代码问题该用哪个模型,省钱还保质量,比直接上Opus便宜30-50%。原文稍后读已读值得跟进有用关注 Cursor
21:52Ate-a-Pi@svpino通过将代码中model参数替换为ship-like/前缀(如model='ship-like/your-favorite-model'),即可使用智能路由服务。该服务承诺相比直接连接模型节省50%成本,同时保持100%的能力和行为一致性。其核心是在收到请求后动态决定计算量、模型组合、工具和执行方式。代价是增加额外延迟,但对多数开发者来说性价比很高。技巧ship-like智能路由模型调用推荐理由:你写代码调模型时,试试在model前加个ship-like/,据说能省一半钱,功能和效果丝毫不差。适合追求性价比的开发者。原文稍后读已读值得跟进有用关注 ship-like
19:49官方账号阿里云 Alibaba Cloud@alibaba_cloudEaseMate AI利用阿里云的AIGC服务和LLM(包括Qwen模型)提升全球创新效率。结果实现实时内容审核准确率超过99.5%,API成本降低20%。该案例展示了阿里云AI平台的性能与安全平衡。行业Alibaba CloudQwenEaseMate推荐理由:阿里云晒出真实客户案例:EaseMate用他们AI服务,内容审核准到99.5%以上,还省了20%成本,做AI平台的人都该看看。原文稍后读已读值得跟进有用关注 Alibaba Cloud
05:06官方账号Google DeepMind@GoogleDeepMindGoogle DeepMind 推出 Gemini 3.5 Flash-Lite,一款针对票据分类、数据提取等高重复性场景优化的快速低成本模型。该模型在多个高吞吐任务上与 Gemini 3.5 Flash 进行对比演示,强调更低计算开销和相近性能。Flash-Lite 专为规模扩展设计,适合需要高效处理大量简单查询的用例。AI模型Gemini 3.5 Flash-LiteGoogle DeepMind轻量模型10 个信源在谈事件专题推荐理由:Google DeepMind 出了个更轻量的 Gemini 3.5 Flash-Lite,专门跑重复性任务,又快又便宜,适合批量处理场景。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash-Lite
03:25elvis@omarsar0Thesean 发布了 Ship 端点的测试版,通过修改 model="original" 为 model="ship-like/original",每次请求固定降低 50% 成本。Ship 保留原有模型的提示词、输出格式和工具行为,在幕后选择最高效的运行方式并匹配原模型质量。如果请求执行成本高于用户支付,Thesean 承担差额。用户可选择削减账单或保持预算不变,运行两倍的智能体、重试和验证来提升输出质量。Ship 已支持 Opus 和 GPT 5.6 Sol,提供 50% 的保证节省和质量 SLA。AI产品TheseanShip成本优化推荐理由:Thesean 的 Ship 让你的 LLM 调用费直接砍半,还能保留原模型名和质量,省下来的钱可以跑更多实验,实用。原文稍后读已读值得跟进有用关注 Thesean
10:24shao__meng@shao__meng76°Cursor 团队用 Agent Swarm 系统从零实现 SQLite,依据 835 页文档用 Rust 编写并 100% 通过 withheld 的 sqllogictest。新 harness 下,Opus 4.8 规划 + Composer 2.5 执行成本约 $1,339,而全程用 Fable 5 则需 $20,057,质量相近。关键工程发现:协调成本和上下文效率比并行更重要,新系统冲突低于 1000 次,旧系统超 7 万次。成本大头在于更贵模型的规划决策,但廉价 worker 可承担 90%+ 的 token 消耗。AI模型CursorOpusComposer8 个信源在谈事件专题推荐理由:Cursor 团队晒出的 swarm 实战:用 Opus 规划、Composer 执行,四小时从零写出能通过全套测试的 SQLite,成本只要一千刀出头。工程细节很硬核,值得看他们怎么解决多 agent 的协调问题。原文稍后读已读值得跟进有用关注 Cursor
20:15Dify@dify_aiDify团队在博客中总结了四个降低AI成本的实践模式:为每个任务选择合适规模的模型、用注解回复缓存重复答案、自托管以获得可预测容量、按节点追踪成本延迟和质量。文章指出AI成本不随使用量线性增长,而是随未优化的架构膨胀。这些技巧帮助团队将预算花在关键环节,而非盲目削减开支。技巧DifyLLMLLMOps推荐理由:Dify团队总结了四个省钱又高效的AI部署模式,尤其适合企业开发者控制成本。原文稍后读已读值得跟进有用关注 Dify
11:34官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里云发布面向游戏、营销、媒体和电商等场景的AI视频模型,支持生成电影级画面和一致多镜头叙事。该方案针对高批量视频生产提供最高47%的成本节省。创作者和企业可通过阿里云平台直接体验并开始使用。AI产品阿里云AI视频生成成本优化推荐理由:阿里云出了AI视频生产方案,能帮你省下最多47%的成本,还能做多镜头叙事,适合游戏、电商这些场景。原文稍后读已读值得跟进有用关注 阿里云
01:15lmarena.ai@lmarena_ai精选UC Berkeley博士生Melissa Pan在Arena发表研究BRANE,通过优化完整系统配置而非仅LLM路由,将Agent系统成本降低89%,同时匹配最佳静态配置100%的准确率。该研究对比了多种方案,验证了全面配置优于单一LLM路由。BRANE在多个基准测试中展示了成本与准确率的平衡。论文BRANE智能体成本优化推荐理由:UC Berkeley的研究发现,优化Agent系统配置比单换LLM更省钱省力,能砍掉89%成本还不掉准头,做AI应用的可以看看。原文稍后读已读值得跟进有用关注 BRANE
23:40Milvus@milvusio精选Milvus 团队指出,用 demo 估算生产环境向量数据库成本常忽略三大隐性因素:数据更新(增删改、重索引)带来的计算开销、离线分析/评估任务与在线服务共用基础设施导致的工作负载错配、以及同一 AI 数据在向量搜索、湖仓、训练等系统间的重复存储。以某自动驾驶场景为例,1B 行数据集合的向量搜索每月仅需运行几小时,专用集群预估 $7,000/月,Serverless 约 $10,800/月,而 Zilliz Cloud On-Demand Search 成本不到 $500/月。建议将稳定在线流量匹配专用容量、突发在线需求用 Serverless、低频分析用按需计费。技巧MilvusZilliz Cloud向量数据库推荐理由:Milvus 聊了向量数据库成本容易算漏的三个坑,还拿自动驾驶 10 亿行数据举例,用对方案能省十几倍钱。原文稍后读已读值得跟进有用关注 Milvus
20:05Junyang Lin@JustinLin610作者JustinLin610指出前沿模型效果好但成本高,个人订阅用户可最大化token使用量(如Codex月费200美元可产生超8000美元token消耗)。企业按token计费时,可将简单格式化任务分配给Seed、Qwen、DeepSeek等便宜模型,复杂智能体任务交给Fable、Sol。GLM 5.2编码能力接近Claude和GPT,Grok类似。合理设计系统能提升生产力且不增加成本。技巧ClaudeGPTDeepSeek推荐理由:如果你用AI时总担心费用,这篇聊透了怎么把便宜模型(如Qwen、DeepSeek)和贵模型(Claude、GPT)搭着用,省成本又出活。原文稍后读已读值得跟进有用关注 Claude
03:11lmarena.ai@lmarena_ai精选73°Muse Spark 1.1 在 Code Arena: Frontend 基准测试中排名第9,得分1541,混合成本350万美元(输入每百万token 1.25美元,输出每百万token 4.25美元)。Meta 称这款模型重塑了成本-性能帕累托前沿,以低廉价格提供前沿表现。同时,Meta 推出了新 Meta Model API 公开预览,开发者可通过该 API 访问 Muse Spark 1.1,模型也已在 Meta AI 应用的“Thinking”模式上线。AI模型Muse Spark 1.1Meta代码生成推荐理由:Meta 发了 Muse Spark 1.1,代码生成得分1541,成本只要350万美元,比同类便宜不少,适合做前端开发的玩家。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
15:04IT之家(博客/媒体)精选Anthropic 官方推荐将 Claude Fable 5 作为规划层、Sonnet 5 作为执行层来降低使用成本。在顾问模式下,Sonnet 5 主执行,必要时才调 Fable 5,在 SWE-bench Pro 基准上达到 Fable 5 单独运行 92% 性能,成本仅 63%。在协调者模式下,Fable 5 分配子任务给多个 Sonnet 5 智能体,在 BrowseComp 基准上实现 96% 性能,成本为 46%。技巧Claude Fable 5Sonnet 5Anthropic10 个信源在谈事件专题推荐理由:Anthropic 教你两种搭配方案,用便宜好用的 Sonnet 5 分担大部分活,成本降到一半甚至更低,性能几乎不掉。原文稍后读已读值得跟进有用关注 Claude Fable 5
06:22Jerry Liu@jerryjliu0LlamaIndex 旗下 LlamaParse 推出改进的智能路由层,能根据页面复杂度自动选择文档解析方式。简单文本优先使用低成本 OCR 技术,复杂页面(密集表格、图表)则切换为视觉语言模型(VLM)以保持准确度。用户可一键在产品中切换。该功能旨在降低处理成本,同时保证质量。AI产品LlamaParseLlamaIndexOCR推荐理由:LlamaParse 现在会根据页面难度自动选解析方式,简单文档用 OCR 省成本,复杂表格才上 VLM,想省钱又不想降精度的话可以试试。原文稍后读已读值得跟进有用关注 LlamaParse
05:59elvis@omarsar0精选Databricks联合创始人Matei Zaharia在推文中分享了内部编码智能体基准测试结果。Pi harness在Opus和GPT模型上获得相同成功率,但成本降低2倍。GLM 5.2被描述为开源编码智能体性能的一次重大进步。测试表明包括开源在内的许多模型已达到真正具有竞争力的水平。AI模型PiOpusGPT推荐理由:Matei Zaharia刚透露Databricks实测:用Pi harness成本省一半,效果和Opus、GPT一样好;GLM 5.2这个开源模型也追上来了。原文稍后读已读值得跟进有用关注 Pi
00:49官方账号Decoder@Matthias Bastian精选Anthropic推荐将昂贵的Claude Fable 5作为规划者,将任务委派给较小的Sonnet 5。采用Advisor模式后,组合方案达到Fable 5单独性能的92%,成本仅为63%。此模式可大幅降低使用Fable 5的推理开销,适合预算敏感场景。技巧Fable 5Sonnet 5Anthropic10 个信源在谈事件专题推荐理由:想省钱又用上Fable 5?让它当经理分配任务给Sonnet 5,性能几乎不减,成本省三成。原文稍后读已读值得跟进有用关注 Fable 5
07:03LlamaIndex@llama_indexLlamaParse Cost Optimizer推出改进,智能层级路由更可靠地平衡成本与准确性。在处理大型文档时,简单页面默认使用低成本层级,复杂页面仍由高准确率、高成本的agentic和agentic plus层级处理。用户只需为每页实际所需的质量付费,该功能现已对所有客户生效。AI产品LlamaParse文档解析成本优化推荐理由:LlamaParse升级了成本优化器,自动把简单页用便宜方案、复杂页用贵方案,按需付费省钱了。原文稍后读已读值得跟进有用关注 LlamaParse
05:21OpenRouter@OpenRouterAI精选OpenRouter 用 1,730 道视觉推理题测试了 5 个模型,检验将图片细节设为“low”的省钱技巧。结果发现该技巧适得其反:模型为看清模糊图像消耗更多推理 token,总体成本不降反升。这一发现提示开发者在使用视觉模型时需谨慎选择图片细节参数。AI模型OpenRouter推理模型多模态推荐理由:想省成本把图设成低清?OpenRouter 测了5个模型1730道题,告诉你这招可能更费钱。原文稍后读已读值得跟进有用关注 OpenRouter
05:19OpenRouter@OpenRouterAIOpenRouter 发布博客对比推理模型与非推理模型在不同细节设置下的成本与性能。推理模型推荐保持 auto 或 high 细节以保留精度;非推理模型设为 low 细节可真实节省费用和延迟,但需接受准确度损失。博客附有详细基准表格和每模型分表,帮助用户按需选择。技巧OpenRouter推理模型成本优化推荐理由:OpenRouter 实测告诉你:非推理模型调低细节真的能省钱省时间,但推理模型别省,自己看表格选策略。原文稍后读已读值得跟进有用关注 OpenRouter
16:29AI Will@FinanceYF5第三方服务商通过SGLang推理引擎、Prefill-Decode解耦架构、专家并行技术及AMD MI300 GPU,将DeepSeek模型的API调用成本降至官方价格的1/5。该技术栈组合显著降低了推理开销,使小型团队和企业能以更低成本使用高性能模型。方案中涉及的专家并行与Prefill-Decode分离是核心优化手段。技巧DeepSeekSGLangAMD MI300推荐理由:想低成本跑DeepSeek?有第三方用SGLang和AMD MI300把API成本压到官方的五分之一,技术方案公开,值得参考。原文稍后读已读值得跟进有用关注 DeepSeek
02:37官方账号Decoder@Matthias Bastian精选开源工具pxpipe通过将长文本提示转换为紧凑PNG图片,利用Anthropic按像素而非文本内容收费的定价策略来节省费用。开发者Steven Chong报告在Claude Code和Fable 5上实现了59%到70%的token成本降低。这种节省以牺牲准确性和速度为代价。该工具完全免费且开源。AI产品pxpipeClaude CodeFable 510 个信源在谈事件专题推荐理由:想省Claude Code的token费?试试pxpipe,把提示藏进PNG,据说能省70%,不过会慢点。原文稍后读已读值得跟进有用关注 pxpipe
04:06官方账号Tri Dao (FlashAttention)@tri_dao精选Etched公司仅用2年就完成了芯片设计和出货。该芯片将注意力机制硬编码到硅片中,实现了极高的模型利用率(MFU)。这种为LLM推理定制的硬件有望将智能成本降低10倍。AI产品Etched推理芯片LLM推理3 个信源在谈事件专题推荐理由:Etched把注意力写进芯片里,2年搞定,LLM推理成本要降10倍了。原文稍后读已读值得跟进有用关注 Etched