14:43IT之家(博客/媒体)72°OpenAI 投资的美国法律科技公司 Harvey 基于中国 Kimi K3 模型构建新模型 Harvey Tenet,实现业界领先性能。Harvey 转向开放权重模型,降低推理成本,优于 Fable 5 和 GPT-5.6 Sol。AI模型Kimi K3法律 AI开源模型6 个信源在谈事件专题推荐理由:Harvey 用 Kimi K3 模型打造法律 AI,比 Fable 5 和 GPT-5.6 Sol 强,成本还低。原文稍后读已读值得跟进有用关注 Kimi K3
10:19官方一手arXiv: DeepSeek@Junchi Liu, Ali Bigdeli, Roya Daneshi, Atu Ambala, Sudipto Ghosh, Fabio Santos该研究评估了ChatRepair和CodeCorrector两种APR技术在DeepSeek、GPT、Llama三个LLM上的修复表现。结果显示,结构复杂的bug和模糊的故障定位会加大修复难度,但LLM技术仍保持有竞争力的修复效果;定位越不精确,两种技术间的性能差距越大。研究发现,更高成本的LLM和更强的推理设置并不总能带来更好的成本效率。GPT-5修复的复杂bug比DeepSeek-V4-pro多7个、比DeepSeek-V3.2多39个,但DeepSeek-V3.2的总修复成本效率最佳。超过50%的中等复杂bug可由低成本LLM技术修复。论文DeepSeekGPT-5自动程序修复10 个信源在谈事件专题推荐理由:论文实测三种LLM的修复能力,发现便宜的DeepSeek-V3.2成本效率反超GPT-5,选模型前值得一看。原文稍后读已读值得跟进有用关注 DeepSeek
23:22elvis@omarsar0精选Pathway的BDH-CQ模型在ARC-AGI 1基准上获得29.5%的分数,但每个任务成本仅为0.0007美元。该模型通过潜在空间中的循环推理而非链式思维(CoT)来实现这一成绩。研究团队还验证了类似Transformer的扩展规律,参数规模可达6000亿。这一成果展示了在成本效率上的显著优势。AI模型BDH-CQARC-AGIPathway推荐理由:Pathway的BDH-CQ用极低成本在ARC-AGI 1拿到29.5%,靠的是潜在空间推理而不是CoT,还验证了600B参数规模,值得一看。原文稍后读已读值得跟进有用关注 BDH-CQ
02:20官方一手@OpenAIDevs@OpenAIDevs76°OpenAI宣布API中GPT-5.6模型降价,Luna降价80%,Terra降价20%。同时推出GPT-5.6 Sol的更快选项。降价也适用于Codex和ChatGPT Work的用量计算,使开发者以更低成本获得更多智能。此次调整旨在提升成本效率,让每美元产出更多结果。AI产品GPT-5.6OpenAIAPI10 个信源在谈事件专题推荐理由:OpenAI把GPT-5.6 API价格打下来了,Luna降八成,Terra降两成,还给了更快选项Sol,开发成本更低了。原文稍后读已读值得跟进有用关注 GPT-5.6
00:29lmarena.ai@lmarena_ai82°Meta 发布的 Muse Spark 1.1 在 Document Arena 排名第 11(此前第 21),帕累托前沿得分 1472;在 Vision Arena 排名第 14;中文语言类别排名第 3。在 Code Arena: Frontend 排名第 9,帕累托前沿得分 1541,成本为混合每百万 token 输入 1.25 美元、输出 4.25 美元。该模型以低价格实现前沿性能。AI模型Muse SparkMeta成本效率推荐理由:Meta 发了 Muse Spark 1.1,在文档、视觉、代码三大领域成绩都不错,关键价格低,适合预算有限又想用前沿模型的团队。原文稍后读已读值得跟进有用关注 Muse Spark
10:53官方一手Pandaily@contact@pandaily.com (Pandaily)精选DeepSeek、智谱AI和Qwen的成本高效模型在OpenRouter平台上周令牌份额超过20%,数据基于2025年7月的统计。这一增长显示开发者正从高价模型转向性价比更高的选项。结构性的市场转变表明成本正在成为AI基础设施选择的关键因素。行业DeepSeekZhipuQwen推荐理由:开发者的钱袋更聪明了:DeepSeek、智谱、Qwen靠低价拿下OpenRouter五分之一流量,值得关注。原文稍后读已读值得跟进有用关注 DeepSeek
05:57Thomas Wolf@Thom_Wolf精选Matei Zaharia指出,在LLM推理中,使用简单的Pi harness(来自@badlogicgames)在Opus和GPT 5.5上达到了与LLM供应商提供的harness相同的成功率,但成本降低了一半。这种成本优势主要归因于更小的输入规模。该发现揭示了harness设计对性价比的巨大影响。AI模型Pi harnessOpusGPT 5.5推荐理由:你知道吗?换个简单的工具就能把成本砍半,效果还不打折!Pi harness让Opus和GPT 5.5的推理省钱又高效,值得一试。原文稍后读已读值得跟进有用关注 Pi harness
16:17官方一手pandaily@contact@pandaily.com (Pandaily)中国国产大模型通过多模型动态路由(Fusion)技术,在推理时动态选择最佳模型以平衡性能与成本。混合智能体架构将多个模型组合成系统,进一步降低部署开销。这种策略优先考虑实际应用的成本效率,而非单纯追求原始基准分数。行业多模型路由智能体成本效率推荐理由:中国大模型厂商正在用多模型路由和混合智能体降低AI应用成本,比单纯堆参数更实用。原文稍后读已读值得跟进有用关注 多模型路由
09:43官方一手Pandaily@contact@pandaily.com (Pandaily)精选StepFun 最新模型 Step 3.7 Flash 在 Artificial Analysis 基准测试中夺得速度、成本效率和端到端性能三项第一。该模型在 OpenRouter 和 Hugging Face 上获得大量关注,展现出强大的竞争力。这一成绩表明 StepFun 在推理优化和成本控制方面取得了显著突破,为开发者提供了高性价比的 AI 模型选择。AI模型Step 3.7 Flash基准测试推理优化推荐理由:做 AI 应用选型或部署推理服务的团队,Step 3.7 Flash 在速度和成本上的优势值得直接对比测试,可能帮你省下不少预算。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
22:54Viking@vikingmuteDeepSWE 对 Opus 4.8 的评分显示,该模型在性能上优于 Opus 4.7,且成本更低、效率更高,但相比 GPT5.5 仍有明显差距。作者表示尚未深度使用 4.8,仍在使用更便宜的 4.6 版本,并指出对基准测试已逐渐祛魅,更看重推特上的真实用户评价。目前普遍认为 GPT5.5 仍是大多数用户的最强模型。AI模型Opus 4.8GPT5.5模型评测4 个信源在谈事件专题推荐理由:如果你在纠结是否升级到 Opus 4.8,这篇推文帮你省了试错成本——作者用真实体验告诉你,4.8 性价比提升但远不及 GPT5.5,做模型选型的开发者建议看看推文下的真实讨论。原文稍后读已读值得跟进有用关注 Opus 4.8
16:21@atomic_chat_hq@atomic_chat_hq在游戏开发竞赛中,Deepseek V4 Pro 与 GPT-5.5 被要求制作卡丁车游戏。GPT-5.5 以 0.33 美元成本、25 tok/s 速度生成 10,580 tokens,耗时 7 分钟,最终游戏质量、视觉效果和创意方向明显更优。Deepseek V4 Pro 成本仅 0.07656 美元,便宜 4.3 倍,生成 18,869 tokens(近 2 倍),但游戏在图形、视觉打磨和创意执行上较弱。结论是尽管 Deepseek 定位为强编码模型,在游戏开发测试中仍远落后于 GPT-5.5。AI模型Deepseek V4 ProGPT-5.5游戏开发3 个信源在谈事件专题推荐理由:想用 AI 做游戏开发的团队,这个对比直接告诉你:省钱不一定省心——Deepseek 便宜但质量差一截,GPT-5.5 贵但成品更靠谱,建议根据预算和品质要求选模型。原文稍后读已读值得跟进有用关注 Deepseek V4 Pro
16:19@atomic_chat_hq@atomic_chat_hq精选76°在编写自训练俄罗斯方块机器人的真实智能体任务中,Qwen 3.7-Max 以 56% 的改进幅度、仅 1.32 美元的训练成本,全面超越 Claude Opus 4.7(+28%,12.15 美元)和 GPT-5.5(+7%,2.85 美元)。测试中每个模型可读取自身代码、运行基准测试并迭代重写 10 轮。Qwen 3.7-Max 在性能提升和成本效率上均占优,成本仅为 Claude 的 1/9、GPT 的 1/2。这表明 Qwen Max 在长智能体循环任务中具有显著优势。AI模型Qwen 3.7-Max智能体模型对比推荐理由:做智能体开发或自动化任务的团队,Qwen 3.7-Max 在成本与性能上碾压对手,值得在类似场景中直接替换测试。原文稍后读已读值得跟进有用关注 Qwen 3.7-Max
00:53TestingCatalog@testingcatalog78°Cursor 发布了 Composer 2.5,该版本在性能上与 Opus 4.7 相当,但成本效率提升了最多 10 倍。新版本更智能,能更好地处理长时间运行的任务,并更可靠地遵循复杂指令。未来一周内,Composer 2.5 的使用限制将翻倍。这对使用 AI 编程助手的开发者来说是一个重大升级。AI产品CursorComposer 2.5编程助手10 个信源在谈事件专题推荐理由:Cursor 用户终于等来了性能与成本兼顾的升级——Composer 2.5 在复杂任务上更可靠,且成本大幅降低,做 AI 编程的团队建议立即试用。原文稍后读已读值得跟进有用关注 Cursor
15:23rohanpaul_ai@rohanpaul_ai微软 CEO Satya Nadella 在最新发言中提出了 AI 时代的新衡量标准:“每美元每瓦特的 Token”(Tokens per Dollar per Watt),强调效率而非单纯算力。他认为这一公式适用于所有公司、行业和国家,并指出核心在于基础设施、基础设施和基础设施。这反映了 AI 产业从追求规模转向关注成本与能效的趋势,对云服务商和 AI 开发者有重要指导意义。行业AI 基础设施成本效率微软推荐理由:Nadella 提出的新公式直击 AI 落地的成本与能效痛点,做 AI 基础设施或模型部署的团队值得关注,这可能是未来优化方向的信号。原文稍后读已读值得跟进有用关注 AI 基础设施
07:26官方账号NVIDIA AI@NVIDIAAINVIDIA 强调大规模智能体推理需要平衡模型算法、软件和计算三方面效率。其全栈平台通过计算、网络、存储和内存的极致协同设计,持续优化这些输入。该平台还拥有覆盖数百万开发者的广泛生态系统支持。最终实现更低的每 Token 成本、更高的吞吐量和更可扩展的 AI 系统。行业NVIDIA智能体推理全栈优化推荐理由:做大规模 AI 推理部署的团队,NVIDIA 的全栈优化思路直接关系到成本与性能,值得关注其协同设计方法。原文稍后读已读值得跟进有用关注 NVIDIA