03:59lmarena.ai@lmarena_aiAgent Arena追踪模型完成真实任务所需的token数量。Opus系列从4.7到5,性能持续提升,但token消耗从约8.5k增至约21k,含推理和输出token。相反,GPT-5.5到GPT-5.6-Sol的token用量从约10k降至约8k,同时净改进提升约1.5pp。两组模型在效率与性能上呈现相反趋势。AI模型Agent ArenaOpus 5GPT-5.6-Sol7 个信源在谈事件专题推荐理由:看Opus 5和GPT-5.6-Sol在同一基准上的表现,一个越强越费token,一个越强越省,挺有意思的对比。原文稍后读已读值得跟进有用关注 Agent Arena
06:09elvis@omarsar0omarsar0在推文中称,DeepSeek V4-Flash等模型的token效率被低估,建议更激进地尝试不同测试框架。他提醒,DeepSeek V4-Flash的每token价格虽便宜,但多轮交互可能使单任务总成本更高。@ArtificialAnlys报告称,DeepSeek完成与Fable相同的基准任务时,总成本仅为Fable的1/105。AI模型DeepSeek V4-FlashFabletoken效率10 个信源在谈事件专题推荐理由:别光看每token单价:DeepSeek V4-Flash跑同基准总成本比Fable低105倍,这条推文有数据。原文稍后读已读值得跟进有用关注 DeepSeek V4-Flash
00:09Patrick Loeber@patloeber81°Google 正式发布 Gemini 3.6 Flash,该模型在智能、token 效率和定价上均有显著改进。开发者 patloeber 实测后表示,3.6 Flash 相比前代更高效、更快速。官方同时发布了详细的开发指南,帮助开发者快速上手。新模型基于开发者反馈优化,适用于真实场景。AI模型Gemini 3.6 FlashGoogletoken效率10 个信源在谈事件专题推荐理由:谷歌出了 Gemini 3.6 Flash,更聪明还更省 token,价格也降了,实测效果不错,有官方指南可以照着用。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
08:22岚叔@lufzzlizGrok 4.5 在 Coding Agent Index 得分 76,与 GPT-5.5 xhigh in Codex 同分,略低于 Fable 5 max in Claude Code。价格为输入 $2/1M tokens、输出 $6/1M tokens,cache hit 折扣至 $0.5/1M input。平均总 token 仅 1.9M,远低于 Fable 5 的 7.2M 和 GPT-5.5 的 6.2M。Elon Musk 披露参数量约 1.5T,上下文窗口 500k tokens。支持可配置 reasoning 和视觉输入,性价比优势明显。AI模型Grok 4.5Grok BuildCoding Agent推荐理由:Grok 4.5 在代码智能体任务上得分和 GPT-5.5 一样高,但 token 消耗只有三分之一,价格还更便宜,做 agent 开发选它很划算。原文稍后读已读值得跟进有用关注 Grok 4.5
05:20Aravind Srinivas@AravSrinivas推文预测未来每家企业都会构建自身的模型-测试-沙箱-评估飞轮,并优化每瓦特token价值。核心驱动力是企业对其领域、客户和工作流拥有独特的隐性知识。该观点获得630个赞和35339次浏览。行业Perplexity企业AI模型评估飞轮推荐理由:Perplexity CEO预测企业AI的未来是定制评估飞轮和能耗优化,看看这个趋势分析原文稍后读已读值得跟进有用关注 Perplexity
10:19官方一手GitHub Blog@Natalie Guevara精选GitHub Copilot agentic harness 在多项基准测试中展现优异性能,同时实现领先的 token 效率。该框架支持超过 20 种不同模型,提供灵活的模型选择。评测覆盖多种任务类型,验证了其通用性。AI产品GitHub Copilotagentic harnesstoken效率推荐理由:GitHub 官方的代理框架评测,Copilot 在不同模型上又快又省 token,支持 20 多种模型,搞编程智能体的别错过。原文稍后读已读值得跟进有用关注 GitHub Copilot
13:50@hebbia@hebbia精选73°Hebbia CTO 指出 Claude Opus 4.8 在金融工作流中实现了更强的引用准确性。相比前代,它在处理复杂金融文档时 token 效率显著提升。新模型适用于需要高精度引用的财务分析场景。AI模型Claude Opus 4.8Hebbia金融1 个信源在谈事件专题推荐理由:Hebbia 的 CTO 亲测说 Claude Opus 4.8 在金融任务上引用更准、省 token,做财报分析的团队可以试试。原文稍后读已读值得跟进有用关注 Claude Opus 4.8