Google 发布了 Gemini 3.8 Flash,价格更低但性能接近前沿模型,成本效率大幅提升。
Gemini 3.8 Flash 在六周内第三次发布,距 3.7 Flash 仅三周。该模型在 Vals Finance Agent v2 达到 61.4%,高于 Opus 5 的 58.6%。Terminal-bench 2.1 得分 89.4%,略高于 Opus 5。在成本效率方面,3.8 Flash 以约 1/7 到 1/8 的任务成本实现了与 Opus 5 几乎相同的通过率。
Gemini 3.8 Flash 发布:3.7 Flash 的速度和价格,接近前沿大模型的推理与编码能力 六周内第三次发布 Flash 系列模型(距 3.7 Flash 仅三周),迭代节奏明显加快。...
Gemini 3.8 Flash 发布:3.7 Flash 的速度和价格,接近前沿大模型的推理与编码能力 六周内第三次发布 Flash 系列模型(距 3.7 Flash 仅三周),迭代节奏明显加快。这次发布的是 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。 blog.google/innovation-and… # 看看 3.8 Flash 的基准测试表现 3.8 Flash 领先的项目: · Vals Finance Agent v2 61.4%,高于 Opus 5 的 58.6% · Harvey 法律智能体 10.0%,同组最高 · Terminal-bench 2.1 89.4%,略高于 Opus 5 的 89.1% · CharXiv Reasoning 86.2% · LVBench 87.8%(agentic)/ 87.1%(static),领先幅度较大 · HLE-Verified 54.9%,与 Opus 5 的 54.4% 及 GPT-5.6 Sol 的 54.5% 基本持平 · BioMysteryBench 高难度子集 56.5%,LABBench2 86.2% 3.8 Flash 未领先、且差距明显的项目: · GDPVal-AA v2(知识型工作)Elo 1545,Opus 5 为 1824,差距约 280 分,这是表中最大的落差 · Terminal-bench 4.0(通用智能体能力)19.1%,Opus 5 为 51.8%,GPT-5.6 Sol 为 37.3% · OSWorld-2.0(智能体电脑操控)59.0%,Opus 5 为 75.4% · DeepSWE v1.1 为 73.7%,略低于 Opus 5 的 74.0%,但已高于 GPT-5.6 Sol(72.7%)和 Sonnet 5(53.8%) · GDP.PDF 专家级 PDF 理解 35.0%,GPT-5.6 Sol 为 40.0% 相对 3.7 Flash 的进步幅度: · 提升最大:BioMystery 高难度 +13 个百分点、DeepSWE +8.4、OSWorld +8.4、Terminal-bench 4.0 +7.9 · 提升较小:HLE-Verified +1.3、CharXiv +1.7、Vals Finance +2.4 # 成本效率:真正的核心论点 3.8 Flash 在约 73–74% 准确率下,单任务平均成本约 $1.5–2;Opus 5 达到 74% 需约 $13,Fable 5 约 $15。 在长程软件工程任务上,3.8 Flash 以约 1/7 到 1/8 的任务成本实现了几乎相同的通过率,处于图中"最高效"区域的帕累托前沿。 从 3.5 Flash(约 33%)→ 3.6 Flash(约 46%)→ 3.7 Flash(约 65%)→ 3.8 Flash(约 74%),Flash 系列在一年内在几乎不变的成本下持续拉高上限。 Logan Kilpatrick @OfficialLoganK Gemini 3.8 Flash on DeepSWE 1.1, scores 73.7%! 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 0 👀 246 ⚡