谷歌新出的Gemini 3.7 Flash,编码和智能体分数提升明显,输入每百万token只要0.75美元,划算,但只走API。
开源模型大爆发,智能体竞争白热化
2026年8月14日,AI领域迎来多家厂商同日发布新模型的盛况。最大看点是开源智能体模型集中爆发:NVIDIA发布专为高吞吐智能体执行设计的Nemotron 3.5,Meta开源Muse Glimmer 30B(Apache 2.0),在多个Agent基准上表现出色。谷歌Gemini 3.7 Flash主打编码与智能体,定价0.75美元/百万输入token;Grok 4.6也在多平台上线。国内DeepSeek凌晨突袭发布V4-Pro正式版,Agent能力大幅提升。此外,NVIDIA推出涵盖300+技能的插件,显著降低智能体开发门槛。
模型发布/更新
5 篇Fastino跟NVIDIA合作,用自动微调Agent搞出了金融和医疗两个开源模型,FinQA涨了43个点,Apache 2.0随便用。
Harvey把Nemotron 3.5 Lightning后训练了一把,法律Agent评测从0冲到8.3%,比Opus 4.6还强,输出也从90k缩到37k,省Token。
产品发布/更新
5 篇Applied Compute 支持 Nemotron 3.5 Lightning 了,并发翻 16 倍延迟不涨,训练迭代快多了。
批量解析复杂企业文档?LlamaExtract比Claude Code便宜一半还更准,去LlamaParse体验。
DeepSeek 开源了 agent 开发框架 Harness v0.1,模型、工具、UI 全是插件,想自己拼装 agent 的可以上手试试。
行业动态
5 篇红杉活动上,LangChain创始人聊了智能体三件套:框架、模型、上下文。他说越偏离模型训练数据,越该自己造框架。还演示了LangSmith Engine怎么做评估。
论文研究
5 篇EvoX Genesis 用持久项目代替持久智能体,DeepSeek V4 Flash 花 44 美元写了能过测试的 C 编译器,MESA 提速 6.87 倍。
这篇论文用Claude Code搭了个智能体流水线,把GAMESS的老Fortran代码转换了还零误差通过,适合搞科学计算现代化的人看。