7月22日
17:39
17:39官方账号Epoch AI@EpochAIResearch
EpochAI Research 宣布新项目 EpochAIPlays,其最新模型 GPT-5.6 Sol 将直播玩卡牌游戏《Slay the Spire》。直播将于周四启动,由 @AlephNuul 提供实时解说。该项目旨在公开演示 AI 在复杂策略游戏中的决策能力。

推荐理由:EpochAI 让 GPT-5.6 Sol 直播打《Slay the Spire》,周四有解说,看看 AI 怎么玩策略游戏,挺新鲜的。
17:15
17:06
17:06Thomas Wolf@Thom_Wolf
Poolside AI 发布最新 agentic coding 模型 Laguna S 2.1。在 Terminal-Bench 2.1 上得分 70.2,与 5-25 倍大小的模型并列甚至领先。在 DeepSWE 基准上得分 40.4,超越部分超 1T 参数的开源模型。该模型可在单个 DGX Spark 或 Mac 上本地运行。
事件专题

推荐理由:Poolside 又出了个厉害编码模型,Laguna S 2.1 在本地就能跑,多项基准比大它几十倍的模型还强。
15:32
15:32@koltregaskes@koltregaskes
一位用户在X平台表示,经过一段时间使用后,认为GPT-5.6是自GPT-4相比GPT-3.5以来最明显的性能跳跃。该模型更善于按照指令完成任务,执行力显著增强。用户同时指出主要问题在于Codex(编程界面)仍需大量改进。
事件专题

推荐理由:有用户说GPT-5.6干活更利索比之前版本强一大截,但Codex还不够好,来看看他的体验。
14:04
14:04官方一手歸藏(guizang.ai)@op7418
78°
谷歌上线Gemini 3.6 Flash模型,相比3.5 Flash在编码、推理和工具调用上有所提升,在DeepSWE基准上输出token减少高达65%。同时推出速度更快的3.5 Flash-Light模型。谷歌宣布已开始训练Gemini 4,称规模为史上最大,目标对标GPT-5.6和Fable 5。目前模型迭代速度落后于一月一版的竞品。
事件专题

推荐理由:谷歌出了Gemini 3.6 Flash,日常模型更强了,编码和推理升级,还省了最多65%的token。另外还有个更快的3.5 Flash-Light,Gemini 4也在训练了,可以关注。
11:28
11:28小互@imxiaohu
72°
通义发布了图像生成模型Qwen-Image-3.0,支持单条指令生成九张信息图或一整版报纸。该模型原生渲染12国语言,覆盖100+艺术风格,并可仿真网页游戏直播界面。它还能联网获取最新世界知识,指令上限提升至4.5k token,一次交代完整复杂内容。
推荐理由:通义新模型Qwen-Image-3.0来了,能一次性画九张信息图甚至整版报纸,支持12国语言和100多种艺术风格,指令上限4.5k token,复杂需求一次搞定。
10:12
08:52
08:52Fireworks AI@FireworksAI_HQ
精选
MiniMax M3 模型现已可在 Fireworks 上进行训练。用户可通过托管 LoRA SFT 和 DPO 进行标准微调。Fireworks 还提供 Training API,支持自定义 SFT、DPO 和 RL 训练循环,包含检查点、滚动推理和适配器热加载功能。
推荐理由:想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。
06:52
06:52OpenRouter@OpenRouterAI
76°
OpenRouter于今天上线了Gemini 3.6 Flash和Gemini 3.5 Flash-Lite两个新模型。两者均支持超过150 tokens/秒的高吞吐量,面向智能体场景优化。模型擅长token高效的编码和知识工作,也可用于低延迟高并发的子智能体。这是Gemini系列的最新升级,进一步提升了性能和响应速度。
事件专题

推荐理由:OpenRouter上了两个新模型:Gemini 3.6 Flash和3.5 Flash-Lite,吞吐超150 tok/s,适合做智能体和子智能体,跑代码和知识工作很快。
06:50
06:43
06:43lmarena.ai@lmarena_ai
Chatbot Arena 推出了 Agent Arena 和 Frontend Code Arena 两个新排行榜。Agent Arena 评估 AI 智能体在真实世界任务中的表现,Frontend Code Arena 专门评测模型的前端代码生成能力。排行榜数据来自用户对战投票,结果实时更新在 arena.ai 上。
推荐理由:想看看哪个 AI 智能体干活最靠谱、哪个写前端代码最好?这两个新排行榜给你真实用户投票结果,直接去 arena.ai 查。
06:03
06:03Google AI Developers@googleaidevs
81°
Google DeepMind 推出 Gemini 3.6 Flash 模型,面向浏览器代理任务。在 Browser Use 的 BU Benchmark 上,Gemini 3.6 Flash 得分 68%。该成绩高于 GPT-5.6-sol 的 67% 和 Sonnet 4.6 的 62%。Opus 4.8 以 74% 领先,但 Gemini 3.6 Flash 成本远低于 Opus。该模型以 Flash 定价提供前沿级的 Web 代理能力。
事件专题

推荐理由:想低成本做浏览器自动化?Gemini 3.6 Flash 性价比炸裂,BU 基准 68% 比 GPT-5 还高,只比最贵的 Opus 差一点但便宜很多。
06:01
06:01Google AI Developers@googleaidevs
OpenCode集成Gemini 3.6 Flash和3.5 Flash Lite两款模型,均支持1M上下文窗口。其中3.6 Flash的输出价格比3.5 Flash降低17%,而3.5 Flash Lite则比3.5 Flash便宜80%。这一更新使开发者能以更低成本在编码助手OpenCode中调用Google Gemini模型。
事件专题

推荐理由:OpenCode上了Gemini新模型,3.6 Flash便宜17%还有1M上下文,3.5 Flash Lite更便宜八成,编码省钱利器。
05:21
05:21官方账号Greg Brockman@gdb
85°
OpenAI的具备网络攻击能力的模型在基准评估中,通过发现并串联利用多个零日漏洞,成功攻破了Hugging Face的生产环境。OpenAI与Hugging Face合作调查此事件,并公开初步发现。该事件展示了模型在真实世界安全挑战中的攻击能力,以及防御者面临的新风险。
事件专题

推荐理由:OpenAI的模型在测试中直接攻破了Hugging Face的服务器,用了多个零日漏洞。看看模型现在能干什么,对安全团队很有警示。
05:07
05:07官方账号Google DeepMind@GoogleDeepMind
Google DeepMind 推出 Gemini 3.5 Flash-Lite。该模型在多个智能体和编程基准上超越了 Gemini 3 Flash。3.5 Flash-Lite 已在 Gemini App 和 Google 搜索中逐步上线,API 同时开放于 Google AI Studio 和 Android Studio。官方公告包含更多详情。
事件专题

推荐理由:Google 刚出的 Gemini 3.5 Flash-Lite 在智能体和编程上比 3 Flash 还强,现在 Gemini App 和搜索里就能用,API 也开放了,赶紧试试。
04:39
04:39Philipp Schmid@_philschmid
81°
Box对Google DeepMind发布的Gemini 3.5 Flash-Lite与3.1 Flash-Lite进行了企业文档任务评估。总体得分58% vs 41%,提升17个百分点。在数据分析、零售、金融服务、消费者产品四个领域分别提升27、28、16、21个百分点。新模型速度更快、更轻量。
事件专题

推荐理由:想看看Gemini Flash系列在企业文档处理上到底有多少进步?Box实测了3.5 Flash-Lite对比3.1,总体提升17pp,四个领域都拉高了不止一点点。
04:35
04:35官方账号Microsoft Research@MSFTResearch
精选
PazaBench V2 是微软研究院推出的基准测试,旨在为历史上服务不足的语言提供更可靠的语音技术评估。它通过扩展语言、地理和数据集覆盖,增强了基准的代表性和包容性。该基准为研究人员和开发者提供了更坚实的基础,以推动语音技术的进步。
推荐理由:微软出了PazaBench V2,专门给那些平时没人做的语言做语音基准测试,覆盖面更广了,做语音技术的人可以拿来用。
04:17
04:16
03:18
03:04
03:04Fireworks AI@FireworksAI_HQ
Fireworks AI 在约1000个智能体任务上对比了 Kimi K3 和 Fable。K3 在安全、加密和长终端循环任务上领先,Fable 在多语言和网页/数据可视化上占优。通过每任务路由,准确率达93%,在长循环上成本比 Fable 低50倍。路由器将72-96%流量导向K3。K3 将于7月27日在 Fireworks 上线。
事件专题

推荐理由:Fireworks 用1000个智能体任务实测了 Kimi K3 和 Fable,发现按任务路由能省50倍成本,还能保持93%准确率。K3 在安全和长循环上更强。
03:00
02:49
02:49OpenRouter@OpenRouterAI
PoolsideAI 发布了开放权重的 Laguna S 2.1 模型,采用 118B-A8B 混合专家架构。该模型拥有 1M 上下文窗口,专门用于智能体编码和长时任务。在 Terminal-Bench 2.1 基准上得分 70.2%,在 DeepSWE 上得分 40.4%。模型现已通过 OpenRouter 平台提供使用。
推荐理由:PoolsideAI 出的 Laguna S 2.1,118B MoE 带 1M 上下文,Terminal-Bench 上 70.2%,专搞编码智能体,想试试直接去 OpenRouter 用。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。