7月23日
07:01
07:01官方账号Together AI@togethercompute
精选
使用DeepSWE基准对比了Kimi K3 Max和GPT 5.6 Sol Max在软件工程任务上的表现。Kimi K3 Max达到了与GPT 5.6 Sol Max相当的性能,而价格仅为后者的约55%。将两个模型联合使用时,性能可额外提升约16%。
事件专题

推荐理由:Kimi K3 Max性价比炸裂,软件工程能力不输GPT 5.6 Sol Max,混合使用还能再提分,值得关注。
04:02
04:02官方账号NVIDIA AI@NVIDIAAI
精选74°
在Kaggle的NVIDIA Nemotron模型推理挑战赛中,该团队获得第一名。核心方法是训练模型记忆最小问题模式及其候选解,推理时进行搜索和验证。详细报告已公开在doi.org/10.34740/kaggle…。
事件专题

推荐理由:这个Kaggle第一名的方法很简单有效:让模型记住问题模式再搜索匹配,值得研究。有开源报告。
7月22日
18:01
18:01官方账号Logan Kilpatrick@OfficialLoganK
精选
Anthropic 发布了 3.6 Flash 模型,专门针对真实世界任务的智能体(agentic)用例进行优化。该模型在 AA(Anthropic 的 Agentic Assessment)覆盖的推理基准上分数没有变化,因为团队并未优先优化那些基准。主要改进方向是提升在复杂多步任务中的实际表现。
事件专题

推荐理由:Anthropic 给 3.6 Flash 做了针对性更新,专攻真实世界的智能体任务,不是刷推理榜单。看它实际干活行不行。
14:04
14:04官方一手歸藏(guizang.ai)@op7418
78°
谷歌上线Gemini 3.6 Flash模型,相比3.5 Flash在编码、推理和工具调用上有所提升,在DeepSWE基准上输出token减少高达65%。同时推出速度更快的3.5 Flash-Light模型。谷歌宣布已开始训练Gemini 4,称规模为史上最大,目标对标GPT-5.6和Fable 5。目前模型迭代速度落后于一月一版的竞品。
事件专题

推荐理由:谷歌出了Gemini 3.6 Flash,日常模型更强了,编码和推理升级,还省了最多65%的token。另外还有个更快的3.5 Flash-Light,Gemini 4也在训练了,可以关注。
12:09
12:09官方账号arXiv cs.LG@Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang
ISO是一种专门为可验证奖励强化学习(RLVR)设计的优化框架。它通过保持基模型的权重谱不变,仅优化输入输出奇异帧来实现模型适配。离线版本ISO-Merger无需数据或梯度就能合并多个专家模型,在无数据合并方法中性能最强。在线版本ISO-Optimizer在Qwen3-8B-Base上,仅用100步就达到AdamW需270步的准确率(0.495),210步后进一步提升至0.509。实验覆盖1.5B到8B参数的推理与代码任务。
推荐理由:如果厌倦了RLVR微调慢慢跑,试试ISO:只用1/3的训练步数就能达到同等效果,Qwen3-8B上实测有效,代码开源。
12:06
12:06官方账号arXiv cs.LG@Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi
标准RLVR在模型无法生成任何正确答案时会得到零学习信号,导致困难问题无法收敛。Off-Context GRPO通过在训练中引入解法前缀作为特权引导,使模型获得非零奖励。该方法通过重要性校正目标避免引导与原始目标的偏差,在标准数学推理基准上比vanilla GRPO平均绝对提升3.9%(相对提升13.8%),且额外成本可忽略。
推荐理由:模型一遇到难题就原地踏步?这篇论文给出了一个简单又有效的解法:给模型一点'提示',效果直接涨3.9%,成本几乎为零。
06:52
06:52OpenRouter@OpenRouterAI
76°
OpenRouter于今天上线了Gemini 3.6 Flash和Gemini 3.5 Flash-Lite两个新模型。两者均支持超过150 tokens/秒的高吞吐量,面向智能体场景优化。模型擅长token高效的编码和知识工作,也可用于低延迟高并发的子智能体。这是Gemini系列的最新升级,进一步提升了性能和响应速度。
事件专题

推荐理由:OpenRouter上了两个新模型:Gemini 3.6 Flash和3.5 Flash-Lite,吞吐超150 tok/s,适合做智能体和子智能体,跑代码和知识工作很快。
04:17
04:16
01:03
01:03Google AI Developers@googleaidevs
76°
Google 推出 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 两款新模型,旨在提升智能体工作流的可扩展智能、token 效率和低延迟。Gemini 3.6 Flash 是主力模型,Gemini 3.5 Flash-Lite 是轻量版。据官方声明,新模型可支持更复杂的多步推理任务。
事件专题

推荐理由:Google 出了两个新模型 Gemini 3.6 Flash 和 3.5 Flash-Lite,专为智能体场景优化,延迟更低、token 更省,做自动流程的可以看看。
00:26
00:26小互@imxiaohu
76°
Google 推出三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。Gemini 3.6 Flash 相比 3.5 Flash 节省约 17% 输出 Token,编程场景最高节省 65%。其输入价格 $1.50/百万 Token,输出 $7.50/百万 Token。Computer Use 成功率提升至 83%,并内置安全机制防御越狱和滥用。3.5 Flash Cyber 专攻网络安全。
事件专题

推荐理由:Google 发布了三款新模型,其中 Gemini 3.6 Flash 在省钱和代码能力上明显提升,编程场景能省 65% Token,Computer Use 成功率 83% 值得一试。
7月21日
18:54
18:54The Rundown AI@therundownai
71°
Claude参与证伪一个持续87年的数学猜想,展示了AI在高级数学推理中的能力。该问题此前长期未被解决,Claude的推理过程被研究者用于辅助验证。这一成果凸显了大型语言模型在数学证明中的应用潜力。

推荐理由:Claude又帮数学家解决了一个87年的老问题,看看它怎么用逻辑推理证伪数学猜想的。