7月1日
03:18
02:17
02:17官方账号NVIDIA AI@NVIDIAAI
Nemotron Labs发布了一项基于5000名Kaggle竞赛参与者数据的研究。他们分析了参与者的解题行为与推理策略。研究揭示了团队协作和多样化方法对提升AI推理效果的关键作用。这些经验可直接应用于现有模型的优化。
事件专题

推荐理由:Nemotron Labs用5000个Kaggle实战案例总结了AI推理的改进方法,比看论文更接地气。
6月30日
22:50
22:50官方账号阶跃星辰 Stepfun@Stepfun_AI
Step 3.7 Flash 本月在 OpenRouter 平台上处理了4.29万亿 tokens,进入该平台流量前十。开发者将其用于真实 agent 运行、编程任务和长上下文工作流。模型在处理复杂任务时表现稳定,获得社区积极反馈。

推荐理由:Step 3.7 Flash 在 OpenRouter 上月流量超4万亿 tokens,开发者拿它跑智能体、写代码,又稳又快。
16:51
16:51官方账号Decoder@Matthias Bastian
DeepSeek发布新框架DSpark,将每位用户的响应速度提升60%至85%。该框架使用小型模型生成候选token,再由大型模型批量验证。通过优化计算流程,DSpark能在更少芯片上榨取更多性能。这有助于减少中国对高端美国芯片的依赖。

推荐理由:DeepSeek的DSpark用小型模型提候选token、大模型批量验证,让速度提升85%,还减少了芯片需求,挺实用的。
13:17
13:17Geek@geekbb
精选
Qwythos 9B 基于 Qwen3.5-9B,在 5 亿 token 的 Claude 思维链轨迹上全参数微调,可处理 1M 上下文。支持原生 Function Calling 和多模态视觉(图像+文本)。GGUF 量化后仅 5.2 GiB,可在低配设备上运行。该模型为开源且未经审查。
推荐理由:Empero AI 开源的 Qwythos 9B 把 Qwen3.5 和 Claude 思维链结合,1M 上下文加 Function Calling,量化后 5.2GB 的推理模型,低配机器也能跑。
12:49
12:49官方账号阶跃星辰 Stepfun@Stepfun_AI
Step 3.7 Flash 在 Nous Portal 上获得实际应用,用户正在用它测试、构建和运行各种智能体工作流。该项目由 Nous Research 合作推进,并保持免费访问。官方邀请用户试用并分享成果。
推荐理由:快去 Nous Portal 上免费试用 Step 3.7 Flash,用它搭建各种智能体工作流,体验它的实际效果。
12:39
12:39官方一手arXiv: DeepSeek@Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Qianyi Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou
精选
Agents-A1是一个35B参数的Mixture-of-Experts智能体模型,通过扩展智能体视野(平均轨迹长度45K tokens)达到万亿参数级别性能。它在SEAL-0(56.4)、IFBench(80.6)、HiPhO(46.4)、FrontierScience-Olympiad(79.0)和MolBench-Bind(56.8)上超越了1T参数的Kimi-K2.6和DeepSeek-V4-pro,在SciCode(44.3)、HLE(47.6)和BrowseComp(75.5)上也具有竞争力。训练采用三阶段流程:全领域SFT、领域级教师模型、多教师领域路由在线蒸馏。
推荐理由:35B的模型干翻万亿参数?Agents-A1用长视野扩展和智能体框架做到,基准全面领先,值得看看怎么训练的。
12:27
12:27官方账号NVIDIA AI@NVIDIAAI
NVIDIA 宣布其 Nemotron 模型与 LangChain 集成,覆盖从推理到编排的智能体工作流。开发者可在开放栈上自定义、调优和部署模型。该集成面向生产环境,基于 LangChain 框架实现灵活编排。Nemotron 是 NVIDIA 的前沿智能体性能模型,支持多种部署方式。
事件专题

推荐理由:NVIDIA的Nemotron现在接入了LangChain,你可以按需调优和部署智能体,不受厂商锁定,适合做定制化AI代理。
03:06
6月29日
23:49
23:49官方账号阶跃星辰 Stepfun@Stepfun_AI
精选
StepFun 的 Step 3.7 Flash 模型在 Claw-Eval General 基准测试中取得第二名的成绩,该基准用于评估自主智能体。模型在多步执行和长程任务鲁棒性上表现强劲,排名仅次于 Claude Opus 4.6。这一结果显示其在真实世界智能体工作负载中的潜力。

推荐理由:StepFun 的 Step 3.7 Flash 在智能体基准 Claw-Eval General 排第二,仅次于 Claude Opus 4.6,多步执行和长程任务都强,感兴趣可以看看。
15:41
13:49
13:49官方账号阶跃星辰 Stepfun@Stepfun_AI
精选
Step 3.7 Flash 是开源多模态推理模型,现已在 DeepInfra API 上线。该模型支持私有端点部署,适用于专用负载场景。它专为智能体编码、工具使用、搜索和视觉工作流设计。开发者可通过 DeepInfra 的 API 直接调用。
推荐理由:Step 3.7 Flash 开源多模态推理模型刚上线 DeepInfra,支持私有部署,适合智能体编程和视觉任务,开发者可以试试。
13:49
13:49
13:49Ethan Mollick@emollick
Ethan Mollick 指出,所有模型路由器(model routers)在处理非数学/编程任务时,普遍低估任务难度并分配过少的智能资源。他建议,对于不可验证的任务(如创新、营销、定性分析),使用更智能的模型往往能带来更大收益。这一观点源于他对多种路由器实际表现的经验观察。
推荐理由:Ethan Mollick 分享了一个容易被忽视的问题:模型路由器的任务分配不够智能,尤其对创意和分析类任务。如果你也发现一些任务结果不好,可能不是模型不行,是路由器给它派了太弱的模型。
10:11
10:11官方账号arXiv cs.AI@Rajesh Jayaram, Drew Tyler, David Woodruff, Corinna Cortes, Yossi Matias, Vahab Mirrokni, Vincent Cohen-Addad
Paper Assistant Tool(PAT)是谷歌开发的智能体框架,用于深度科学评审,能检查理论结果、验证实验并提出改进建议。PAT利用推理缩放技术,在SPOT基准上对数学错误的零样本召回率提升了34%。该工具已在STOC和ICML两大计算机科学会议作为预提交工具试点,有效识别关键错误并减轻审稿人认知负担。
推荐理由:谷歌做了个叫PAT的工具,能帮你审论文抓数学错误,召回率比普通模型高34%,已在两大顶会试过了,实用。
10:06
10:06官方一手arXiv: DeepSeek@Lei Yu, Peng Wang, Jia Xu, Jingyuan Zhang, Xin Wang, Jiajia Ma, Li Yang, Changzhi Deng, Zenghua Wang, Fengjun Zhang
BashCoder-R1提出三阶段框架:连续预训练(CPT)专业化Bash范式、长思维链监督微调(L-CoT SFT)模拟风险意识推理、鲁棒性感知分组相对策略优化(R-GRPO)优化语法与鲁棒性。在包含952个真实任务(773单行,179多行)的BashBench基准上,单行/多行任务SyntaxPass达100.00%/94.97%,RobustPass达95.99%/79.33%,FullRate达90.04%/73.18%。相比最强基线DeepSeek-V3.2(推理)在FullRate上分别提升37.82%和20.18%。
推荐理由:BashCoder-R1用三阶段训练让AI写bash脚本更稳更可解释,在BashBench上比DeepSeek-V3.2完整率高出一大截。
6月28日
16:03
16:03官方账号Decoder@Jonathan Kemper
精选
新浪微博发布开源模型VibeThinker-3B,仅30亿参数。在数学和编程基准上,它匹配了DeepSeek V3.2和Kimi K2.5,后两者参数规模大333倍。模型通过多阶段后训练实现高性能。研究人员假设:逻辑推理可压缩进小模型,但广泛世界知识不行。

推荐理由:30亿参数的小模型推理能力居然能打千亿级大模型,新浪VibeThinker-3B在数学和编程上很强,而且开源了。
05:49