7月6日
05:27
05:27官方一手marktechpost@Asif Razzaq
美团发布LongCat-2.0,总参数量1.6万亿,每个token激活约480亿参数。模型原生支持100万token上下文,采用LongCat稀疏注意力机制。训练与推理均在国内AI ASIC超算集群上完成。该模型开源,API已开放访问。
事件专题

推荐理由:美团开源了1.6T参数的LongCat-2.0,激活参数480亿,原生支持100万token上下文,国内ASIC集群跑出来的,值得关注。
7月5日
08:34
08:34AI Will@FinanceYF5
用户 Nicolas Bustamante 测试 Claude Fable 5,发现该模型能根据模糊提示一次性生成逼真的埃菲尔铁塔代码。他多次评估后认为 Fable 5 是特殊模型,擅长从模糊描述完成一次生成。该模型在代码生成任务中表现出色。
事件专题

推荐理由:Anthropic 的 Claude Fable 5 回来了,能从一句话就写出埃菲尔铁塔代码,一次成型不用改,写代码神器。
03:03
03:03lmarena.ai@lmarena_ai
Fable 5模型重回LMSys Chatbot Arena,官方发布了一段蒙太奇视频,展示多个测试prompts。用户可以在Battle Mode和Agent Mode中直接体验该模型。官方排行榜分数即将公布,供社区参考。
事件专题

推荐理由:Fable 5又回Arena了,还加了Agent模式,想自己动手测测看?直接去Battle Mode里玩,官方排名马上出。
7月3日
11:54
11:54官方账号arXiv cs.AI@Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng
精选
PAW(Program-as-Weights)提出一种模糊函数编程范式,将自然语言规范编译为紧凑的本地可执行神经构件。一个4B编译器在FuzzyBench(1000万示例)上训练,为冻结的0.6B Qwen3解释器生成参数高效适配器。该解释器执行PAW程序,性能匹配直接提示Qwen3-32B,但推理内存仅为其1/50,在MacBook M3上达30 tokens/s。PAW将基础模型从逐输入求解器转变为可复用小工具构建器。
推荐理由:PAW让模糊函数(如日志告警、修复JSON)不再依赖大模型API。用4B编译器一次编译,0.6B小模型就能跑出32B的效果,还省内存和算力。
11:52
11:52官方账号arXiv cs.AI@Yanjun Zhao, Ruizhong Qiu, Tianxin Wei, Yuanchen Bei, Zhining Liu, Lingjie Chen, Ismini Lourentzou, Hanghang Tong, Jingrui He
ReContext是一种无需训练的长上下文推理方法,通过模型内部相关性信号构建证据池并在生成前重放。该方法在8个长上下文数据集上测试,上下文长度达128K。实验表明,ReContext在Qwen3-4B、Qwen3-8B和Llama3-8B三个模型上均提升了证据利用率,平均排名最优。
推荐理由:ReContext不用训练就能让模型用上长文里的关键信息,Qwen3和Llama3上都有效,适合处理超长文档推理。
11:49
11:49官方账号arXiv cs.AI@Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian
研究者发布了DramaSR-532K基准,包含53.2万条带注释对话和900多个角色,需整合听觉、语言和视觉线索。他们提出DramaSR-LRM方法,基于大型推理模型(LRM),通过多模态工具自主聚合上下文证据。在短话语上,DramaSR-LRM显著优于现有基线,因为声学生物特征在这些场景中不可靠。数据和代码将公开。
推荐理由:一篇论文用推理模型做说话人识别,还建了个53万条对话的新基准,短话识别效果比现有方法强不少。
11:48
11:48官方账号arXiv cs.AI@Yunhe Li, Hao Shi, Wenhao Liu, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Shuang Qiu, Linqi Song
DemoPSD是一种新的策略自蒸馏框架,用于训练大语言模型推理。它通过选择性采纳教师指导,构建反向KL重心的目标分布,自动平衡教师学习与学生自身推理能力的保持。理论证明该框架能有效缓解特权信息泄露并保留探索能力。在SciKnowEval的四个科学领域上,DemoPSD的表现优于GRPO和SDPO,并在跨分布GPQA基准上展现出强泛化性。
推荐理由:这篇论文提出了DemoPSD,通过分歧调节蒸馏过程,比GRPO和SDPO在科学推理上更强,还能防止模型学到测试时无效的捷径。
09:19
09:19官方账号arXiv cs.LG@Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye
研究发现在线自蒸馏(OPSD)在长思维链推理模型上效果有限且破坏推理稳定性。通过分解教师监督信号,发现参考导致的成分驱动死记硬背,而可迁移的问题条件成分被忽略。提出两步解法:首先构建仅参考教师以隔离不可迁移成分,再用点互信息(PMI)过滤掉参考捷径。在4个长思维链模型和2个数据集上,该方法相比基线和标准OPSD均取得一致改进。
推荐理由:这篇论文解决了OPSD在长推理模型上越蒸馏越笨的问题,用PMI过滤器保留思考能力,值得做推理优化的朋友看看。
00:25
00:25lmarena.ai@lmarena_ai
Claude Sonnet 5 (Thinking) 在 Text Arena 中整体文本排名第32位。在专家级提示(Expert-level prompts)上,Sonnet 5 超越了上一代版本4.6。在数学、写作、文学与语言、生命/物理/社会科学类别中表现稳定,但大多数其他类别的排名出现下降。
事件专题

推荐理由:想对比 Claude Sonnet 5 和 4.6 的文本能力?这份分析告诉你它在专家级提示上更强,但其他类别反而差了。
00:23
00:23官方账号Decoder@Matthias Bastian
精选73°
Anthropic将Claude Code的系统提示削减了80%。员工Tariq Shihipar表示,新的Fable 5模型需要更少的指令和示例,指南甚至可能限制模型,因为它们“比给定的更富想象力”。Anthropic现在通过上下文而非严格规则来引导模型行为。
事件专题

推荐理由:Anthropic发现Claude Code的新模型Fable 5太聪明,系统提示反而碍事,直接砍掉80%。
7月2日
23:29
23:29官方账号LMSYS Org (SGLang)@lmsysorg
76°
NVIDIA推出Qwen3.6-27B-NVFP4模型,采用4位浮点量化,模型大小仅为BF16版本的约1/2.5。该模型在MMLU Pro基准上达到86.3分,与FP8版本性能几乎无损。上下文长度完整保留262K。SGLang已提供Day-0支持,并附带cookbook。
事件专题

推荐理由:NVIDIA新出的Qwen3.6-27B模型,4位量化体积小很多但精度没怎么降,SGLang直接就能用,可以去试试。
18:20
12:35
12:35官方账号arXiv cs.LG@Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong
本文基于Qwen3和Qwen2.5共7个模型,使用GRPO、GiGPO、Dr. GRPO三种RL算法,在数学推理、代码生成和智能体决策任务上实验。研究发现训练单层Transformer即可恢复全参数RL训练大部分甚至全部改进。作者引入“层贡献”指标量化单层训练相比全参数训练的收益比例。结果显示RL收益高度集中于少数中间层,输入输出层贡献显著较低。
推荐理由:这篇论文发现RL训练只需调优一层Transformer就能接近全参数效果,还揭秘中间层才是关键,刷新认知。
11:48
11:48AI Will@FinanceYF5
OpenAI模型更新平均间隔51.8天,Claude 4到Opus 4.1用了75天,之后保持42-73天周期。谷歌Gemini系列平均75.8天,2025年曾出现154天空窗期。GPT-5到5.1间隔97天,5.1到5.2仅29天,后续稳定在28-56天。快速发布带来数据飞轮、人才迭代和开发者心智优势,成为AI竞争的结构性壁垒。
事件专题

推荐理由:OpenAI和Anthropic现在每1-2个月发一次新版,谷歌要75天还断过154天,速度差距越来越大了。看看他们怎么用发布节奏建护城河。
10:23
10:23官方账号arXiv cs.AI@Zhuoxuan Zhang, Kangqi Ni, Yuhang Chen, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Adam, Song, Sandeep Pandey, Luke Simon, Tianlong Chen, Xi Liu
生成式推理重排序器(GR2)通过自回归解码生成推理链后再排序,准确率高但推理速度慢。论文提出Diffusion-GR2,将自回归重排序器转换为块扩散模型,并行解码多个位置。通过转换微调(CFT)解决结构间隙,确保输出有效排列;通过在线蒸馏(OPD)和强化学习(RL)弥补分布间隙。在Amazon Beauty数据集上,Diffusion-GR2准确率接近自回归基线,推理吞吐量提升2.4-3.5倍。消融实验显示CFT恢复大部分转换损失,在线蒸馏进一步缩小差距。
推荐理由:想加速推理重排序又不想掉精度?这篇把自回归GR2换成块扩散,速度提升2.4倍以上,准确率几乎没降,干货满满。
09:12
09:12Notion@NotionHQ
Notion在X上宣布,Claude Fable 5模型已正式集成到Notion中。该模型专为最复杂的自定义智能体和自动化工作而设计,在Notion内部基准测试中创下了多步骤任务的新高。目前面向Biz和Ent计划用户开放。
事件专题

推荐理由:Notion 把 Claude Fable 5 放进来了,专治复杂多步骤任务,比之前更强的推理和智能体能力。
08:19
08:19eric zakariasson@ericzakariasson
Claude Fable 5 模型现已重新在 Cursor 中可用。该模型在 CursorBench 基准测试中排名第一,超过所有其他模型。不过其每次任务成本也是最高的。开发者可再次在 Cursor 中选择并使用 Fable 5。
事件专题

推荐理由:Cursor 里又能用 Claude Fable 5 了,它在 CursorBench 上排第一,就是有点贵,适合追求极致效果的场景。
06:28
06:28elvis@omarsar0
该推文指出直接对比GPT-5.5与Opus-4.8、GLM-5.2等模型是错误方向,主张将模型组合使用。如果GPT-5.6达到Fable 5性能且无50%限制和7天限制,将给Anthropic带来压力。文中强调未来模型迭代只会提升组合效果。
事件专题

推荐理由:别纠结谁更强了!GPT-5.5、Opus-4.8、GLM-5.2组合用才是新玩法,学会这招直接降维打击。
06:20
02:30
02:30官方一手Google Blog: AI博客/媒体
2026年6月,Google发布多项AI更新,涵盖模型升级、产品新功能和工具发布。具体内容包括Gemini模型的性能提升、Bard新增功能,以及AI视频生成和推理模型的推出。这些更新在多项基准测试中取得显著进展。

推荐理由:谷歌的月度更新打包了一堆新东西,Gemini和Bard都有变化,可以快速了解
02:18
02:18官方一手AWS Machine Learning Blog@Zohreh Norouzi
AWS 宣布在 AWS GovCloud (US) 中通过 Amazon Bedrock 支持 NVIDIA Nemotron 系列(Nano 9B v2、Nano 12B v2、Nano 30B、Super 120B)和 OpenAI GPT OSS 模型(120B 和 20B)。这些模型均为美国原产的前沿开放权重模型,满足数据驻留合规要求。用户现在可以通过 Bedrock 在 GovCloud 环境中使用这些模型进行推理。
事件专题

推荐理由:AWS 把 NVIDIA 的 Nemotron 和 OpenAI 的 GPT OSS 模型搬上 GovCloud 了,有 6 种不同规模的开放权重模型可选,适合需要数据驻留的合规场景。
7月1日
16:59
16:59量子位@思邈
Loop世界模型论文在Hugging Face热门榜登顶,该模型由中国初创公司研发,允许AI通过反复推演世界状态进行推理。模型获得360创始人周鸿祎和奇绩创坛陆奇等投资,引发关注。论文展示了世界模型在复杂推理任务上的潜力。
推荐理由:中国初创搞的世界模型火了,能反复推演不同情境,Hugging Face上热度第一,周鸿祎和陆奇都投了,做推理模型的朋友可以看看。