7月8日
09:54
09:54官方账号arXiv cs.AI@He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe Li
DT-Guard提出一种推理主动训练、推理自由推理的范式,在训练时使用推理监督,推理时只输出结构化安全标签。它采用意图-类别-安全的三步决策过程,并构建带意图标签、风险类别、安全标签和推理轨迹的数据集。通过Rollout-Guided Progressive Hard-Case Optimization (RG-PHO)提升硬样本鲁棒性。在提示侧和响应侧安全基准上,DT-Guard分别达到0.886和0.870的平均F1分数,4B参数版本取得0.878的双侧平均F1,超越多个8B基线。
推荐理由:想用轻量模型做好内容安全?DT-Guard靠训练时推理、运行时只打标签,4B就干掉8B的护栏,速度快还准。
00:59
7月7日
22:17
22:17Hunyuan@TXhunyuan
腾讯混元发布Hy3模型,已在OpenRouter平台上线,通过Novita Labs提供访问。该模型采用295B MoE架构(21B活跃参数),支持原生256K上下文长度,并提供三种可配置推理模式。Hy3在编码、推理和长上下文任务中表现强劲,并针对智能体工作流进行优化。模型免费使用至7月21日。
推荐理由:腾讯的Hy3模型现在OpenRouter上就能用,295B参数但只激活21B,成本低,还有三种推理模式,做智能体任务很合适,而且免费到7月21号,赶紧试试。
14:00
14:00官方一手marktechpost@Asif Razzaq
精选
腾讯Hy团队发布Hy3,一个总参数量295B的混合专家(MoE)模型,每个token仅激活21B参数。Hy3在SWE-Bench Verified上取得78.0分,报告更低的幻觉率,并支持256K上下文窗口。该模型以Apache 2.0许可证开源,可在OpenRouter上免费试用至2026年7月21日。

推荐理由:腾讯刚开源Hy3,激活21B参数就能在SWE-Bench拿到78.0,还支持256K长上下文,想尝鲜推理模型的话OpenRouter上免费到7月21日。
12:37
12:20
12:20AI Will@FinanceYF5
根据r/LocalLLaMA的一张图表,有人计算了从云端顶尖模型发布到普通笔记本能运行同等能力水平的平均时间差为24.8个月。GPT-3用了37个月才被追上,GPT-3.5是17个月,GPT-4大约24个月。按此节奏推算,Fable/Mythos 5级别的能力预计在2028年7月可运行于高端消费级电脑。

推荐理由:有人拿LocalLLaMA的数据算了一笔账:顶级云端模型大概两年后就能在普通笔记本上跑,GPT-3.5只用了17个月,这个时间差挺有意思。
11:41
11:41官方账号arXiv cs.AI@Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
RLVR通过可验证奖励提升推理能力,但每次训练强模型需要大量采样,成本高昂。Direct-OPD方案在小模型上执行RL,将其策略偏移作为隐式奖励传递给强模型。对比后RL教师与前RL参考的对数比率,为学生模型提供密集监督。实验显示,Direct-OPD将Qwen3-1.7B在AIME 2024上的准确率从48.3%提升至62.4%,仅需8块A100 GPU训练4小时。该方法优于step-matched直接RL,并支持多策略偏移的级联组合。
推荐理由:用弱模型训练强模型,Qwen3-1.7B在AIME 2024从48.3%飙到62.4%,只花4小时8卡A100。比直接RL还省,值得试试。
11:24
11:21
11:11
11:11官方账号arXiv cs.AI@Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz Geramifard
TREK提出一种分阶段训练方法,解决GRPO在困难提示上的探索停滞问题。该方法先用蒸馏将教师模型(如DeepSeek-V4)的已验证轨迹拉入学生模型支持域,再返回标准GRPO精炼。在数学推理中,TREK将Qwen3-8B在AIME 2025上从36.9提升至40.3,在AIME 2024上从47.9提升至51.1(avg@16)。在代理任务上,ALFWorld成功率从75.8提高到82.8,ScienceWorld从12.5提高到26.7。TREK的泛化优势在于仅需已验证输出轨迹,可兼容黑盒或白盒教师。
推荐理由:这篇论文给出了一个实用技巧:用蒸馏扩展支持域再强化学习,在数学和代理任务上都涨点明显,而且不需要改动模型结构。
08:30
08:30官方一手@OpenAIDevs@OpenAIDevs
OpenAI 发布了 GPT-Realtime-2.1-mini 新模型,其 API 现已可用。该模型在 Realtime mini 系列中新增了推理能力和工具调用功能。定价与原有的 GPT-Realtime-mini 相同,开发者无需额外付费。
事件专题

推荐理由:OpenAI 新推 mini 实时模型,能推理还能调用工具,价格不变,适合实时场景开发。
03:01
03:01AK@_akhaliq
精选
bottlecapai 基于 Qwen3.6-27B 微调推出 ThinkingCap-Qwen3.6-27B 模型,平均推理 token 减少 50%,最佳案例减少 90% 以上。该模型通过先进微调算法在多个领域和难度的问题集上训练。

推荐理由:bottlecapai 用 Qwen3.6-27B 微调的新模型能省一半推理 token,最快省九成,适合低成本推理场景。
7月6日
05:27
05:27官方一手marktechpost@Asif Razzaq
美团发布LongCat-2.0,总参数量1.6万亿,每个token激活约480亿参数。模型原生支持100万token上下文,采用LongCat稀疏注意力机制。训练与推理均在国内AI ASIC超算集群上完成。该模型开源,API已开放访问。
事件专题

推荐理由:美团开源了1.6T参数的LongCat-2.0,激活参数480亿,原生支持100万token上下文,国内ASIC集群跑出来的,值得关注。
7月5日
08:34
08:34AI Will@FinanceYF5
用户 Nicolas Bustamante 测试 Claude Fable 5,发现该模型能根据模糊提示一次性生成逼真的埃菲尔铁塔代码。他多次评估后认为 Fable 5 是特殊模型,擅长从模糊描述完成一次生成。该模型在代码生成任务中表现出色。
事件专题

推荐理由:Anthropic 的 Claude Fable 5 回来了,能从一句话就写出埃菲尔铁塔代码,一次成型不用改,写代码神器。