7月9日
10:18
10:18官方账号arXiv cs.LG@Chen Tang, Yizhou Wang, Jianyu Wu, Lintao Wang, Shixiang Tang, Pengze Li, Encheng Su, Jun Yao, Jiabei Xiao, Yuqi Shi, Jielan Li, Hongxia Hao, Zhangyang Gao, Fang Wu, Ben Fei, Xiangyu Yue, Pan Tan, Bozitao Zhong, Jinouwen Zhang, Aoran Wang, Yan Lu, Jiaheng Liu, Xinzhu Ma, Liang Hong, Mingyue Zheng, Phil Torr, Bowen Zhou, Wanli Ouyang, Lei Bai
精选
SciReasoner是一个多模态科学基础模型,通过统一的结构感知词汇表对蛋白质、小分子和无机晶体进行推理。在Gene Ontology预测中,对低同源性和孤儿样蛋白的Cellular Component注释Fmax从0.42提升至0.55。化学单步逆合成准确率从0.63升至0.72,并能生成片段级断键与前体验证轨迹。在86个基准中,SciReasoner在67个任务上达到SOTA,双盲专家评估认为其推理痕迹在98%案例中优于或可比于前沿大语言模型。
推荐理由:这篇论文发布了SciReasoner,一个能同时处理蛋白质、小分子和晶体的推理模型,在67项基准上成绩最好,专家评价也很高。
09:54
09:54官方账号arXiv cs.LG@Vladislav Beliaev
精选
AdaPrefix-GRPO针对GRPO在困难问题上梯度消失的问题,提出自适应调整正确前缀长度的机制。方法通过反馈控制器将问题的成功率维持在50%附近以最大化梯度信号,训练后完全移除前缀。在0.6B模型上,该方法在保留训练分布的难题上将准确率提升2.1倍;在Qwen3-1.7B上提升1.6倍,在AIME基准上提升1.7倍,同时将追踪长度减半。模型越小,增益越大。
推荐理由:这篇论文解决了GRPO训练时难问题学不到东西的痛点,用自适应前缀让模型在数学推理上准确率翻倍,而且模型越小效果越明显,值得做强化学习的人看看。
09:44
09:44Cognition@cognition_labs
Cognition 推出 SWE-1.7 模型,基于 Kimi K2.7 基座并改进强化学习流程。其自研 FrontierCode 基准测试关注代码合并意愿,SWE-1.7 在该基准 Main 集上取得 42.3% 的分数,每个任务成本降至 1.97 美元,优化了成本-性能帕累托曲线。
事件专题

推荐理由:Cognition 新模型 SWE-1.7 基于 Kimi K2.7 用强化学习改进,FrontierCode 基准上 42.3% 分且每任务仅 1.97 美元,性价比突出。
08:53
08:53@koltregaskes@koltregaskes
83°
MiniMax计划在Q3开源代号M3 Pro的模型,参数量达2.7T,是当前旗舰M3(428B参数)的6倍多。新模型在复杂推理和多步任务上有显著提升。由于规模巨大,M3 Pro仅适合在专业基础设施上运行,无法在消费级硬件上实时使用。开源权重可供社区实验、微调或蒸馏更小模型。

推荐理由:MiniMax要开源2.7T参数的巨模型,比M3大六倍多,专攻复杂推理。虽然本地跑不动,但开源权重让研究者能动手玩,看看中国厂商怎么卷。
06:44
06:44Aadit Sheth@aaditsh
76°
OpenAI 推出 GPT-Live,一种支持全双工语音交互的模型。在复杂问题上,它会自动委派给 GPT-5.5 处理。OpenAI 内部网络研究基准测试成绩从 0.7% 跃升至 75.2%。有用户接到餐厅确认电话时发现是 AI 并提问测试,AI 直接挂断,表明体验仍有瑕疵。
事件专题

推荐理由:OpenAI 出了 GPT-Live,能全双工对话还自动叫 GPT-5.5 帮忙算难题,但用户说聊着聊着被挂电话,距离完美还有段路。
03:52
02:27
02:27官方账号OpenAI@OpenAI
精选
OpenAI 宣布 GPT-Live 新增委托功能,可将需要网络搜索、深度推理或更复杂工作的请求交给最新前沿模型后台处理。处理完成后,结果会自动带回对话界面。该功能旨在降低用户手动切换模型的成本,提升复杂任务响应效率。
事件专题

推荐理由:GPT-Live 能自动把复杂任务甩给更强的后台模型处理,你只管提问,结果自动回来,省心又高效。
00:34
00:34官方账号Greg Brockman@gdb
OpenAI 的 GPT-5.6-Sol 模型经过两个多月在 Next.js 日常开发中的测试,表现出色。它能理解架构权衡、调查复杂 issue 报告,并在修复 bug 时考虑代码库其他部分。仅需简短提示即可指导,甚至独立完成了 Next.js 服务器的大规模重构(包括测试套件、部署测试)。相关 PR 将在 Next.js 16.3 发布后合并。
事件专题

推荐理由:OpenAI 的 GPT-5.6-Sol 不只是聊天,能直接干复杂编程活了,比如自己重构 Next.js 服务器。想看看模型实际生产力有多强?这篇实测值得看。
7月8日
23:38
17:16
14:17
14:17Ethan Mollick@emollick
Sol 和 Fable 这两个新 AI 模型在智能水平上相比之前模型实现了大幅提升。它们与排名其后的最佳 AI 之间产生了显著性能差距。Ethan Mollick 认为,对于任何需要更高智能的任务,Sol 和 Fable 是目前仅有的两个选择。
推荐理由:Mollick 说 Sol 和 Fable 比之前所有模型都强,甚至甩开了其他顶级 AI。做需要高智力的活,目前就选这俩。
10:17
10:17官方账号arXiv cs.AI@Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Zhang, Bin Dong
Danus是一个基于事实图记忆的协调系统,旨在提升研究级数学推理能力。系统包含一个主智能体进行规划和协调,多个工作智能体并行执行证明搜索,以及一个无状态验证器检查数学主张。每个验证的事实连同证明和逻辑依赖存储在事实图中,构建递增的长期论证。在代数几何、奇点理论和组合学的六个研究级案例中,Danus成功生成长而详细的数学证明。
推荐理由:看看Danus怎么用事实图记忆帮多个推理智能体协作解数学难题,还能和数学家互动。
09:54
09:54官方账号arXiv cs.AI@He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe Li
DT-Guard提出一种推理主动训练、推理自由推理的范式,在训练时使用推理监督,推理时只输出结构化安全标签。它采用意图-类别-安全的三步决策过程,并构建带意图标签、风险类别、安全标签和推理轨迹的数据集。通过Rollout-Guided Progressive Hard-Case Optimization (RG-PHO)提升硬样本鲁棒性。在提示侧和响应侧安全基准上,DT-Guard分别达到0.886和0.870的平均F1分数,4B参数版本取得0.878的双侧平均F1,超越多个8B基线。
推荐理由:想用轻量模型做好内容安全?DT-Guard靠训练时推理、运行时只打标签,4B就干掉8B的护栏,速度快还准。
00:59
7月7日