8月7日
03:34
03:34官方账号OpenAI@OpenAI
83°
OpenAI 推出 GPT-5.6 Sol,为付费用户的全部聊天(含 Instant 模式)提供一致体验。在高风险事实性评估中,覆盖金融、医学和法律领域,GPT-5.6 Sol 比 GPT-5.5 Instant 的事实错误响应减少 68%。该模型成为付费用户的默认统一推理版本。
事件专题

推荐理由:OpenAI 把新模型 GPT-5.6 Sol 用到所有付费聊天里,医学法律等场景错误率比上代 Instant 低了 68%,靠谱很多。
03:33
03:33官方账号OpenAI@OpenAI
78°
OpenAI 为 ChatGPT 推出 GPT-5.6 Sol,Plus 和 Pro 用户可使用即时与深度推理,响应更注重事实。GPT-5.6 Luna 面向 Free 和 Go 用户,从明天起提供无限文本对话。Sol 与 Luna 分别面向付费和免费层级,覆盖不同需求。
事件专题

推荐理由:OpenAI 把新模型拆成两档:付费的 Sol 更会推理,免费的 Luna 随便聊,明天就能用。
03:12
03:12官方账号Decoder@Matthias Bastian
72°
OpenAI更新了ChatGPT中的GPT-5.6 Sol,新增推理滑块可调节思考深度,并优化了回复聚焦度。免费用户从下周起获得GPT-5.6 Luna的无限文本聊天权限,外加一个让其推理更长的按钮。但Luna的能力仍明显弱于Sol等更大的模型。
事件专题

推荐理由:Sol更新了推理滑块,想调思考深度可以试试;免费用户下周用Luna,但别指望它能打。
01:20
01:20Geek@geekbb
精选71°
Unsloth AI推出DSpark加速方案,让DeepSeek-V4-Flash-0731的GGUF模型在本地生成速度提升约1.4至2倍。根据Unsloth官方实测,该模型在本地可达到每秒120 tokens,精度没有变化。相关GGUF文件已发布在Hugging Face上,完整指南见Unsloth官方文档。
事件专题

推荐理由:Unsloth搞了个DSpark,能让DeepSeek-V4-Flash在本地跑快一两倍,每秒120 tokens,精度不变,自己部署更爽了。
8月6日
23:47
17:25
17:25AI Will@FinanceYF5
78°
NVIDIA宣布开源自动驾驶推理模型Alpamayo 2 Super。Alpamayo 2 Super能理解复杂场景,先思考再行动。Robotaxi、卡车和配送车是它的目标应用。模型采用OpenMDW-1.1协议开放商用。Jensen Huang表示下一代AI是机器人,从自动驾驶开始。
事件专题

推荐理由:老黄开源的Alpamayo 2 Super是自动驾驶推理模型,能先思考再行动,Robotaxi和卡车都能用,而且协议允许商用。
8月5日
12:25
12:25官方账号arXiv cs.AI@Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao, Xun Xiao, Zhihong Zhu, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua
ReflectRL 提出从专家模型的失败轨迹中学习推理,将失败样本视为反思对象而非模仿示范。该方法基于“反思优势”假设:对难题,反思有缺陷的轨迹比从头求解更有效。ReflectRL 先利用失败轨迹生成反思推理,再通过“反思到直接策略迁移”将能力转移。在 9 个基准、4 种 LLM 骨干和 4 种在线训练方法上,ReflectRL 稳定提升推理性能且开销极小。
推荐理由:ReflectRL 把失败样本当教材,让模型先反思再直接推理。在 9 个基准上稳定提升,还挺轻量。
12:09
12:09官方账号arXiv cs.LG@Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipin Chaudhary
这篇论文将测试时缩放形式化为自回归模型隐式前缀树上的预算推理,区分单轨迹连续缩放、叶级缩放和前缀级缩放三种结构。论文提出评估轮廓,将端到端系统性能与候选库诊断分离,并指定推理协议的可重复性要求,区分精确重放与分布可复现。作者在广泛知识、符号推理和竞赛数学基准上应用这些原则,并组装了超过20亿条完整推理轨迹供发布。
推荐理由:这篇论文把测试时缩放拆成三种结构,还给了评估和复现规范,做推理模型的人可以参考。
8月4日
09:29
09:29官方账号arXiv cs.AI@Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho
研究通过5个开源权重模型、500个MedQuAD问题和120万次试验,分析医学谄媚行为。结果发现,虚假来源伴随提问时使谄媚率提高2.0倍,但在模型回答后出现则使谄媚率减半。谄媚程度在不同问题间的差异是模型间差异的67倍对3倍。思维链追踪显示,重新审视自己答案的模型会让步,而推理医学事实的模型坚持。
推荐理由:这篇论文用120万次试验测了5个开源模型,发现你反驳它就会改答案,假来源出现的时机不同效果差很多,值得看看。
03:15
03:15官方账号OpenAI@OpenAI (@OpenAI)
82°
OpenAI在X平台宣布,其下一代旗舰模型的内部版本在数学和理论计算机科学领域的10个长期开放问题上取得了新结果。该模型运行消耗的token价值约2000美元,按GPT-5.6 Sol API费率计算。推文附带的视频展示了部分求解过程,目前该模型尚未公开发布。
事件专题

推荐理由:OpenAI说下一代模型内部版才花2000美元token就解了10个数学老难题,按GPT-5.6 Sol API费率算的,很猛。
8月3日
09:19
09:19官方一手arXiv: DeepSeek@Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi
精选
TwT(Translation with Thought)是一个难度自适应的多领域机器翻译框架,通过强化学习在直觉与深思推理间动态切换。该模型先利用DeepSeek-R1蒸馏并由GPT-4o重写的长思维链进行监督微调,再通过混合奖励优化翻译质量与推理效率。在15个基准、3种已见语言和59种未见语言上,TwT-7B和TwT-14B的翻译质量超过更大的SOTA推理模型,同时token用量减少32%至60%。
推荐理由:这个TwT框架让翻译模型根据难度动态调整思考量,7B和14B的小模型打过大模型,token还省了30%到60%,做多领域翻译的可以看看。
8月2日
8月1日
10:13
10:13Fireworks AI@FireworksAI_HQ
72°
DeepSeek-V4-Flash-0731已在Fireworks平台上线,支持日零部署。DeepSeek报告该模型在全部9项智能体评测中超越V4 Pro,其中Terminal Bench得分82.7%。其性价比优于V4 Pro,定价为每百万tokens 0.28美元,上下文窗口达100万tokens。

推荐理由:Fireworks当天上线了DeepSeek最新模型,智能体评测全面超过V4 Pro,价格还更便宜,适合跑高并发任务。
02:05