8月13日
01:57
01:57Mustafa Suleyman@mustafasuleyman
精选76°
微软发布其首款推理模型 MAI-Thinking-1。该模型从零开始构建,而非基于现成架构。目前已在 Microsoft Foundry 平台上开放使用。团队负责人 Mustafa Suleyman 在 X 平台公布了这一消息。
推荐理由:微软自己从头搞了个推理模型 MAI-Thinking-1,已经放到 Foundry 里能用了,想试推理模型的可以去看看。
8月12日
17:33
17:33官方账号阿里通义 Qwen@Alibaba_Qwen
精选
Qwen3.8-Max在Legal Research Bench上的得分在不到三个月内几乎翻倍,排名从第22位跃升至第4位。Vals AI在推文中强调了这一进步,并附上了相关链接。该模型在基准测试中的显著提升展示了其在法律研究领域的性能增强。
推荐理由:Qwen3.8-Max在Legal Research Bench上从第22冲到第4,三个月内得分翻倍,看看它怎么做到的。
17:12
17:12Yangyi@Yangyixxxx
安全研究人员发现OpenAI、Anthropic、Google等主要AI提供商的API存在漏洞,可读取推理模型的加密思考过程。扫描约7000条公开会话后,发现62个API密钥、33个邮箱和33个密码。该漏洞影响Claude、GPT等推理模型的隐私保护机制。
事件专题

推荐理由:安全研究员发现API漏洞能偷看Claude、GPT的加密思考过程,还扫出62个密钥,搞AI开发的得看看。
00:43
00:43官方账号Microsoft Research@MSFTResearch
精选
微软研究院推出CARE-X,一个结合灵活推理、校准预测和基于测量工具的统一框架,用于胸部X光解读。该框架超越了传统报告生成,旨在提升AI在放射学中的实用性和可靠性。CARE-X通过整合多种能力,可能改善诊断准确性和临床决策支持。相关细节在微软研究院的推文中公布。
推荐理由:微软研究院搞了个CARE-X,把推理、预测和测量工具整合起来做胸片解读,比单纯生成报告更进一步,搞放射AI的可以看看。
8月11日
23:34
23:34官方账号Decoder@Matthias Bastian
精选
Nvidia发布开源权重模型Nemotron 3.5 Lightning,仅36亿活跃参数,在智能指数上与OpenAI的gpt-oss-120b持平,但体积小四倍。该模型每秒处理近670个token,是对比中速度最快的模型。Nvidia此举表明其更注重效率而非模型规模。
事件专题

推荐理由:Nvidia新出的开源模型,36亿参数跑得比1200亿的还快,速度拉满,适合追求低延迟的开发者。
15:08
15:08Geek@geekbb
72°
DeepSeek V4 系列 API 定价在 X 平台曝光。V4-Flash 百万 tokens 输入命中缓存仅 0.02 元,未命中 1 元,输出 2 元。V4-Pro 对应价格分别为 0.025 元、3 元和 6 元。Flash 版并发限制 2500,Pro 版 500,按账号粒度计算。

推荐理由:DeepSeek V4 价格出来了,Flash 版命中缓存才 2 分钱,比白菜价还便宜,做批量任务的朋友可以算算账了。
12:47
12:47官方账号arXiv cs.LG@Lecheng Kong, Like Hui, Haitao Mao, Jun Huan
论文指出基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上会崩溃,因为高置信度常表示探索失败。作者提出Consilience框架,通过评估推理中置信度的时间不对称性,惩罚初始高置信度并要求最终确定性。在研究生级数学问题和自由形式代码生成实验中,Consilience优于现有基线。
推荐理由:如果你做推理模型,这个框架能解决置信度评分在复杂任务上失效的问题,用时间不对称性挑出真正靠谱的答案。
11:51
11:51官方账号arXiv cs.AI@Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard Zhong
BDH-CQ 是一种结合上下文学习与循环潜在推理的推理模型,推理时输入持续更新模型记忆,并在高维潜在空间迭代计算,不输出中间推理过程。在 ARC-AGI-1 公开评测集上,150M 参数配置达到 29.5% pass@2,单任务推理成本仅 0.0007 美元。该结果突破了 ARC-AGI-1 此前报告的成本-准确率帕累托前沿,树立了新的基准成本效率标杆。研究还通过受控 ARC 干预实验,分析了模型从演示中学习的内容、应用推断变换的一致性及难点概念。
推荐理由:这个模型用循环潜在推理做上下文学习,150M 参数在 ARC-AGI-1 上花 0.0007 美元就拿到 29.5% 的 pass@2,性价比直接刷新纪录,值得看看它怎么做到的。
11:44
11:44官方账号arXiv cs.AI@Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko
精选76°
Anthropic、OpenAI和Google等主流LLM提供商将推理轨迹加密后返回客户端,但研究发现这些加密块在会话、用户和模型间可互换。攻击者将加密轨迹注入同提供商的较弱模型,可强制其明文输出推理内容,无需直接越狱更强模型。通过解码315,320个推理块,研究者恢复了367个PII和182个凭证。该漏洞还支持隐形提示注入,可污染智能体部署。论文提出加密和系统级缓解措施。
事件专题

推荐理由:这篇论文揭露了Anthropic、OpenAI和Google推理加密的漏洞,能跨模型解密,还挖出大量隐私数据,搞AI安全的必看。
8月10日
08:02
8月9日
19:00
8月8日
11:31
11:31官方账号Greg Brockman@gdb
ARC Prize团队重新测试了OpenAI的GPT-5.6 Luna,在ARC-AGI-2上取得59.6%准确率,每任务成本0.18美元。在ARC-AGI-1上取得90.7%准确率,每任务成本0.07美元。降价后新结果与原始性能一致,而成本降低了80%。这一价格性能比在推理模型中相当少见。
事件专题

推荐理由:ARC Prize实测了降价后的GPT-5.6 Luna,性能没缩水,跑一次ARC-AGI-2只要0.18美元,性价比确实猛。
8月7日
13:24
13:24官方账号arXiv cs.AI@ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng
论文提出DASH方法,用于改进带可验证奖励的强化学习(RLVR)中奖励稀疏的问题。标准OPSD对所有局部发散使用相同权重,忽略了生成过程中发散序列的时间结构。DASH根据局部蒸馏信号与序列均值的差距自适应调整token级监督权重,控制反向多步聚合。在三个数学推理基准和三种模型规模上,DASH均优于匹配的vanilla OPSD。该方法复用OPSD已有的师生分布,不额外增加前向传播成本。
推荐理由:这篇论文提出了DASH,能让推理模型在自蒸馏时按发散情况动态调整权重,三个数学基准上全面超过原版OPSD,还不用额外算力。
12:12
12:12官方一手歸藏(guizang.ai)@op7418
OpenAI宣布ChatGPT聊天改由GPT-5.6系列驱动。Plus和Pro用户可使用GPT-5.6 Sol,支持即时回答与深度推理。免费版和Go用户从明天起可无限使用GPT-5.6 Luna文本聊天,并有限次数使用Thinking。推文提到Luna实际体验“还行”,免费用户也值得一试。
事件专题

推荐理由:OpenAI把GPT-5.6拆成Sol和Luna,付费用户用Sol,免费用户也能无限聊Luna。想不花钱体验新模型的可以明天试试。
11:57
05:23
05:23官方账号Sam Altman@sama
82°
OpenAI发布GPT-5.6 Sol,为Plus和Pro用户在即时推理和深度推理中提供更准确、专注的回复。免费和Go用户从明天起可使用GPT-5.6 Luna的无限文本聊天。该更新旨在降低高级模型的使用门槛。
事件专题

推荐理由:OpenAI把GPT-5.6 Sol给了Plus和Pro用户,聊天更准了;免费用户明天起能无限聊Luna,值得试试。
03:44