6月20日
10:15
10:15官方一手Pandaily@contact@pandaily.com (Pandaily)
精选
Infinigence的Agentic MaaS平台在六个月内Token调用量增长超过20倍。推理计算支出首次超过训练,成为主要成本驱动。公司定位为芯片与模型之间的中立基础设施层。这反映了中国AI基础设施层对推理算力的巨大需求。

推荐理由:Infinigence半年token涨了20倍,推理比训练还烧钱,它想当芯片和模型的中间商,值得看看。
06:15
06:15官方一手marktechpost@Asif Razzaq
VibeThinker-3B是一个3B参数的MIT许可证推理模型,基于Qwen2.5-Coder-3B构建。该模型采用Spectrum-to-Signal后训练流水线。在可验证基准上,它匹配了DeepSeek V3.2和Kimi K2.5的性能。
事件专题

推荐理由:3B参数就能比肩DeepSeek V3.2和Kimi K2.5,基于Qwen2.5-Coder-3B开源,适合资源受限场景的推理任务。
6月19日
11:41
11:41官方账号arXiv cs.AI@Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthoran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveira, Rohin Shah, Neel Nanda
71°
论文分析 DiffusionGemma 的推理透明度,将其分解为变量透明度和算法透明度。初始发现 DiffusionGemma 的不透明串行深度是自回归 Gemma 4 的 28.6 倍。但通过可解释的 token 瓶颈映射信息流,可将不透明串行深度降至仅 Gemma 4 的 1.1 倍。算法透明度方面,扩散模型因每步所有 token 可变化而更复杂,研究识别了非时间顺序推理、token 与序列涂抹、中间上下文推理等新现象。可监控性测试表明 DiffusionGemma 与 Gemma 4 水平相当。
事件专题

推荐理由:Google 团队这篇论文解释 DiffusionGemma 的推理黑箱有多大,发现能用 token 瓶颈把深度压到几乎和 Gemma 4 一样,还发现了扩散模型特有的奇怪推理方式。
07:06
07:06官方账号Greg Brockman@gdb
OpenAI o1推理模型公布后,其他实验室研究者认为这是战略失误,应保密以拉开差距。Noam Brown引用研究表示,公开o1有助于推动医学推理领域的进展。这验证了OpenAI开放模型的正确性,加速了推理范式的应用。
事件专题

推荐理由:Noam Brown聊了OpenAI开放o1背后的争论,告诉你为什么公开反而能让医学推理进步更快。
06:38
06:38官方账号Greg Brockman@gdb
精选72°
OpenAI 与波士顿儿童医院及哈佛大学合作,在 NEJM AI 发表研究。研究使用 o3 Deep Research 模型重新分析 376 个先前未解决的罕见儿科病例。模型帮助临床医生找到了 18 个新诊断。其中包括 Kyra 的病例,她从 9 岁起持续肌肉无力,在 28 岁生日前夕被确诊为罕见的肌原纤维肌病。
事件专题

推荐理由:OpenAI 的 o3 Deep Research 模型帮医生翻出了 376 个陈年疑难病例,找出了 18 种之前漏诊的病。有个女孩从 9 岁查到 28 岁,终于有了答案。这 AI 真的能救命。
02:33
02:33Notion@NotionHQ
Fast Company发布了首届"AI 20"榜单,表彰在AI扩散至经济中起关键作用的领袖。Notion的AI负责人Sarah Sachs入选,其团队将Notion AI从简单重写工具演变为检索式问答,再到具有权限和审计追踪的"治理型AI队友"。当推理模型能自主完成序列任务时,他们从头重建了整个Notion AI架构。
事件专题

推荐理由:Fast Company选出了20位推动AI普及的领袖,Notion的Sarah Sachs榜上有名。她让Notion AI从改文章进化成带权限的‘AI队友’,还重写了整个架构,很酷。
02:10
02:10官方一手OpenAI Blog博客/媒体
OpenAI 推出 GPT-5.5 Instant,用于增强 ChatGPT 在健康和 wellness 领域的回复质量。新模型在推理、上下文理解、沟通清晰度上均有提升,并引入 physician-informed 评估方法。该改进旨在提高医疗健康场景下 AI 回复的准确性和可信度。
事件专题

推荐理由:GPT-5.5 Instant 让 ChatGPT 的健康建议更靠谱了,医生参与评估的设计值得关注。
6月18日
13:00
13:00@atomic_chat_hq@atomic_chat_hq
精选
Google Gemma 4 12B模型在RTX 4090上实测仅需9GB VRAM,生成8.9k tokens,速度80 tok/s,性能接近26B版本。其对比的Gemma 4 26B-A4B使用15GB VRAM,生成6.9k tokens,速度138 tok/s,所有场景胜出。但12B在近半VRAM下表现十分接近,成为16GB笔记本的理想选择。
事件专题

推荐理由:新Gemma 4 12B别看参数小,实测代码能力接近26B版,而且只需要9GB显存,16GB笔记本就能跑。
10:57
10:57官方账号arXiv cs.AI@Siyi Gu, Jialin Chen, Sophia Zhou, Arman Cohan, Rex Ying
提出Rubric-Conditioned Self-Distillation框架,用评分标准替代标量奖励,提供token级指导。方法分两步:先学习生成任务级评分标准,再训练评分标准引导的推理器。在多个科学推理基准上平均超越GRPO 1.0分、OPSD 0.9分。避免了单一参考推理链的噪声和标量奖励的模糊性。
推荐理由:想提升推理模型训练效果?这篇用评分标准做细粒度自蒸馏,比GRPO和OPSD都强,实验扎实。
05:17
05:17官方账号Greg Brockman@gdb
精选
OpenAI的GPT-5.4与Molecule.one的Maria AI合作,推动了一个药物化学项目从文献综述到实验验证的完整流程。模型提出了一种意想不到的方法,改进药物发现中广泛使用的反应。该结果在专用实验室中得到验证。相关推文获得180个点赞和超过2.3万次查看。
事件专题

推荐理由:OpenAI的GPT-5.4这次不是聊天,而是真帮化学家改进了药物反应,和Molecule.one的AI配合,从文献到实验跑通了
03:06
03:06官方账号xAI@xai
精选
xAI的Grok 4.3模型正式在Amazon Bedrock上可用,AWS开发者可通过Bedrock的安全推理引擎调用。Grok 4.3在幻觉率和工具调用两项基准上表现领先,能支持更可靠的生成与外部功能集成。该模型目前向所有AWS区域开放,按token计费。
事件专题

推荐理由:xAI把Grok 4.3放到了AWS上,你用Bedrock就能直接调,幻觉率低、工具调用强,适合做可靠应用。
6月17日
23:06
23:06官方账号LMSYS Org (SGLang)@lmsysorg
精选
Zai_org 发布了新旗舰模型 GLM-5.2,支持 1M token 长上下文。在 Terminal-Bench 2.1 上,GLM-5.2 得分 81.0,相比 GLM-5.1 的 62.0 提升明显。IndexShare 机制在 1M 上下文下将每 token 的 FLOPs 降低了 2.9 倍,改进的 MTP 将投机解码接受率提升了 20%。该模型在 SGLang 中已获得即日支持。

推荐理由:Zai_org 的 GLM-5.2 来了,1M 长上下文拿下了 81.0 的 Terminal-Bench 分数,比上一代高出一截,而且推理效率也优化了,值得上手试试。