6月20日
06:57
06:57官方一手marktechpost@Asif Razzaq
NVIDIA AI推出了SpatialClaw,这是一个无需训练的智能体。它通过编写Python代码在持久内核中执行,将代码作为动作接口。SpatialClaw能够组合多种感知工具,实现3D空间推理。这种设计免去了传统微调或训练步骤。
事件专题

推荐理由:NVIDIA搞了个叫SpatialClaw的智能体,不用训练,直接用写Python代码的方式做3D空间推理,挺创新的。
06:15
06:15官方一手marktechpost@Asif Razzaq
VibeThinker-3B是一个3B参数的MIT许可证推理模型,基于Qwen2.5-Coder-3B构建。该模型采用Spectrum-to-Signal后训练流水线。在可验证基准上,它匹配了DeepSeek V3.2和Kimi K2.5的性能。
事件专题

推荐理由:3B参数就能比肩DeepSeek V3.2和Kimi K2.5,基于Qwen2.5-Coder-3B开源,适合资源受限场景的推理任务。
6月19日
22:18
22:18官方账号Decoder@Maximilian Schreiner
一项新基准测试评估了AI处理真实知识工作的能力。即使是最先进的AI模型,也仅能完全解决3%的任务。这一结果凸显了当前AI在处理复杂、多步骤的知识工作方面仍存在巨大短板。

推荐理由:这个新基准狠狠打了AI的脸——最强模型也只完成3%的真实知识工作,别看平时吹得厉害。
21:53
14:30
13:36
13:36量子位@衡宇
73°
北京通用人工智能研究院发布全球首个人形机器人通用小脑,基于2万小时人类动作数据训练。该模型在未经微调的情况下,能零样本泛化到多种新任务和场景。相比传统方法,它减少了90%的调试时间,使机器人动作更自然。
推荐理由:北通院搞了个通用小脑,用两万小时人类动作数据训练,机器人不用重新学就能干新活,比传统方法省时省力。
03:29
03:29官方账号Decoder@Matthias Bastian
OpenAI发布了ChatGPT的医疗功能升级,基于GPT-5.5 Instant模型。在内部对比测试中,该模型在准确性、清晰度和完整性上均超过医生撰写的答案。健康相关陈述的错误率降低了71%。OpenAI声称这是医疗问答能力的一次显著提升。
事件专题

推荐理由:OpenAI用GPT-5.5 Instant让ChatGPT在医疗问答上比医生答得更好,准确率提升了71%,值得试。
02:10
02:10官方一手OpenAI Blog博客/媒体
OpenAI 推出 GPT-5.5 Instant,用于增强 ChatGPT 在健康和 wellness 领域的回复质量。新模型在推理、上下文理解、沟通清晰度上均有提升,并引入 physician-informed 评估方法。该改进旨在提高医疗健康场景下 AI 回复的准确性和可信度。
事件专题

推荐理由:GPT-5.5 Instant 让 ChatGPT 的健康建议更靠谱了,医生参与评估的设计值得关注。
6月18日
01:55
01:55官方账号Decoder@Jonathan Kemper
精选
智谱AI推出开源模型GLM-5.2,采用MIT许可证,支持稳定100万token上下文。在FrontierSWE编码基准测试中,GLM-5.2以1个百分点之差落后于Anthropic的Claude Opus 4.8。该模型在推理能力上仍显著落后于闭源竞争对手。
事件专题

推荐理由:智谱AI的GLM-5.2在长时间编码任务上只比Claude Opus 4.8差1%,还是开源免费,码农可以试试。
00:36
6月17日
23:30
23:30官方账号Decoder@Maximilian Schreiner
73°
Nvidia、卡内基梅隆大学和UC Berkeley的研究人员使用AI编码智能体(coding agents)训练机器人自主完成灵巧抓取任务。项目部署了8台机器人,在真实世界中执行复杂抓取,成功率高达99%。该研究展示了AI智能体在机器人技能自我提升中的潜力。
事件专题

推荐理由:Nvidia和大学团队让8台机器人用AI编码智能体自己练抓取,成功率冲到99%,比手写代码更灵活。
13:58
13:58官方一手marktechpost@Michal Sutter
精选
OpenAI于2026年6月16日推出Deployment Simulation方法,通过回放历史对话让新候选模型生成完成并评分,以估计部署时不良行为率。该方法报告了1.5倍中位数乘法误差,将预部署风险评估扩展至智能体编码场景。文章还讨论了该方法的局限性,如无法覆盖所有风险类型。
事件专题

推荐理由:OpenAI搞了个新方法,用历史对话模拟测试模型,能估算不良行为率,误差才1.5倍,做AI安全评估的朋友可以看看。
11:36
11:36量子位@十三
智谱AI于2026年6月开源了GLM-5.2模型,支持1M上下文长度。该模型在AI编程评测基准上取得第一,超过此前领先的Fable-5。基于GLM架构的持续优化,GLM-5.2在代码生成任务中展现出更强能力。开源版本已发布在GitHub。
事件专题

推荐理由:智谱开源了GLM-5.2,1M超长上下文,编程能力直接拿下第一,想换编程模型的话可以试试。
10:10
10:10官方一手pandaily@contact@pandaily.com (Pandaily)
73°
阿里巴巴发布了Qwen-Robot系列,这是其首个具身AI模型系列,涵盖导航、操作和世界建模三个领域。该系列可部署在Unitree Go2四足机器人上,仅需一个摄像头就能运行。Qwen-Robot模型旨在让机器人更智能地感知和交互物理世界。

推荐理由:阿里给机器狗装上了AI大脑,单摄像头就能导航干活,Qwen-Robot系列挺实用。
00:55
00:55官方一手marktechpost@Asif Razzaq
精选73°
Qwen团队推出Qwen-RobotSuite,包含三个具身AI模型。RobotManip是基于Qwen3.5-4B的视觉-语言-动作模型,用于操作任务。RobotWorld是一个60层MMDiT架构的语言条件视频世界模型。RobotNav是基于Qwen3-VL的导航模型,提供2B、4B和8B三种参数量。
推荐理由:一口气发了三个模型,从操作到导航都管了,全用自家Qwen3.5和Qwen3-VL,做机器人研究的可以看看。
6月16日
22:10