8月15日
16:33
16:32
14:05
14:05官方账号Decoder@Jonathan Kemper
Moonshot AI 发布 PerceptionBench 基准,专门测试多模态 AI 模型的视觉感知能力,并将该能力与逻辑推理分离评估。目前没有任何前沿模型在该基准上达到 60% 的准确率,GPT-5.6 Sol 以微弱优势领先。测试还发现,许多原本被认为是推理过程的错误,实际上在图像读取阶段就已经发生。

推荐理由:Moonshot AI 出了个新测试 PerceptionBench,专门查 AI 的“眼神”。结果最强模型 GPT-5.6 Sol 准确率也不到 60%,而且很多错是从看图时就错了。
01:31
01:31官方账号Decoder@Matthias Bastian
阿里Qwen团队发布Qwen 3.8,权重以Apache 2.0许可开放。该模型是270亿参数的密集模型,原生上下文长度达262000个token。官方称其在编码和办公任务上优于尺寸更大的Qwen 3.7 Plus。这一版本面向构建本地应用和智能体应用的开发者。

推荐理由:阿里开源了Qwen 3.8,270亿参数比Qwen 3.7 Plus更强,原生支持26.2万token上下文,做本地和智能体应用可以看看。
8月14日
18:47
18:47官方账号Decoder@Matthias Bastian
72°
智谱AI发布GLM-5.3,并称其为最强的开源权重编码模型。据其自家基准,仅通过后训练就比上一代提升50%。该模型经过网络安全训练,帮助安全团队在269个项目中找到2436个漏洞。模型权重计划在两周后开源。
事件专题

推荐理由:智谱发了GLM-5.3,说是开源编码模型里最强的,后训练提升50%,还帮找出了2436个漏洞,权重两周后开源,可以关注下。
18:12
17:55
17:55官方一手pandaily@contact@pandaily.com (Pandaily)
深圳机器人公司X Square Robot在一次未经编辑的实机测试中,用简单夹爪在一小时内分拣了1816个包裹。它为自己设定的目标是1248件,这个数字恰好等于Figure AI公布的持续每小时平均分拣量。最终X Square Robot的实际成绩比该基准高出约45%。

推荐理由:X Square Robot用简单夹爪一小时分拣1816个包裹,还拿Figure AI的数字当基准,结果超了45%,挺实在的。
16:26
16:26官方一手Pandaily@contact@pandaily.com (Pandaily)
中国语音AI创业公司VUI Labs的Luna-TTS模型在Hugging Face TTS Arena排行榜上位列第一,超越了ElevenLabs、MiniMax和Cartesia。在Artificial Analysis的Speech Arena榜单中,Luna-TTS排名第三,领先Google。该模型基于Qwen3的扩散架构,首包延迟仅为41.6毫秒。

推荐理由:VUI Labs的Luna-TTS登顶语音评测榜,延迟才41.6毫秒,比ElevenLabs还快,搞语音合成的该看看。
16:24
16:24官方一手Pandaily@contact@pandaily.com (Pandaily)
智谱AI首席科学家唐杰在X上回应‘sooooooon’数小时后,GLM-5.3正式上线。该模型专注编程与安全,将SWE-Marathon成绩翻倍至42.5,Terminal Bench 3.0提升至28.3,是原来的5倍。在CyberGym基准上,GLM-5.3以84.5分居所有模型之首。模型发布距用户调侃唐杰仅三天。
事件专题

推荐理由:想试最强编程+安全模型?GLM-5.3刚发布,SWE-Marathon和CyberGym都拿了第一,看它怎么碾压对手。
14:48
05:19
05:19techcrunch@Russell Brandom
Writer 发布了基于 Z.ai 开源模型 GLM-5.2 的后训练新模型。新系统(基于 GLM-5.2)宣称以更低价格提供部署就绪能力,并升级 harness 控制 token 成本。Writer 表示,该模型延续了 GLM-5.2 的开源生态优势。
推荐理由:Writer 出了新模型,基于 GLM-5.2 改的,价格更低还升级工具省 token 成本,适合想省钱的开发者。
02:49
02:49官方账号Decoder@Matthias Bastian
71°
谷歌在 3.6 Flash 发布仅三周后推出 Gemini 3.7 Flash,定位为编码和 AI 智能体场景的旗舰工作模型。官方基准显示,Gemini 3.7 Flash 在编码任务上超过 Claude Sonnet 5 和 GPT-5.6 Terra,而价格仅为两者的一半。新模型的价格也比三周前的 Gemini 3.6 Flash 低 50%。

推荐理由:谷歌新出的 Gemini 3.7 Flash,编码和智能体能力更强,价格比 3.6 又砍半,还比 Claude 和 GPT 便宜一半,拿来写代码试试。
00:50
00:50官方账号Decoder@Jonathan Kemper
DeepSeek将旗舰模型V4-Pro从测试阶段转为正式发布,同时以MIT许可证开源了智能体软件Harness v0.1。API价格同步上调,缓存命中成本涨至原来的6倍。对于反复读取相同文件的智能体工作流,这是价格涨幅最大的部分。

推荐理由:DeepSeek把V4 Pro转正,开源了Harness v0.1,但缓存涨价到6倍,跑智能体工作流得多算算账。
8月13日
18:12
18:12官方一手marktechpost@Asif Razzaq
Dyna Robotics推出世界动作模型Dyna-2,预训练数据超过100万小时的第一人称人类视频。技术报告展示了在人类数据上至1M小时的缩放定律,并首次将该定律迁移到未见过的机器人数据。实验还表明,视频联合训练能推动跨实体泛化。该模型旨在让机器人从人类行为中学习动作执行。
推荐理由:Dyna Robotics把100万小时人类视频喂给机器人模型,搞出了Dyna-2,还验证了缩放定律能跨界到机器人数据,看它怎么做到跨实体泛化挺有意思。
18:11
18:06
18:06IT之家博客/媒体
DeepSeek 发布 DeepSeek-V4-Pro-0813 正式版,API 同步上线更新。新版本增强了智能体能力,支持 Responses API 和 Codex 接入。在多项测试中,DeepSeek V4 Pro 正式版性能接近 Fable 5,相比预览版大幅提升。
事件专题

推荐理由:DeepSeek 又发新版本了,V4 Pro 正式版 API 已上线,智能体能力更强,还支持 Codex,性能直逼 Fable 5。
18:02
17:59