8月4日
16:43
16:43官方一手pandaily@contact@pandaily.com (Pandaily)
Moonshot AI的Kimi K3、阿里Qwen3.8-Max和字节Doubao-Seed-2.1均采用原生多模态训练,而DeepSeek、智谱和腾讯混元仍坚持纯文本路线。在长程智能体任务中,视觉信息的实时参与成为决定性因素。这一差异将影响下一代模型在复杂环境中的表现。
事件专题

推荐理由:Kimi K3和DeepSeek V4现在走了两条路:一个搞原生多模态,一个纯文本硬扛。长任务里能不能看懂画面,差距会越来越大。
13:38
13:38官方账号Latent Space (swyx)博客/媒体
Qwen发布了两个新开源模型:Qwen 3.8 Max,参数规模2.4T,以及27B版本。两个模型都面向编程和协作场景,权重已经开放。开发者可以基于这些权重进行本地部署或微调。这延续了Qwen在开源模型上的发布节奏。

推荐理由:Qwen这次一口气放了2.4T和27B两个开源权重模型,专攻编程和协作用途,想自己部署或微调的直接看就行。
04:30
04:30官方一手OpenAI Blog博客/媒体
OpenAI用六个月构建了GPT-Live实时语音系统。GPT-Live采用无轮次语音模型,实现了连续语音交互。低延迟架构使得对话响应更迅速,更接近自然交流。OpenAI官方博客公开了这套系统的构建方法与技术细节。
事件专题

推荐理由:OpenAI搞了个GPT-Live,能连续对话不用等你说完,延迟更低,比传统语音助手自然多了。
03:15
03:15官方账号OpenAI@OpenAI (@OpenAI)
82°
OpenAI在X平台宣布,其下一代旗舰模型的内部版本在数学和理论计算机科学领域的10个长期开放问题上取得了新结果。该模型运行消耗的token价值约2000美元,按GPT-5.6 Sol API费率计算。推文附带的视频展示了部分求解过程,目前该模型尚未公开发布。
事件专题

推荐理由:OpenAI说下一代模型内部版才花2000美元token就解了10个数学老难题,按GPT-5.6 Sol API费率算的,很猛。
8月3日
21:27
19:21
19:21官方账号Decoder@Jonathan Kemper
74°
阿里巴巴发布旗舰模型Qwen3.8-Max,总参数达2.4万亿。该模型可自主执行跨数天的复杂任务,包括复现研究论文和设计芯片。与常见闭源模型不同,Qwen3.8-Max采用开放权重,团队计划下周公布权重文件。

推荐理由:阿里那个2.4万亿参数的Qwen3.8-Max要开源了,能自己搞芯片设计,下周放权重,想玩长任务的盯紧点。
16:39
16:19
16:19IT之家博客/媒体
Arena平台发布2026年第31周AI大模型排行榜。阿里qwen3.8-max以1496分位列综合榜第5,距榜首claude-fable-5仅差13分。月之暗面kimi-k3-max以1485分排综合榜第13。代码榜中,kimi-k3-max和qwen3.8-max分别以1531分和1530分进入Top10。前端开发榜kimi-k3-max以1676分排第二,字节seedream-5.0-pro进入AI生图榜第6名。
事件专题

推荐理由:阿里新模型qwen3.8-max一上榜就冲到综合第五,只比榜首Claude差13分;kimi-k3-max代码也进了前十,国产模型进步挺明显,榜单值得翻翻。
16:01
16:01官方一手pandaily@contact@pandaily.com (Pandaily)
77°
中国智能体InAgent在OSWorld基准上取得90.2%任务成功率,成为首个突破90%的计算机操作智能体。它在系统级任务上达到100%完成率。这一成绩超过OpenAI、Google和Anthropic此前保持的纪录。报道还提到,Harness工程正成为AI竞赛的新前沿。
事件专题

推荐理由:InAgent在OSWorld刷到90.2%,系统级任务100%,比OpenAI、谷歌、Anthropic都高,快看。
16:00
16:00官方一手pandaily@contact@pandaily.com (Pandaily)
79°
阿里巴巴发布Qwen3.8-Max正式版,参数量达2.4万亿。该模型支持1M上下文窗口,可执行长时间运行的智能体任务。官方称其编码与办公能力显著提升,跻身全球第一梯队。开源权重预计一周内公布,开发者可下载使用。

推荐理由:阿里发了Qwen3.8-Max,2.4T参数加1M上下文,做长任务Agent很强,而且下周就开源了,能直接玩。
15:59
15:59官方一手pandaily@contact@pandaily.com (Pandaily)
MiniMax 在 HuggingFace 上开源 H3-Base 权重,采用 33B 参数的稠密单流 Omni-Transformer 架构。该模型配备 16 倍空间和 4 倍时间压缩 VAE,本地运行只需两张 RTX 5090 显卡。其 API 定价仅为 Seedance 2.0 的三分之一。H3 在基准测试中直接对标 Seedance 2.0,展示了开源视频生成模型的竞争力。

推荐理由:MiniMax 把 H3 开源了,33B 参数,两张 RTX 5090 就能本地跑,API 价格只有 Seedance 2.0 的三分之一,想玩视频生成的可以试试。
15:14
14:39
10:35
10:35IT之家博客/媒体
阿里巴巴今日发布千问 Qwen3.8-Max,参数规模达 2.4 万亿。官方称其在编程、真实办公、长程任务与多模态智能体方面实现提升。该模型能以极少人工介入端到端完成复杂开放目标。模型权重将于下周开源。

推荐理由:千问新模型 Qwen3.8-Max 有 2.4 万亿参数,编程办公更强,端到端自主干活,下周还开源。
09:54
09:54官方一手pandaily@contact@pandaily.com (Pandaily)
清华团队开源VeriLoop Coder-E1,基于Qwen3.6-27B模型。模型在SWE-bench Verified获得85.20分,SWE-bench Pro为62.38分,Terminal-Bench 2.0达76.40分,DeepSWE为33.63分。该模型采用窄领域PEFT和Self-Harness技术,实现仓库级代码修复的可验证递归自改进。

推荐理由:清华开源了个能自己改代码的模型VeriLoop Coder-E1,SWE-bench拿85.2分,比很多大模型都强,想搞代码修复的可以试试。
09:48
09:48官方一手pandaily@contact@pandaily.com (Pandaily)
71°
DeepSeek-V4-Flash-0731正式发布并开源,参数量304B,性能评分82.7。该模型超越V4-Pro预览版,定价为0.14/0.28美元。在VulcanBench基准上位列第一,HuggingFace热度榜第二。官方称其表现媲美Claude Opus-4.8。
事件专题

推荐理由:DeepSeek把304B的V4-Flash开源了,性能打平Claude Opus-4.8,价格还便宜,快去试试。
8月2日
22:17
22:17官方账号Nathan Lambert: Interconnects@Florian Brand
开放模型系列第23期介绍了Laguna S2.1、Inkling和Kimi K3。这三个模型展示了开源权重在帕累托前沿上的竞争力,兼顾性能与效率。文中指出,训练强模型的能力正在快速扩散到更多团队。
事件专题

推荐理由:三个新开源模型:Laguna S2.1、Inkling和Kimi K3,这期合集讲清楚了它们好在哪。
03:08
03:08官方一手marktechpost@Asif Razzaq
AMD推出Instella-MoE-16B-A3B,这是一个完全开源的混合专家语言模型,总参数16B,每个token仅激活2.8B。模型采用Gated MLA与FarSkip-Collective架构,在Instinct MI300X和MI325X GPU上从零训练。AMD已发布所有训练阶段的权重,并公开数据混合、配置和推理代码。
推荐理由:想用AMD显卡跑大模型的可以看看,AMD把16B总参数、2.8B激活的MoE模型全开源了,连训练配置和数据配方都给了。