8月1日
02:05
7月31日
23:04
23:04官方一手歸藏(guizang.ai)@op7418
精选
DeepSeek 宣布 V4 Flash 0731 模型已开源。模型权重托管在 Hugging Face 的 deepseek-ai 组织下。该版本属于 Flash 系列,版本号为 0731。开发者可以下载权重进行本地部署或二次开发。
推荐理由:DeepSeek 把 V4 Flash 0731 的开源权重放出来了,想本地跑模型的话直接去 Hugging Face 下载就行。
16:21
16:21官方一手pandaily@contact@pandaily.com (Pandaily)
Kimi K3技术报告披露了MoonEP、KDA和AttnRes三套基础设施方案。报告强调MFU对训练效率的关键作用。Moonshot AI认为专家并行与共享专家的工程实现是真正壁垒。这些经验让开源模型的经济优势难以被复制。
事件专题

推荐理由:Moonshot AI公开了Kimi K3的MoonEP等设计,但真正难抄的是工程调优经验,这决定了开源模型能不能打。
12:58
12:58官方账号arXiv cs.AI@Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong
OSReward 是一个用于评估视觉语言模型(VLM)判断计算机使用智能体轨迹能力的基准。研究者在多平台、多智能体框架上收集人工验证的指令轨迹,并通过多阶段标注得到真实标签。评测发现,即使是当前最强的 VLM 判断器也存在系统性宽松偏差,常把失败操作标记为成功。为此,团队构建了包含 10 万条推理标注轨迹的 OS-Shepherd-100K 语料,并训练出 9B 和 35B 的 OS-Shepherd 奖励模型。这两个开源模型能以比商业判断器低 30-60% 的成本提供同等质量的奖励信号。
推荐理由:OS 团队开源了 OSReward 基准和 9B/35B 奖励模型,专测 AI 判断电脑操作任务是否成功,成本比商业方案低 30-60%。
12:21
11:10
11:10OpenRouter@OpenRouterAI
MiniMax 发布开源权重视频模型 Hailuo H3,已上线 OpenRouter。H3 支持文本、图像、音频和视频四种输入,并输出原生音视频。官方定位包括指令驱动编辑、文字/品牌渲染和视频到视频的动作迁移。H3 主打轻量级,可直接在 OpenRouter 上调用。
推荐理由:开源视频模型 H3 上 OpenRouter 了,能按指令改视频、渲染品牌文字,还能视频到视频迁移动作,直接调用很方便。
10:01
10:01官方一手pandaily@contact@pandaily.com (Pandaily)
Kimi K3 是 Moonshot AI 开源的 2.8T 参数模型,也是目前最大的开放权重模型。发布两天内因访问量过大导致服务短暂过载。该模型上线后占全球开源下载量的 41%,海外付费用户增长 4 倍,API 收入增长 400%。
事件专题

推荐理由:Moonshot 开源的 Kimi K3 有 2.8T 参数,是目前最大开源权重模型,一上线就过载,海外付费和 API 收入都翻了几倍。
03:39
03:39lmarena.ai@lmarena_ai
精选
Thinking Machines 发布 Inkling-Small,总参数量 276B,其中 12B 活跃。该模型在 Text Arena 的 AutoEval 初评中获得 1431 分,排名 #88,并在开放模型中位列 #21。它是美国仅有的五个进入开放模型前 25 的模型之一。初始分数基于 Arena 人类偏好数据训练的奖励模型自动投票得出,待与真实投票验证。
事件专题

推荐理由:Thinking Machines 新出的开源模型,276B 参数但只激活 12B,一发布就挤进 Text Arena 前 100,美国厂商里排前几,想试大参数但轻量推理的可以看看。
01:56
7月30日
09:17
09:17官方账号arXiv cs.LG@Petr Simecek, Elnaz Babayeva, Jiri Balhar, Michal Bida, Michal Buran, Vaclav Cadek, Luigino Camastra, Tomas Dulka, Michal Janocko, Tomas Klohna, Pavel Kohout, Ondrej Kokes, Adam Krivka, Jakub Kubik, Patrik Mada, Igor Morgenstern, Marek Pavelka, Joshua Rogers, Petr Stastny, Jan Tattermusch, Dmitrijs Trizna, Martin Votruba, Guido Vranken, Jakub Zikl, Evelina Gabasova, Stanislav Fort
论文提出HoF-Bench基准,由AISLE发现的95个真实CVE组成,覆盖8个开源仓库。在严格协议下,一个最小化LLM分析器重新发现了65个CVE(68%)。10个检测骨干包括5个开源模型(21B-284B参数)和5个专有小模型,均无前沿模型参与。基准提供7,600条模型-CVE通过记录,用于比较漏洞扫描器的可靠性。数据集已在Hugging Face发布。
推荐理由:想看开源模型能不能真挖漏洞?这个基准用95个真实CVE测了10种模型,最弱的也能找回68%,数据很实在。
7月29日
11:17
11:17官方账号arXiv cs.AI@Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir
76°
MODUS是一个仅解码器的any-to-any多模态模型,无需模态特定的输出头或损失函数,就能从任意组合的输入模态预测任意输出模态。它在视频、图像、语言等模态上直接使用预训练解码器,无需重头训练。在多个基准测试中,MODUS与专业模型和多任务基线性能相当甚至更优。所有代码和模型权重已在 modus-multimodal.epfl.ch 开源。
推荐理由:MODUS用一个解码器统一处理各种模态的输入输出,省去多个专用组件,性能不输专家模型,还开源了。
11:16
08:36