11:57量子位@量子位的朋友们PPIO正式发布Fusion融合模型。官方称其用十分之一的价格就能超越顶级模型的智商。这相当于把成本打到10%,让更多应用能负担得起。AI模型PPIOFusion推理模型推荐理由:PPIO新出了Fusion模型,说花十分之一的价格就能有顶级表现,预算紧的可以瞧瞧。原文稍后读已读值得跟进有用关注 PPIO
10:14量子位@henry卡帕西(Andrej Karpathy)公开推荐了一个名为“指环王基准”的大模型评测方案。该基准用《指环王》原著考察模型对长篇叙事的理解,而非简单问答。目前“指环王基准”尚未放出完整测试集和模型成绩,但已在开发者社区引发讨论。AI模型指环王Karpathy基准测试推荐理由:卡帕西推了个新基准,用《指环王》当考题测大模型,比枯燥的选择题有意思多了。原文稍后读已读值得跟进有用关注 指环王
08:06IT之家(博客/媒体)82°消息源@synthwavedd在X平台爆料,OpenAI目标下周发布内部代号为mewfour的Astra模型。该模型是OpenAI自GPT-4.5以来训练的最大预训练模型。其内部版本已解出10个重要开放数学问题,按Sol API费率计算消耗约2,000美元词元成本。该模型可组织和协同AI智能体,面向长周期、高难度任务的推理与协作工作流。AI模型OpenAIAstraGPT-4.510 个信源在谈事件专题推荐理由:OpenAI下周可能要发Astra,是GPT-4.5以来最大模型,能解10道数学难题,还能调度智能体干活。原文稍后读已读值得跟进有用关注 OpenAI
03:44官方账号OpenAI@OpenAI (@OpenAI)OpenAI发布GPT-5.6 Luna,推理能力升级。GPT-5.6 Luna对免费版和Go用户开放了Think按钮。借助该按钮,GPT-5.6 Luna面对更难题可进行更多推理。AI模型GPT-5.6 LunaOpenAIThink按钮10 个信源在谈事件专题推荐理由:OpenAI把Think按钮下放给免费用户,配合升级的GPT-5.6 Luna,难题能多想几步,赶紧去试试。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
01:06官方一手OpenAI Blog(博客/媒体)OpenAI在ChatGPT中推出改进后的GPT-5.6 Sol,提升了准确性和一致性。免费用户现在可以访问该模型,并享受与GPT-5.6 Luna的无限日常对话。这次更新扩大了高级模型的覆盖范围,降低了使用门槛。AI模型GPT-5.6 SolChatGPTOpenAI10 个信源在谈事件专题推荐理由:OpenAI给GPT-5.6 Sol做了升级,免费用户也能用了,还能无限聊Luna版,试试看区别大不大。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
00:21官方一手Google DeepMind: Blog(博客/媒体)72°DeepMind在官方博客发布WeatherNext,将其定位为面向气旋预报的AI模型。该模型利用机器学习技术,在热带气旋路径和强度预测上展示了新的能力。官方称这是气旋预报领域的一次突破。AI模型WeatherNextDeepMind气旋预报推荐理由:DeepMind出了个新模型WeatherNext,专门用来预测气旋(台风/飓风),说是预报精度有突破,关心极端天气的可以看看。原文稍后读已读值得跟进有用关注 WeatherNext
21:51官方账号Decoder@Maximilian Schreiner阿里发布的Qwen3.8 Max在Artificial Analysis Intelligence Index上得分56,比上一代Qwen3.7 Max的46分高出10分。该分数追平了Claude Opus 4.8。但Kimi K3的得分更高,且成本低25%。AI模型Qwen3.8 MaxClaude Opus 4.8Kimi K310 个信源在谈事件专题推荐理由:Qwen3.8 Max一口气涨10分追平Claude,但Kimi K3更便宜还更强,值得看。原文稍后读已读值得跟进有用关注 Qwen3.8 Max
21:15官方账号Decoder@Maximilian Schreiner精选Meta发布了Muse Spark 1.2和编程智能体Muse Code,后者设计用于在崩溃后恢复工作。最便宜档每百万输出token仅20美分,但要求用户共享数据用于训练。Meta以价格而非顶级性能参与竞争,基准测试中存在明显差距。AI模型Muse SparkMuse CodeMeta10 个信源在谈事件专题推荐理由:Meta这次拼价格,Muse Code崩了能接着干,最便宜档20美分每百万token,但得拿数据来换。原文稍后读已读值得跟进有用关注 Muse Spark
20:45IT之家(博客/媒体)72°阿里云 8 月 6 日宣布 Wan3.0 开启公测,单次可生成 30 秒视频,支持文本、图片、音频、视频及 doc、xls、ppt、pdf、md 等文档格式输入。在文生视频模式中,Wan3.0 强化人像细节表现,追求千人千面,并能在参考任务中保持角色、道具、场景和风格的一致性。API 价格方面,480P/720P/1080P 分别为 0.3/0.6/1.2 元/秒,目前已于阿里云百炼、万镜一刻等平台开放公测。AI模型Wan3.0阿里云视频生成推荐理由:阿里 Wan3.0 能一次生成 30 秒视频,还支持读文档做课件和汇报,试试看效果如何。原文稍后读已读值得跟进有用关注 Wan3.0
18:14量子位@量子位的朋友们阿里Qwen3.8在Artificial Analysis的Agentic能力榜单中得分全球第一,超越其他参评模型。该榜单重点考察模型在智能体任务中的工具调用与多步推理表现。这标志着Qwen3.8在复杂任务自主执行方面已达到全球领先水平。AI模型Qwen3.8Artificial Analysis阿里推荐理由:阿里的Qwen3.8在Artificial Analysis的智能体能力榜上拿了第一,做Agent开发选它准没错。原文稍后读已读值得跟进有用关注 Qwen3.8
17:28IT之家(博客/媒体)72°华为计算8月5日宣布,昇腾基于Ascend C编程语言提供完整训推一致算子集。在Qwen3-30B MoE模型上测试实现Logdiff为0,并通过FA算子优化在Eager模式下获得20%-60%性能收益。该方案通过统一注意力语义、锁定reduce累加序等4项修改,解决训练与推理累加不保序问题。相关基础设施已开源至GitHub,并将上线训推一致问题识别Skill。AI模型昇腾Ascend CQwen3-30B1 个信源在谈事件专题推荐理由:华为昇腾把RL训推一致做出来了,Qwen3-30B上Logdiff归零,还能提速20%-60%,搞强化学习训练可以看看。原文稍后读已读值得跟进有用关注 昇腾
15:45量子位@量子位的朋友们MiniMax 视频生成模型 H3 登顶开源社区排行榜第一。它以这一成绩为视频模型领域定义了一条“斩杀线”,低于该水准的开源模型将被淘汰。榜单第一意味着 H3 目前是开源视频模型中综合表现最强的一个。AI模型MiniMaxH3视频生成推荐理由:MiniMax 的 H3 把开源视频模型榜一拿下了,做视频生成可以拿它当新基准来比。原文稍后读已读值得跟进有用关注 MiniMax
14:26IT之家(博客/媒体)精选DeepGrove 发布轻量模型 Maple-Preview-20B-A1B,采用混合专家架构,总参数量 202 亿,激活参数量 14.9 亿。官方称在 iPhone 上运行速度达 127 tokens/s,是 Bonsai 27B(9.6 tokens/s)的约 13 倍。该模型使用三值权重方案,将权重约束为 {-1,0,1},包含 24 层、256 个专家(8 个活跃)。在 MacBook Pro(M5 Pro)上完成 IMO 2024 P1,结果为 7/7,运行速度 281.5 tokens/s。处理 131,000 tokens 上下文时,内存占用约 7.69GB。AI模型Maple-PreviewDeepGrove三值权重推荐理由:DeepGrove 新模型 iPhone 上跑 127 tokens/s,比 Bonsai 27B 快约 13 倍,亮点是三值权重方案。原文稍后读已读值得跟进有用关注 Maple-Preview
13:56IT之家(博客/媒体)Black Forest Labs 于 8 月 5 日发布视频生成模型 FLUX 3,单次生成最长 20 秒、原生 1080p 视频,还附带原生音频。该模型采用统一架构联合学习图像、视频和音频,支持文生视频、图生视频、视频生视频及多镜头串联等功能。在官方公布的跑分中,FLUX 3 文生视频得分 1135,超过 Gemini Omni Flash 和 Minimax H3;图生视频得分 1051,超过 Seedance 2.0 和 Minimax H3。定价方面,Draft 模式文本转视频每秒 0.06 美元,全高清模式视频转视频每秒 0.53 美元。AI模型FLUX 3Black Forest LabsSeedance 2.05 个信源在谈事件专题推荐理由:FLUX 3 上线了,能生成带声音的 20 秒 1080p 视频,跑分超 Seedance 2.0。原文稍后读已读值得跟进有用关注 FLUX 3
10:36官方一手Pandaily@contact@pandaily.com (Pandaily)西湖大学研究员于开成创立的 Awomo 获得1亿元种子轮及天使轮融资,其创始人首次公开阐述概念空间世界模型。该模型与数据驱动的大规模扩展法则不同,强调隐式概念空间推理。于开成曾参与撰写现有规模扩展法则,如今转向新的技术路线。目前该项目仍处于早期,尚未公布完整基准测试结果。AI模型Awomo于开成西湖大学推荐理由:于开成拿了1亿融资,做了个不走老路的世界模型,跟scaling law对着干,值得看看原文稍后读已读值得跟进有用关注 Awomo
10:29官方一手pandaily@contact@pandaily.com (Pandaily)81°DeepSeek V4 Flash以7.1万亿token登顶OpenRouter周度token使用量榜首。榜单前五名中已有四款中国模型,OpenAI随即把GPT-5.6 Luna的价格下调80%。梁文锋的“硬汉”表情包在社交网络走红,进一步放大了外界对中国大模型全球竞争力的关注。AI模型DeepSeek V4 FlashOpenRouterGPT-5.6 Luna10 个信源在谈事件专题推荐理由:中国模型前五占四,DeepSeek V4 Flash一周跑7.1万亿token,OpenAI直接砍价80%,这仗打得真热闹。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
08:47官方一手marktechpost@Asif RazzaqSkillOpt 的核心结果不只有 52/52,Section 4.3 显示导出的 best_skill.md 能在未训练过的环境里继续工作。一个用 Codex 训练的 SpreadsheetBench 技能,让 Claude Code 从 22.1 提升到 81.8,略高于该环境自己训练技能得到的 80.4。迁移保留率随任务类型差异明显:电子表格任务达 102%,数学任务只有 10%。AI模型SkillOptMicrosoftCodex推荐理由:别只盯 52/52,微软把 Codex 练好的技能搬到 Claude Code,电子表格直接涨到 81.8,比自己练还高一点;不过数学任务保留率只有 10%。原文稍后读已读值得跟进有用关注 SkillOpt
08:29官方账号Simon Willison’s Weblog(博客/媒体)Meta推出编码智能体Muse Code,并同步发布Muse Spark 1.2。该版本是1.1的编码专项更新,重点提升代码生成、复杂调试和代码库理解能力。训练上大幅增加编码任务算力,并扩展训练环境多样性。模型通过长周期编码任务训练,支持仓库级生成和端到端项目开发。Muse Spark 1.2与Muse Code协同训练,优化了目标管理、任务压缩和子智能体协作。AI模型Muse Spark 1.2Muse CodeMeta10 个信源在谈事件专题推荐理由:Meta这回把编码智能体和模型一起发了,1.2版本在代码生成和调试上更强,还专门跟自家工具链配合,写代码的可以试试。原文稍后读已读值得跟进有用关注 Muse Spark 1.2
00:59官方账号Decoder@Jonathan KemperMistral发布开源安全模型Shieldstral,参数规模仅3B,通过自然语言是/否问题检查AI输入输出的安全违规,而非使用固定分类。在部分基准测试中,Shieldstral的表现与比它大7倍的模型相当。运营者可在运行时自定义检测标准,无需依赖第三方的分类体系,且模型支持本地部署。AI模型MistralShieldstral开源模型3 个信源在谈事件专题推荐理由:Mistral出了个3B的小模型,安全检测效果能追上7倍大的模型,还能本地跑、自定义规则,做AI安全的话可以看看。原文稍后读已读值得跟进有用关注 Mistral
21:47官方一手Cloudflare Blog@Matt SilverlockCloudflare发布Agent Access Model,为任务级智能体提供新的安全架构。该模型采用严格身份代理,确保智能体以特定身份访问资源。它通过持续中介实时监控每一次API调用。有状态信任机制让系统根据上下文动态调整权限。这一设计旨在解决智能体在企业环境中的授权边界问题。AI模型CloudflareAgent Access Model智能体推荐理由:Cloudflare给智能体安全出了一套新方案:身份代理加持续审核,做任务级权限管控,适合搞Agent落地的人看。原文稍后读已读值得跟进有用关注 Cloudflare
21:38官方账号Decoder@Matthias BastianBlack Forest Labs推出FLUX 3 Video,能生成最长20秒的全高清视频,并自带原生音频和唇形同步对话,支持超过14种语言。该模型还能直接在场景中渲染文字。BFL公布的Elo排行榜显示,FLUX 3 Video的评分高于Gemini Omni Flash和Seedance 2.0。AI模型FLUX 3Black Forest LabsSeedance 2.05 个信源在谈事件专题推荐理由:Black Forest Labs出了FLUX 3 Video,能生成20秒带原生声音和口型对上的视频,还说自己比Seedance 2.0强,去看看效果吧。原文稍后读已读值得跟进有用关注 FLUX 3
16:51量子位@鹭羽Sand.ai开源了全球首个千亿参数MoE视频生成模型,总参数达114B,激活参数仅6B。该模型支持生成10秒1080P视频,单次生成成本约为0.5元。这标志着开源视频生成模型进入千亿MoE时代。AI模型Sand.aiMoE视频生成推荐理由:Sand.ai开源了千亿MoE视频生成模型,114B参数只激活6B,跑10秒1080P只要5毛钱,视频生成也卷性价比了。原文稍后读已读值得跟进有用关注 Sand.ai
16:32官方一手marktechpost@Asif Razzaq英伟达发布34B参数的开源视觉-语言-动作模型Alpamayo 2 Super,面向自动驾驶和Robotaxi场景。该模型采用32B Cosmos 3 Super Reasoner主干加2.3B扩散动作解码器,在LingoQA基准上得分79.2。它可在单次前向传播中输出轨迹、Chain-of-Causation因果链、元动作、自动标注和接地视觉问答。模型基于OpenMDW-1.1许可发布,允许微调、衍生和商业再分发。AI模型Alpamayo 2 SuperNVIDIAVLA10 个信源在谈事件专题推荐理由:英伟达这个34B开源VLA模型专攻自动驾驶,LingoQA拿79.2,还能商用改造,做Robotaxi的可以直接上手。原文稍后读已读值得跟进有用关注 Alpamayo 2 Super
16:26官方一手Pandaily@contact@pandaily.com (Pandaily)腾讯通过WorkBuddy、Tencent Design Miora和TokenHub三个平台向国际市场开放旗舰Hy3大模型。WorkBuddy上的Hy3模型免费使用截止到2026年8月31日。该模型是腾讯在AI领域的重要布局,此次国际开放旨在扩大其全球影响力。AI模型Hy3腾讯WorkBuddy1 个信源在谈事件专题推荐理由:腾讯把Hy3模型放到国际上了,WorkBuddy上免费用到8月底,想试试国产大模型的可以去玩。原文稍后读已读值得跟进有用关注 Hy3
16:23IT之家(博客/媒体)国际AI安全基准CyberGym最新排名显示,中国团队达酷诺威与DARKNAVY联合研发的DoGNAVY以90.8%的通过率位列全球第三、开源第一。微软和谷歌依靠多个顶级闭源模型组合路由提升成绩,而DoGNAVY仅使用一款开源通用模型GLM-5.2,可自由下载部署。央视新闻指出,AI安全攻防进入实战化阶段,开源路线让顶尖安全能力更易被掌握。AI模型DoGNAVYCyberGymGLM-5.2推荐理由:DARKNAVY和达酷诺威搞的DoGNAVY在CyberGym拿了全球第三、开源第一,只靠一个开源模型GLM-5.2就干翻了微软谷歌的闭源组合,你也能下载来用。原文稍后读已读值得跟进有用关注 DoGNAVY
16:17官方一手pandaily@contact@pandaily.com (Pandaily)独立机构SaferAI对Zhipu GLM-5.2的审计显示,其网络攻击能力与GPT-5.5持平,但缺少内容过滤护栏。审计中76%的安全漏洞可被复现,模型对恶意请求的拒绝率为0%。这一结果暴露了开源权重版本在部署时的结构性风险。AI模型SaferAIGLM-5.2Zhipu推荐理由:SaferAI测了Zhipu的GLM-5.2,攻击力比肩GPT-5.5,但零内容过滤,开源风险不小。原文稍后读已读值得跟进有用关注 SaferAI
15:47量子位@听雨英伟达用了20年构建的CUDA生态,被AI用10小时撕开缺口。这一技术绕过了CUDA专有壁垒,将代码迁移到其他GPU平台的难度大幅降低。CUDA作为英伟达核心护城河的地位因此遭到动摇。AI模型CUDA英伟达GPU编程推荐理由:老黄攒了20年的CUDA家底,被一个AI用10小时挖穿了。以后换显卡跑模型,不用再手动改代码。原文稍后读已读值得跟进有用关注 CUDA
15:44IT之家(博客/媒体)小米于8月5日宣布开源具身基座模型 Xiaomi-Robotics-1。该模型基于超10万小时UMI数据预训练,并使用超1万小时跨本体数据后训练。开源内容包括真机后训练到模型部署的完整流程,并附带Benchmark评测代码。项目已在GitHub和Hugging Face上公开。AI模型Xiaomi-Robotics-1小米开源模型推荐理由:小米把训练好的机器人模型开源了,10万小时数据打底,还附评测代码,做具身智能的可以直接上手试试。原文稍后读已读值得跟进有用关注 Xiaomi-Robotics-1
14:35IT之家(博客/媒体)82°OpenAI 联合创始人 Andrej Karpathy 于 8 月 2 日提出一项新基准测试:给模型《指环王》开篇文字,要求用 three.js 构建可交互 3D 场景。测试资源上限为 100 万 tokens,成本约 10 美元。Claude Opus 5 在该任务中耗时约 2 小时,输出约 5500 行代码。生成结果包含比尔博告别宴会和财宝洞穴等 3D 动画场景。AI模型Claude Opus 5Karpathy基准测试10 个信源在谈事件专题推荐理由:Karpathy 的新测试:让 Claude Opus 5 用 100 万 tokens 把《指环王》开头做成 3D 场景,2 小时生成了 5500 行代码。原文稍后读已读值得跟进有用关注 Claude Opus 5
13:56IT之家(博客/媒体)Liquid AI 推出 LFM2.5-2.6B 开源智能体模型,参数仅 26 亿,可在智能手机上本地运行。该模型在 34T Token 数据集上预训练,并增强了对非拉丁字母语言的支持。基准测试显示,LFM2.5-2.6B 在指令执行和几乎所有工具使用项目中领先 gemma-4-E2B-it、gemma-4-E4B-it、Qwen3.5-4B 等更大模型,仅在 BFCLv4 中落后于 Qwen3.5-9B。在 STEM 领域,AA Omniscience 测试领先,编程仍是更大模型的优势领域。AI模型LFM2.5-2.6BLiquid AI端侧小模型2 个信源在谈事件专题推荐理由:想在手机上跑智能体?Liquid AI 这个 2.6B 小模型本地就能跑,指令和工具调用还干翻了不少大模型。原文稍后读已读值得跟进有用关注 LFM2.5-2.6B
12:14IT之家(博客/媒体)字节跳动 Seed 于 8 月 5 日发布原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本。SeedRealtime 支持边看、边听、边说,能结合画面消解同音词歧义,并在关键目标出现时主动提醒。端到端人工评测显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少了一半。目前 SeedRealtime 已在豆包 App 全量上线,更新后选择“打电话”即可体验视频通话。AI模型SeedRealtime字节跳动豆包1 个信源在谈事件专题推荐理由:字节跳动把SeedRealtime塞进豆包,打电话就能边看边聊,比级联模型卡壳少一半。原文稍后读已读值得跟进有用关注 SeedRealtime
12:06IT之家(博客/媒体)72°Mistral AI 于 8 月 4 日发布 Shieldstral,这是一个 30 亿参数的开源内容审核模型,采用 Apache 2.0 许可证,已上线 Hugging Face。模型支持 12 种语言,可在单张 16GB GPU 上运行,官方称其内容安全性能媲美 7 倍规模的开放模型,并在多模态审核任务上达到 SOTA。与将伤害类别固化在权重中的防护模型不同,Shieldstral 把审核政策写入输入,通过 <Instruct>、<Query>、<Document> 三个字段将任务转化为二元问答。推理时只读取“是/否”两个词元的逻辑值并归一化为分数,以 0.5 为阈值输出判断,覆盖提示词分类、回答审核、拒答检测和毒性检测。AI模型ShieldstralMistral内容审核3 个信源在谈事件专题推荐理由:Mistral出了30亿参数的开源审核模型,16GB显卡就能跑,审核规则可写进输入,适合做内容过滤。原文稍后读已读值得跟进有用关注 Shieldstral
10:26官方一手pandaily@contact@pandaily.com (Pandaily)75°阿里巴巴发布Qwen3.8旗舰模型,总参数2.4T,激活参数95B。同时推出千问办公智能体,面向企业AI工作流。该组合依托钉钉的企业生态,与腾讯WorkBuddy、字节豆包展开直接竞争。AI模型Qwen3.8阿里巴巴千问办公3 个信源在谈事件专题推荐理由:阿里发了Qwen3.8,总参数2.4T,还带了办公智能体,直接跟豆包和WorkBuddy抢企业客户。原文稍后读已读值得跟进有用关注 Qwen3.8
09:54IT之家(博客/媒体)精选京东开源的 JoyAI-Video-Edit 是一款实时流式视频编辑模型,在 720P 分辨率下达到每秒 30 帧的推理速度。它支持任意时长的连续编辑,用户可在视频播放过程中实时修改场景、替换物体或调整人物形象。在与 SANA Streaming、LiveEdit、Xmax-X2.0 的对比中,该模型在典型编辑场景下全面领先。在 OpenVE-Bench 通用评测中,它超越了所有流式编辑方法,尤其在全局风格、局部替换、局部删除和字幕编辑任务上优势突出。该模型还可将人手操作视频转化为机械臂操作素材,用于具身智能训练数据合成。AI模型JoyAI-Video-Edit京东视频编辑推荐理由:京东开源 JoyAI-Video-Edit,边看边改视频,720P 30帧/秒、任意时长,效果超 LiveEdit,还能生成机器人训练数据。原文稍后读已读值得跟进有用关注 JoyAI-Video-Edit
09:48IT之家(博客/媒体)英伟达发布开源自动驾驶模型 Alpamayo 2 Super,采用 Linux Foundation 的 OpenMDW-1.1 许可,支持商业使用、微调和衍生模型分发。该模型在 LingoQA 自动驾驶推理基准中排名第 1,Lingo-Judge 测试中领先 Qwen2.5-VL 72B 达 17.0 分,领先 Gemini 2.5 Pro 达 15.1 分。Alpamayo 2 Super 基于 NVIDIA Cosmos 3 Super Reasoner 构建,并通过强化学习后训练。系列中 Alpamayo 1.5 和 Alpamayo 1 作为低成本选项,适合云端开发和模型蒸馏。AI模型Alpamayo 2 SuperNVIDIAOpenMDW10 个信源在谈事件专题推荐理由:英伟达把能跑自动驾驶推理的 Alpamayo 2 Super 开源了,商用免费,LingoQA 评测第一,比 Gemini 2.5 Pro 高 15 分,搞车的开发者和车企可以直接拿去改。原文稍后读已读值得跟进有用关注 Alpamayo 2 Super
07:38IT之家(博客/媒体)72°马斯克在 SpaceX 财报电话会议上预告,Grok 4.6 将于下周发布,总参数量为 1.5 万亿。该模型重点改进监督微调(SFT)和强化学习(RL)技术。他还透露未来 3~4 周将推出 Grok 4.7,参数量达 2.1 万亿。AI模型Grok马斯克监督微调推荐理由:马斯克说 Grok 4.6 下周就来,1.5 万亿参数,重点改了监督微调和强化学习,可以先蹲一波。原文稍后读已读值得跟进有用关注 Grok
04:14techcrunch@Rebecca BellanSaferAI发布新报告,评估Z.ai的开源权重模型GLM-5.2。该模型在多项基准上接近前沿闭源模型,但缺少关键安全缓解措施。报告指出,开源模型的快速进展可能超过现有治理与防护机制。AI模型GLM-5.2Z.aiSaferAI推荐理由:SaferAI的报告说,Z.ai的开源模型GLM-5.2已经快追上顶级闭源模型,但安全防护没跟上,搞开源的朋友得看看。原文稍后读已读值得跟进有用关注 GLM-5.2
02:48官方一手marktechpost@Asif RazzaqCursor Research开源了MoK,这是支撑Composer模型的MoE训练内核。MoK将专家混合的全部通信与计算融合进单个确定性内核。在GB300 NVL72机架上,MoK比最强公开基线快2.37倍。它需要Blackwell SM100或SM103 GPU,没有NVL72算力的用户无法使用。AI模型MoKCursorMoE3 个信源在谈事件专题推荐理由:Cursor把训练内核MoK开源了,在GB300 NVL72上比最强公开基线快2.37倍,但得先有NVL72机器才能跑。原文稍后读已读值得跟进有用关注 MoK
22:35官方一手Hugging Face: Blog(博客/媒体)Liquid AI 推出 LFM2.5-2.6B,一个 26 亿参数的语言模型。该模型面向本地智能体部署,减少对云端依赖。模型权重托管在 Hugging Face,开发者可直接下载。其体积适合在边缘设备上运行。AI模型LFM2.5-2.6BLiquid AI智能体1 个信源在谈事件专题推荐理由:想在自己电脑上跑智能体?Liquid AI 的 LFM2.5-2.6B 只有 2.6B 参数,不用联网,下载就能用。原文稍后读已读值得跟进有用关注 LFM2.5-2.6B
19:50IT之家(博客/媒体)DeepSeek于7月31日发布V4-Flash正式版API,跑分显示其单任务成本比GPT-5.6 Luna低约60%。OpenRouter周度统计中,V4-Flash以7.22万亿Token调用量位居全球第一。荣耀CMO关海涛称这是“法拉利的性能,电动小摩托的价格”。该模型引发的“行业生死线”讨论,已倒逼OpenAI等巨头大幅降价并提升入门级模型能力,Kimi K3等国产模型同样加剧了竞争。AI模型DeepSeek-V4-FlashGPT-5.6 LunaOpenRouter10 个信源在谈事件专题推荐理由:DeepSeek-V4-Flash比GPT-5.6 Luna便宜六成,一周调用7.22万亿Token登顶,逼得硅谷连夜降价,你要不要看看?原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash