15:18IT之家(博客/媒体)Sakana AI发布Fugu Cyber模型,专为现代网络防御设计。该模型在CyberGym基准测试中成功率达86.9%,在CTI-REALM测试中成功率达72.1%。其表现优于OpenAI GPT-5.5-Cyber和Anthropic Claude Mythos-Preview。Fugu Cyber是一个多智能体系统,通过单一API动态编排专业智能体处理复杂任务。Sakana AI还提供人工智能驱动的网络安全解决方案实地部署服务。AI模型Sakana AIFugu CyberGPT-5.5-Cyber10 个信源在谈事件专题推荐理由:Sakana AI新出的Fugu Cyber在安全基准上比GPT-5.5-Cyber还强,86.9%的CyberGym成功率很硬核,搞网络安全的可以关注。原文稍后读已读值得跟进有用关注 Sakana AI
15:05IT之家(博客/媒体)79°谷歌 DeepMind 发布 GenCeption,基于阿里巴巴开源视频模型 Wan2.1 训练。该模型将预训练视频生成器逆向改造,可同时完成深度估计、图像分割、3D 姿态估计等任务。与传统扩散模型需多步去噪不同,GenCeption 一次前向传播完成预测,小模型处理81帧视频约需6秒,14B大模型约需10秒。训练仅用7500段合成视频,但可泛化到真实多人视频及动物、类人机器人。输出细节可保留猫胡须和单根发丝边缘,部分结果甚至优于训练数据渲染质量。AI模型GenCeptionWan2.1DeepMind推荐理由:谷歌 DeepMind 用阿里 Wan2.1 搞了个逆天改造,一个模型能同时搞深度估计、分割、姿态估计,速度还快,搞 CV 和生成模型的值得一看。原文稍后读已读值得跟进有用关注 GenCeption
15:00IT之家(博客/媒体)精选阿里发布Qwen-Image-3.0图像生成基础模型,支持最大4.5k token输入,可一次性生成复杂九宫格知识图解。该模型能精准渲染10px小字、毛孔发丝等细节,并支持12国语言和20多款字体原生渲染。在学术论文PDF测试中,模型完整渲染了包含多行复杂公式的代数几何论文。Qwen-Image-3.0还具备古画修复能力,能以原画风格补全缺失部分。目前阿里云百炼、千问AI平台已开通API邀测。AI模型Qwen-Image-3.0阿里图像生成推荐理由:阿里新出的Qwen-Image-3.0能一次生成4.5k token的复杂版面,连数学公式、多国语言小字都渲染得很清楚,做海报、UI排版效率很高。原文稍后读已读值得跟进有用关注 Qwen-Image-3.0
12:27IT之家(博客/媒体)精选小鹏集团发布TuringViT视觉编码器,推出18L和24L两个版本,分别包含15层TLA和20层TLA。在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍。该模型仅用0.85B图文对训练,在ImageNet-1K等六项零样本分类基准上取得83.6%平均准确率,超越使用10B数据的SigLIP2-L。TuringViT采用VISTA-Curation数据治理流水线,通过三步筛选优化图文数据质量,并支持四阶段渐进式原生动态分辨率训练。该编码器将应用于小鹏智能驾驶、智能座舱和IRON人形机器人。AI模型TuringViT小鹏视觉编码器推荐理由:小鹏自己搞了个TuringViT视觉编码器,只用了别人十分之一的数据就达到更好效果,还能跑车载和机器人,效率很高。原文稍后读已读值得跟进有用关注 TuringViT
11:45IT之家(博客/媒体)72°腾讯混元推出 Hyra-1.0,一个专为性能导向研究与工程任务打造的智能体,具备递归自我改进能力。它能在真实 AI 研发流水线、自然科学及工业场景中学习进化。在 2D 图像转 3D 模型任务中,Hyra 通过多轮探索修改代码和参数,使用 VLM judge 评估轮廓、比例等维度,生成结果比 Claude Code goal 模式更接近参考图像且更符合审美。AI模型腾讯混元Hyra智能体推荐理由:腾讯混元搞了个新智能体 Hyra,能自己改自己,做 3D 模型比 Claude Code 效果还好,值得看看原文稍后读已读值得跟进有用关注 腾讯混元
10:11官方一手Pandaily@contact@pandaily.com (Pandaily)在 WAIC 上,Keep 推出 Keepace.ai 垂直体育 AI 模型。该模型基于 140 亿条真实运动记录和 700 多个指标特征图构建。与通用模型不同,它优先定义安全边界,明确哪些训练内容应被避免,以降低用户受伤风险。Keepace.ai 强调在特定领域内精准而非泛化能力。AI模型KeepKeepace.aiWAIC推荐理由:Keep 出了个专做体育的 AI 模型,用了 140 亿条运动数据,特别强调安全,不会瞎推荐危险动作,挺靠谱的。原文稍后读已读值得跟进有用关注 Keep
22:21IT之家(博客/媒体)月之暗面发布的开源模型Kimi K3在全球榜单登顶。马斯克表示其2万亿参数模型在各方面优于当前1.5万亿参数版本(Grok 4.5),预计下周完成初步训练且可能超越Kimi,推理速度和Token效率接近Grok 4.5。月之暗面公开喊话欢迎加入2万亿+俱乐部。xAI尚未公布Grok 4.6的发布时间和技术细节。AI模型Kimi K3月之暗面马斯克10 个信源在谈事件专题推荐理由:月之暗面和马斯克杠上了,Kimi K3刚登顶,马斯克就说2万亿模型要超它,还喊话进了俱乐部,看这俩谁先兑现。原文稍后读已读值得跟进有用关注 Kimi K3
18:44量子位@量子位的朋友们国家具身智能应用中试基地与魔芯科技联合发布首个合作世界模型MoWorld 3D。该模型专注于3D场景生成与具身智能交互,支持从文本或图像直接生成三维环境。MoWorld 3D在空间理解与物理模拟方面表现突出,可为机器人训练提供低成本仿真数据。这一发布标志着国内具身智能领域在3D世界模型上取得关键进展。AI模型魔芯科技MoWorld 3D世界模型推荐理由:国家基地联手魔芯搞了个MoWorld 3D,能直接文本生成3D场景,给机器人训练省大钱了。搞具身智能的别错过。原文稍后读已读值得跟进有用关注 魔芯科技
18:42IT之家(博客/媒体)Arena平台2026-29期大模型排行榜显示,国产模型Kimi K3以1486分ELO首次进入综合榜第9位,与gemini-3-pro、gpt-5.6-sol-xhigh并列。在前端开发榜中,Kimi K3超越所有海外模型登顶榜首,ELO分数领先。综合榜第一由claude-fable-5以1507分占据,Anthropic多款思考模型包揽前5。代码榜中claude-opus-4-7-thinking以1553分升至第一,Kimi K3以1529分首次进入代码榜Top10。AI模型Kimi K3ArenaClaude10 个信源在谈事件专题推荐理由:月之暗面的Kimi K3这次真争气,综合榜前十、前端开发榜第一,国产模型越来越能打了。原文稍后读已读值得跟进有用关注 Kimi K3
18:34量子位@梦晨阿里发布Qwen-Audio-3.0-TTS,在Global TTS Benchmark中位列第一。该模型支持20种中文方言合成,覆盖吴语、粤语、闽语等方言区。通过细粒度标签控制情感、语调、语速,实现高表现力语音生成。在MOS评分和自然度测试中超越GPT-4o等主流模型。AI模型Qwen-Audio-3.0-TTS阿里语音合成推荐理由:阿里出了个超强语音模型,能说20种方言,情感语调都能调,榜单第一,快去试试合成效果。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
16:57IT之家(博客/媒体)阿里千问发布语音合成大模型Qwen-Audio-3.0-TTS,包含Flash(首包延时300ms级别)和Plus两个版本。在Artificial Analysis全球榜单中,Qwen-Audio-3.0-TTS-Plus位列第一。模型支持在文本嵌入[gasp]、[giggles]等结构化标签精细控制语气情绪。覆盖中、英、日、韩、德等16种语言及20种方言,音频输出提升至48KHz,单次合成可达3分钟。AI模型Qwen-Audio-3.0-TTS阿里千问语音合成推荐理由:阿里千问新语音模型能通过标签控制语气情绪,支持16种语言和20种方言,48KHz音质,试试让语音笑或生气。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
16:08官方一手Pandaily@contact@pandaily.com (Pandaily)76°ByteDance Seed 团队发布 Seed Audio 1.0 音频生成模型,支持语音、音效和环境声的统一编排。该模型提供逐帧精度的时间轴控制,可精细调整每个音频元素的起止和混合。支持超过 20 种语言,面向电影级声音创作场景。AI模型Seed Audio 1.0ByteDance音频生成1 个信源在谈事件专题推荐理由:字节跳动新出的 Seed Audio 1.0,能对音频做精确到帧的控制,做电影级音效、语音、环境声都行,还支持20多种语言。原文稍后读已读值得跟进有用关注 Seed Audio 1.0
16:07官方一手Pandaily@contact@pandaily.com (Pandaily)Moonshot AI 的 Kimi K3 在 48 小时内利用开源 EDA 工具和 45nm 工艺库,自动完成了从架构到布局的完整芯片设计流程。该实验展示了 AI 在芯片设计领域的端到端能力,直接挑战了 Synopsys、Cadence 等传统 EDA 厂商的市场地位。Kimi K3 的自主化流程可能大幅降低芯片开发成本与周期,推动半导体设计民主化。AI模型Kimi K3Moonshot AIEDA10 个信源在谈事件专题推荐理由:Kimi K3 48小时走完芯片设计全流程,用开源EDA挑战行业巨头,这事儿值得关注。原文稍后读已读值得跟进有用关注 Kimi K3
16:06官方一手Pandaily@contact@pandaily.com (Pandaily)Moonshot AI旗下Kimi K3模型在AlphaEngine的专有IRB投资研究基准测试中,以更高得分击败GPT-5.5和OPUS-4.8。测试涵盖时间判断、证据边界控制和前提修正三个维度。Kimi K3已部署在AlphaEngine平台上。AI模型Kimi K3Moonshot AIAlphaEngine10 个信源在谈事件专题推荐理由:Kimi K3在投资研究上直接干翻了GPT-5.5和OPUS-4.8,时间判断和证据边界控制尤其强,已经在AlphaEngine上用了,搞金融研究的可以试试。原文稍后读已读值得跟进有用关注 Kimi K3
15:25IT之家(博客/媒体)宇树科技发布UnifoLM-OminiA-0.3模型,单模型可统筹家居康养多任务。它支持全模态交互理解,能执行物品搬运(如将抱枕放到沙发上)、视觉识别(如识别药盒颜色和数量)和设备控制(如调节病床高度)。该模型应用于人形机器人G1,实现了从感知到行动的闭环。AI模型宇树UnifoLM-OminiA-0.3G1推荐理由:宇树发了新模型UnifoLM-OminiA-0.3,能统筹家居康养任务,全模态理解,还能控制设备,比以往机器人模型更实用。原文稍后读已读值得跟进有用关注 宇树
15:03IT之家(博客/媒体)精选上海科学智能研究院发布科学多模态基础模型“神珍”(Monkey King Bang, MKB),参数约110亿,覆盖DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据。在20项生物序列任务中,9项取得最优结果,17项位列前二;小分子理解任务SMolInstruct中4项最优。气象预报可滚动生成最长10天的全球气象场,多项指标达到业务级数值预报水平。医学影像分割在9种模态中平均Dice得分为91.20,7种参评方法中最优。AI模型神珍Monkey King Bang上智院推荐理由:上智院开源了110亿参数的科学模型“神珍”,能处理生物序列、小分子、气象和医学影像,在多项基准上领先其他模型。原文稍后读已读值得跟进有用关注 神珍
14:45IT之家(博客/媒体)72°字节跳动 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声。支持精细时间控制,一条 prompt 即可按时间线编排对白、音效和环境声。支持 20+ 语种生成,大部分语言 MOS 超 4 分,可用率在多数场景达 90% 以上。已在火山方舟体验中心上线。AI模型Seed Audio 1.0字节跳动火山方舟1 个信源在谈事件专题推荐理由:字节新出的 Seed Audio 1.0 能精细控制声音时间线,还能跨 20 多种语言保持音色一致,音频可用率超 90%,做视频创作很实用。原文稍后读已读值得跟进有用关注 Seed Audio 1.0
13:36IT之家(博客/媒体)月之暗面于7月16日发布Kimi K3模型,拥有2.8万亿参数,在Frontend Code Arena以1679分超越Claude Fable 5位居第一,并即将开放权重。OpenAI新任战略未来主管Dean W. Ball批评该开源行为是减速主义,会阻碍AI资本支出,虽承认Kimi K3非常优秀。Dean W. Ball还渲染开源危险论,建议美国政府制造监管恐慌来打压对手,例如发布“中国模型可能存在后门”的软性法规。Dean W. Ball本月刚加入OpenAI,此前担任白宫科技政策办公室高级顾问。AI模型Kimi K3月之暗面OpenAI10 个信源在谈事件专题推荐理由:月之暗面Kimi K3刚登顶编程榜单,OpenAI新主管就跳出来批开源是“减速主义”,还教美国政府怎么使绊子,这瓜值得吃。原文稍后读已读值得跟进有用关注 Kimi K3
12:20量子位@梦瑶Kimi K3上线仅48小时,用户访问量激增导致GPU算力资源严重不足。月之暗面紧急宣布暂停会员新购,以保障服务器稳定运行。该模型在中文长文本理解等任务上表现突出,吸引大量用户涌入。AI模型Kimi K3月之暗面GPU资源10 个信源在谈事件专题推荐理由:Kimi K3刚上线48小时就火到GPU扛不住,会员都卖停了,赶紧围观是什么模型这么猛。原文稍后读已读值得跟进有用关注 Kimi K3
12:19量子位@十三面壁智能推出MiniCPM-Robot系列VLA(视觉-语言-动作)模型。该模型仅有1.5B参数,权重完全开源。它在多项具身智能基准测试中性能达到第一梯队水平。模型可直接用于机器人任务中的感知、规划与控制。这降低了具身智能研究的入门门槛。AI模型MiniCPM-Robot面壁智能VLA推荐理由:面壁开源了个超实用的1.5B VLA模型,能直接跑机器人任务,比同尺寸模型强不少。原文稍后读已读值得跟进有用关注 MiniCPM-Robot
10:23IT之家(博客/媒体)腾讯混元大模型Hy3限时免费活动延长至8月5日,面向WorkBuddy和CodeBuddy用户。Hy3于7月6日开源,采用MoE架构,总参数295B,激活参数21B,支持256K上下文。模型在推理、智能体、长上下文任务上显著进步,性能比肩参数规模2-5倍的更大模型。AI模型腾讯混元Hy3MoE推荐理由:腾讯又给了两周免费试用Hy3,到8月5日。这个295B参数的MoE开源模型激活仅21B,但性能能打,适合推理和智能体场景。原文稍后读已读值得跟进有用关注 腾讯混元
10:21官方一手pandaily@contact@pandaily.com (Pandaily)虎牙于WAIC 2026发布VAM 1.0,这是一款实时多模态数字人模型,可通过单张照片生成交互式虚拟人,帧率达36.4fps。VAM 1.0支持实时表情与动作驱动,延迟低于100ms。该模型基于扩散架构,参数规模为2.3B。虎牙声称VAM 1.0在实时数字人生成质量上超越同类方案,且计算成本降低50%。AI模型HuyaVAM 1.0WAIC 2026推荐理由:虎牙搞了个新VAM 1.0,给一张照片就能实时生成能互动的数字人,36.4帧每秒,速度挺快。原文稍后读已读值得跟进有用关注 Huya
10:06官方一手marktechpost@Michal Sutter精选社区开发者用 Claude Fable 5 的推理链数据微调了 OpenBMB 的 MiniCPM5-1B,得到一个仅 657MB 的最小化本地推理模型。该模型支持 128K 上下文,推理过程可见。微调后的能力继承自原始模型,但授权条款在模型卡中未完全明确。AI模型MiniCPM5-1BOpenBMBClaude Fable 510 个信源在谈事件专题推荐理由:有人把 Claude Fable 5 的思维链塞进了 MiniCPM5-1B,搞出个 657MB 的本地推理模型,128K 上下文还能看它怎么想的,部署门槛极低。原文稍后读已读值得跟进有用关注 MiniCPM5-1B
10:02官方一手pandaily@contact@pandaily.com (Pandaily)76°阿里巴巴发布 Qwen3.8-Max,参数量达 2.4 万亿,采用开源许可。官方称其性能仅次于 Fable 5。该模型是近一个月内四个中国实验室发布的万亿参数开源模型之一。AI模型Qwen3.8阿里巴巴开源模型8 个信源在谈事件专题推荐理由:阿里把 2.4 万亿参数的 Qwen3.8-Max 开源了,说只比 Fable 5 弱一点。国产开源模型卷到万亿级别了。原文稍后读已读值得跟进有用关注 Qwen3.8
09:59官方一手pandaily@contact@pandaily.com (Pandaily)摩尔线程在WAIC 2026上展示了三个AI工厂框架:模型训练工厂、Token生成工厂和智能体生产工厂。其中,由北京大学训练的5D世界模型基于MTT S5000 GPU部署。该模型在斯坦福WorldScore基准上取得了全球第一的成绩。这个框架试图将GPU算力从单一代工扩展到端到端AI生产流水线。AI模型Moore ThreadsMTT S50005D世界模型1 个信源在谈事件专题推荐理由:摩尔线程用自家MTT S5000 GPU训出的世界模型拿了斯坦福评测第一,三个AI工厂的划分也挺新鲜,值得关注国产GPU的进展。原文稍后读已读值得跟进有用关注 Moore Threads
07:22SuperTechFans(博客/媒体)73°Qwen3.8是阿里巴巴即将开源的新模型,拥有2.4万亿参数,预览版Qwen3.8-Max-Preview已在阿里云平台上线。该模型实力仅次于Fable 5,直接对标Moonshot AI的2.8T参数开源模型Kimi K3。阿里巴巴通过开源策略可能意在削弱美国AI实验室并获取客户支持。AI模型Qwen3.8阿里巴巴开源模型10 个信源在谈事件专题推荐理由:阿里巴巴要开源一个2.4万亿参数的Qwen3.8,预览版已经能用了,据说只比Fable 5差一点,和Kimi K3直接对标,想试试大模型的可以关注。原文稍后读已读值得跟进有用关注 Qwen3.8
06:27官方一手marktechpost@Asif RazzaqFeyn AI推出SQRL文本转SQL模型系列,旗舰版SQRL-35B-A3B(35B参数,3B激活)在BIRD Dev基准上达70.6%执行准确率,超过Claude Opus 4.6个百分点。该系列还提供4B和9B蒸馏版本,支持自托管部署。其核心创新是在生成SQL查询前先用只读探针检查数据库结构与样本数据。AI模型SQRLFeyn AI文本转SQL1 个信源在谈事件专题推荐理由:写SQL查数据别直接问,先让SQRL看看数据库结构再写,准确率比Claude高。小模型还能自己部署。原文稍后读已读值得跟进有用关注 SQRL
05:45官方一手marktechpost@Asif Razzaq阿里Qwen团队预览了Qwen3.8-Max-Preview,该模型拥有2.4万亿参数,采用MoE架构,自称性能仅次于Fable 5。预览版已在Token Plan、Qoder和QoderWork上以标准定价的10%提供服务。官方未公布任何基准测试表格、模型卡或许可证,也未说明激活参数数量。读者需区分阿里的确认信息与声称内容。AI模型Qwen3.8-MaxAlibabaKimi K310 个信源在谈事件专题推荐理由:阿里放了个大招,Qwen3.8-Max有2.4万亿参数,号称仅次于Fable 5,但没给具体跑分,价格只要十分之一,值得关注。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
21:42IT之家(博客/媒体)精选面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,在Artificial Analysis(AA)榜单中以17分取得全球4B以下模型最高分。该模型原生支持混合思考,提供512K超长上下文窗口,可处理整本长篇小说或数十万行代码。训练阶段执行了200B规模的Agent Midtraining和百万条轨迹的Agent SFT,具备工具调用、深度搜索等智能体能力。目前已适配AMD、英特尔、联发科、高通等全球主流芯片,覆盖华为昇腾、英伟达等9款芯片。模型即将在Hugging Face、魔搭等平台开源。AI模型MiniCPM5-2B面壁智能端侧模型推荐理由:面壁的MiniCPM5-2B在4B以下模型里AA榜单第一,还有512K上下文和智能体能力,马上要开源了,小模型也能干大事。原文稍后读已读值得跟进有用关注 MiniCPM5-2B
20:15官方账号Decoder@Matthias Bastian73°阿里巴巴推出Qwen 3.8多模态AI模型,参数规模达2.4万亿。该模型在多项基准测试中表现优异,Qwen团队称其性能仅次于Fable 5。目前预览版已开放,可直接体验。AI模型Qwen 3.8AlibabaKimi K310 个信源在谈事件专题推荐理由:阿里新出的Qwen 3.8有2.4万亿参数,多模态能力强,号称只输给Fable 5,快去试试预览版吧。原文稍后读已读值得跟进有用关注 Qwen 3.8
18:03IT之家(博客/媒体)阿里Qoder上线了Qwen3.8-Max-Preview模型,参数量2.4T。7月19日起,调用该模型Credits限时1折消耗,夜间22:00至次日8:00享0.2折起。较前代Qwen3.7-Max,该模型在全栈开发、数据分析等复杂多Agent长程任务上显著提升,官方称匹敌世界前沿模型。AI模型Qwen3.8-Max-Preview阿里Qoder通义千问推荐理由:阿里Qoder新上的Qwen3.8-Max-Preview参数有2.4T,现在限时1折夜间更是0.2折,便宜得离谱,性能还比Qwen3.7-Max强很多原文稍后读已读值得跟进有用关注 Qwen3.8-Max-Preview
17:51官方账号Decoder@Matthias Bastian精选Moonshot的Kimi K3在Code Arena: Frontend排行榜上超越Claude Fable 5和GPT-5.6 Sol,成为首个登顶该榜单的中国模型。但在FrontierMath Tier 4数学测试中,Kimi K3仅得约39%,而OpenAI和Anthropic模型得分接近90%。差距主要体现在复杂数学推理能力上。AI模型Kimi K3Fable 5GPT-5.6 Sol10 个信源在谈事件专题推荐理由:国产模型Kimi K3前端代码很强,能超过Fable 5,但数学推理还差得远。想了解具体差距多大,可以看看这篇。原文稍后读已读值得跟进有用关注 Kimi K3
17:24IT之家(博客/媒体)韩国棋手申真谞在韩经棋神战第二局中,受让两子以四目半击败围棋AI KataGo,成为首位在正式比赛中受让两子取胜的职业棋手。比赛配置四块RTX 3090显卡(96GB显存),申真谞每局5小时基本用时加一次30秒读秒,KataGo每手20秒内完成运算。首局申真谞245手认负后,第二局他开局胜率99%,盘面领先18目半,最终行至290手获胜,将三番棋比分扳为1:1。AI模型申真谞KataGo围棋AI推荐理由:人类棋手申真谞在AI让两子的劣势下,靠精准的定式和攻防击败KataGo,证明顶尖棋手仍能与顶级围棋AI一战。原文稍后读已读值得跟进有用关注 申真谞
17:15IT之家(博客/媒体)73°阿里千问推出 Qwen3.8-Max-Preview 模型,参数量达 2.4T。该预览版已首发上线千问 PC 端及 Web 端,用户可在模型列表勾选体验。相较于前代旗舰 Qwen3.7-Max,新模型在内部真实任务测评中能力显著提升,涵盖全栈开发、数据分析、Office 办公工作流等复杂场景。正式版将于近期发布,届时同步上线 PC 端和 App。AI模型Qwen3.8-Max-Preview阿里千问Qwen3.8-Max推荐理由:阿里千问刚更新了 Qwen3.8-Max-Preview,参数量 2.4T,比上一代 Qwen3.7-Max 更强,PC 和 Web 端都能直接用了,快去试试吧。原文稍后读已读值得跟进有用关注 Qwen3.8-Max-Preview
16:48IT之家(博客/媒体)73°7月17日月之暗面发布新一代大模型Kimi K3,拥有2.8万亿参数,成为首个达到该规模的开源模型。该模型原生支持视觉理解,拥有100万token上下文窗口。在Frontend Code Arena榜单上,K3超越了Claude Fable 5和GPT-5.6 Sol。总裁张予彤透露,发布次日年化收入(ARR)创下历史最大单日增幅,并强调开源模型并非只有卷价格一条路。AI模型Kimi K3月之暗面开源模型10 个信源在谈事件专题推荐理由:月之暗面开源了2.8万亿参数的Kimi K3,视觉理解强,成绩超Claude和GPT-5.6,ARR单日新高。原文稍后读已读值得跟进有用关注 Kimi K3
16:45量子位@Jay上海AI Lab提出一种方法,让Harness模型通过搜索、验证和迭代实现自我进化,无需更换模型即可在多个任务上取得104%的效果提升。该方法利用自演进机制优化模型性能,验证了无需额外训练即可显著提升推理能力。AI模型Harness上海AI Lab自进化推荐理由:上海AI Lab搞了个新招,不换模型就能把Harness性能翻倍,实用又省钱。原文稍后读已读值得跟进有用关注 Harness
16:30IT之家(博客/媒体)阿里千问今日宣布 Qwen3.8 即将发布并开源,预览版模型 Qwen3.8-Max-Preview 已上线。该模型参数规模达 2.4T,官方宣称其性能可能仅次于 Fable 5。目前预览版已在阿里 Token Plan、Qoder 及 QoderWork 平台上架。AI模型Qwen3.8阿里千问Fable 59 个信源在谈事件专题推荐理由:阿里千问刚放了个2.4T参数的 Qwen3.8 预览版,官方说只比 Fable 5 差点,想尝鲜直接去 Token Plan 体验吧。原文稍后读已读值得跟进有用关注 Qwen3.8
15:54官方账号Decoder@Jonathan KemperRadLE 2.0基准测试评估AI模型在放射学中判断何时应由人类接手诊断的能力。测试发现,许多AI模型在给出错误结论时仍表现出完全自信,而人类放射科医生的准确率仍显著更高。该基准聚焦于模型的自知力,强调AI必须学会在不确定时保持沉默,才能安全投入临床。AI模型RadLE 2.0放射学医疗AI推荐理由:RadLE 2.0测试发现AI读X光常常自信地犯错,人类医生还远领先。搞医疗AI的该看看这个教训。原文稍后读已读值得跟进有用关注 RadLE 2.0
15:25官方一手marktechpost@Asif Razzaq精选Perplexity AI 发布了开放基准 WANDR,包含500个证据密集型任务,用于评估研究智能体在搜索广度和深度上的表现。该基准测试智能体能否发现多个符合条件的实体,并为每个实体提供可验证的引用证据。当前 Perplexity Search as Code 以 soft F1 0.363 和 hard F1 0.133 的成绩领先。AI模型Perplexity AIWANDRSearch as Code推荐理由:想测你的研究智能体能不能又广又深地搜证据?Perplexity 新出 WANDR 基准,500个任务等着,看看 Search as Code 怎么跑到了0.36 F1。原文稍后读已读值得跟进有用关注 Perplexity AI
11:57IT之家(博客/媒体)79°月之暗面于7月19日发布Kimi K3大模型,拥有2.8万亿参数和100万Tokens上下文。该模型在Frontend Code Arena榜单中以1679分超越Claude Fable 5,排名第一。彭博社报道称,这一成绩打破了美国AI领先中国的固有认知。伯克利教授斯托伊卡表示,差距已从6-9个月缩小到2-3个月。市场质疑硅谷数千亿美元投资的回报,企业用户开始通过模型路由服务选用中国模型。AI模型Kimi K3月之暗面Frontend Code Arena10 个信源在谈事件专题推荐理由:Kimi K3 2.8万亿参数,编程基准击败Claude,让美国专家承认差距仅2-3个月,值得关注。原文稍后读已读值得跟进有用关注 Kimi K3