7月17日
04:21
04:21Paul Couvert@itsPaulAi
73°
Kimi K3由Kimi.ai发布,拥有2.8T参数和1M上下文窗口。在编程和智能体任务上表现领先,部分指标超越Fable 5和GPT-5.6 Sol。定价与Sonnet 5相同,但推理成本更低。在前端设计竞技场首次登顶。
事件专题

推荐理由:Kimi K3开源了,2.8T参数比Fable 5还便宜,编码和智能体任务很强,试试看。
04:20
04:17
04:17lmarena.ai@lmarena_ai
精选72°
Kimi K3 在 Code Arena 前端榜单以 1679 分超越 Claude Fable 5 升至第一,排名从 Kimi-k2.6 的第 18 位跃升 17 位。在 Brand & Marketing、Reference-Based Design 等 6 个领域排名第一,仅在 Gaming 领域落后 Fable 5 列第二。模型权重将于 7 月 27 日开源。
事件专题

推荐理由:Kimi 新模型在前端代码上把 Claude Fable 5 比下去了,六个子项都排第一,而且权重会开源,值得试试。
04:09
04:09Ethan Mollick@emollick
一项新基准测试要求AI一次性程序化生成不同历史时期的港口城镇文件。目前已有GPT-5.6 Pro、Fable、Kimi K3和Inkling四个模型参与。作者提供了所有模拟的可交互链接。该基准被认为能出人意料地反映模型能力。
事件专题

推荐理由:想看看不同AI在一次性生成复杂历史场景上的表现?这里有GPT-5.6 Pro、Fable、Kimi K3和Inkling的对比,还能自己玩模拟。
03:27
03:27lmarena.ai@lmarena_ai
精选78°
Kimi_Moonshot 发布的 Kimi-K3 模型在 Frontend Code Arena 中以 1679 分排名第一,超越 Claude Fable 5。相比此前第 18 名的 Kimi-k2.6 跃升 17 位。在 Brand & Marketing 等 6 个领域中均排名第一,仅 Gaming 领域位居第二。完整模型权重将于 7 月 27 日前开源。
事件专题

推荐理由:Kimi-K3 刚把 Claude Fable 5 从第一拉下来,前端代码评测全面领先,很快还会开源权重,玩编程的可以关注。
03:13
03:07
02:54
02:50
01:49
01:03
00:41
00:41官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA 发布了 Nemotron 3 Embed 8B 模型。该模型在 RTEB 基准测试中取得总体第一,RTEB 评估真实世界任务的检索准确度。更好的检索能力为智能体提供更相关的上下文,有助于提升响应准确性。
事件专题

推荐理由:NVIDIA 新出的 8B 嵌入模型,RTEB 排名第一,检索能力强,适合做 RAG 和智能体。
00:34
00:20
00:20岚叔@lufzzliz
用户付费测评了Kimi-K3和GLM-5.2两个国产模型,认为它们与海外SOTA模型的差距正在缩小。在“托举大力神杯”任务中,Kimi-K3的表现仅次于fable-5模型。测评提到Kimi-K3推理速度较慢,需要付费才能完成测试。GLM-5.2也被评价为“国产之光”。
事件专题

推荐理由:有人真金白银实测了Kimi-K3,发现和海外顶级模型差距缩小了,在特定任务上仅次于fable-5,值得看看具体表现。
00:09
00:09orange.ai@oran_ge
月之暗面发布开源模型Kimi K3,参数量达2.8T。这一规模可能超过Anthropic的Claude Opus,接近业界顶级模型Fable。模型已训练完成,表明中国开源模型与全球顶尖水平的差距可能缩短至6个月内。
事件专题

推荐理由:月之暗面刚开源了Kimi K3,2.8T参数,可能比Claude Opus还大。想看看开源模型的天花板?这个必须关注。
7月16日
23:13
22:28
21:16
21:16官方账号LMSYS Org (SGLang)@lmsysorg
86°
Inkling是thinkymachines发布的首个开源MoE模型,总参数量975B,激活参数41B。它支持最高1M上下文长度,原生处理文本、图像和音频。该模型已获得SGLang和Miles的Day 0支持,采用短卷积、相对位置嵌入注意力和共享专家sink MoE等新架构。推理优化包括DFlash投机解码和MXFP8 KV缓存,并支持全参数和LoRA RL训练。
事件专题

推荐理由:thinkymachines开源了一个超大MoE模型Inkling,总参975B但只激活41B,还支持1M上下文和图文音频理解,已经可以在SGLang上跑了,想玩大模型的朋友可以试试。
13:43
12:45
12:45官方一手歸藏(guizang.ai)@op7418
87°
Thinking Machine 推出首款模型 Inkling,采用 MoE 架构,总参数量 975B,激活参数 41B,上下文窗口达 1M。模型在 45T 数据上训练,原生支持文本、图像和音频理解。同时发布 Small 预览版,激活参数 12B,且模型开源。后训练数据从 Kimi 2.5 等开源模型蒸馏得到。
事件专题

推荐理由:Mira Murati 新公司出了开源多模态模型,近 1T 参数但只激活 41B,支持 1M 上下文,还能自己微调,值得试试。
12:39
12:39Junyang Lin@JustinLin610
Thinking Machines 推出名为 Inkling 的新模型,支持文本、图像和音频三种模态的推理。Inkling 的完整权重已开放,可在 Tinker 平台进行微调。用户还能通过 Inkling Playground 直接体验模型。该模型发布后获得了社区关注,原推文作者点赞其新架构。
事件专题

推荐理由:Thinking Machines 发了 Inkling,一个能看图文听音频的推理模型,而且权重全开放,能自己微调,还能在 Playground 试玩。
11:32
11:32Ethan Mollick@emollick
Ethan Mollick评测新开源权重模型Inkling,指出其性能远不及DeepSeek R1等中国前沿开源模型。Inkling未能通过Lem测试,而该测试自DeepSeek R1/Sonnet 3.5以来已被所有前沿模型通过。Mollick认为Inkling目前还处于粗糙阶段。
事件专题

推荐理由:想看看新开源模型Inkling到底行不行?Ethan Mollick实测发现它连Lem测试都过不了,和DeepSeek R1差距明显。
07:03
07:03Fireworks AI@FireworksAI_HQ
Doximity Ask由Doximity开发,基于Fireworks平台训练。在Stanford Arise Lab的独立评估中,它超越GPT-5.6 Sol、Claude Fable 5、OpenEvidence等24个模型。该研究涉及12,747个专家评级,针对真实临床问题。结果表明专用临床模型在安全性上更优。
事件专题

推荐理由:Doximity Ask在独立测试中把GPT-5.6和Claude Fable 5都干翻了,说明医学领域专用模型才是王道。
06:28
06:28Fireworks AI@FireworksAI_HQ
Fireworks AI 宣布提供 Thinky Machines 的首个开源权重模型 Inkling,该模型为 975B MoE 架构,支持多模态,采用 Apache 2.0 许可证。Inkling 专为微调设计,提供 day-zero 访问,可在 Fireworks AI 平台使用。
事件专题

推荐理由:Thinky Machines 开源了 975B MoE 多模态模型 Inkling,Apache 2.0 随便用,适合微调,直接在 Fireworks 上跑。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。