03:30Thomas Wolf@Thom_WolfKimi K3 在内部写作基准测试中以 2840 Elo 得分排名第一,超越 Claude Fable 5。相比前代 Kimi K2.6 从第21位跃升至第1位。每脚本成本约 0.25 美元,比被取代的模型便宜 5 倍。这是首个开源权重模型在此基准登顶。AI模型Kimi K3Claude Fable 5开源模型10 个信源在谈事件专题推荐理由:Kimi K3 写作能力把 Claude Fable 5 比下去了,价格还便宜五倍,写稿子可以试试。原文稍后读已读值得跟进有用关注 Kimi K3
02:33宝玉@dotey81°月之暗面在GTC 2026演讲中提出用MuonClip替代Adam(2014)、Kimi Linear替代注意力机制(2017)和Attention Residue替代残差连接(2015),全部开源。MuonClip在万亿参数模型上训练超15万亿Token且无loss spike,数据利用效率接近翻倍。Kimi Linear采用KDA线性注意力,按3:1比例混合全注意力,在短、长输入和输出任务上全面超越标准全注意力。Agent Swarm在K2.5上支持100个Agent并行(K2.6升级至300个),通过实例化、完成和最终结果三种奖励训练并行协作。早期融合多模态训练混合15万亿Token,使视觉训练显著增强了文本能力。AI模型Kimi K2.5MuonClipKimi Linear推荐理由:杨植麟把用了十年的优化器、注意力、残差连接全换了:MuonClip数据效率翻倍,Kimi Linear百万Token不掉分,Agent Swarm能并行100个智能体,开源模型离闭源又近了一步。原文稍后读已读值得跟进有用关注 Kimi K2.5
02:16AK@_akhaliqVideoChat3 是一款完全开源的视频多模态大型语言模型,专注于高效通用视频理解。该模型在视频问答、时序定位等任务上展现能力。开发者可通过 GitHub 获取权重与代码。AI模型VideoChat3视频理解多模态推荐理由:VideoChat3 完全开源,适合研究视频理解,你可以自己部署试试效果。原文稍后读已读值得跟进有用关注 VideoChat3
02:13Justine Moore@venturetwinsDecartAI推出Nano Banana模型,允许用户通过视频或文本提示编辑直播流。用户上传场景截图作为参考图像,输入文本指令(如将女人改为穿背心的网红),模型能保留原光照效果。该功能基于参考图像进行编辑,无需从头生成。演示中展示了从截图到修改后画面的流程。AI模型DecartAINano Banana视频编辑推荐理由:DecartAI发了Nano Banana,能让你用视频或一句话改直播画面,上传截图就能保留原光照,挺好玩的。原文稍后读已读值得跟进有用关注 DecartAI
00:40官方账号Jim Fan@jimfan83°Jim Fan团队推出RoboTTT,将机器人模型上下文长度从不到0.1秒扩展到5分钟(8000步),且推理成本恒定。与现有方法相比,性能提升3个数量级。RoboTTT基于Test-Time Training(TTT),在模型内部携带一个小型核心,每帧触发梯度更新,将历史压缩到权重中。8K上下文预训练比1K性能高出62%,且无饱和迹象。该方法支持从人类视频进行一次性上下文学习,并能在部署后持续自我改进,机器人可实时从错误中恢复。AI模型RoboTTTJim Fan机器人模型2 个信源在谈事件专题推荐理由:Jim Fan团队用RoboTTT让机器人记住5分钟的动作,上下文拉到8000步,性能飙升62%,还能从视频里学新活。原文稍后读已读值得跟进有用关注 RoboTTT
00:16Jerry Liu@jerryjliu0精选Kimi-K3在Frontend Code Arena中以1679分排名第一,从第18位跃升至第1位,超越Claude Fable 5。它在7个测试域中6个排名第一,仅在Gaming域落后。全量模型权重将于7月27日开源。这一成绩展示了中国开源模型在任务特定基准上的竞争力。AI模型Kimi-K3Claude Fable 5Frontend Code Arena10 个信源在谈事件专题推荐理由:Kimi-K3刚拿了前端代码领域第一,全面超越Claude Fable 5,权重下月底就开源,搞AI的值得关注。原文稍后读已读值得跟进有用关注 Kimi-K3
00:09lmarena.ai@lmarena_ai精选73°Arena 新增“事实性”排名信号,基于人类偏好与事实性的加权组合重新排列模型。该团队标注了超过 200 万条来自真实对话的 LLM 声明(Text Arena 130 万+,Search Arena 70 万+),通过验证声明正确性比较模型。开启事实性后,Claude Fable 5 下降至第 2,GPT-5.5 上升 13 位至第 7,Muse Spark 下降 13 位至第 20。Meta 整体从第 2 跌至第 5,Anthropic 仍居第 1;开源模型中,Xiaomi 从第 9 跃至第 6。AI模型ArenafactualityClaude Fable 510 个信源在谈事件专题推荐理由:Arena 现在能看模型在事实准确性上的表现,Claude 和 GPT-5.5 排名变化挺有意思,想挑更靠谱的模型可以看看。原文稍后读已读值得跟进有用关注 Arena
23:54Ethan Mollick@emollick英国政府AI安全机构(UK AI Security Agency)将使用其内部基准测试评估Kimi K3。该基准专注于AI安全能力。Kimi K3的权重将在几周内发布。测试结果将揭示Kimi是否赶上公开前沿模型,并引发大量网络安全讨论。AI模型Kimi K3UK AI Security AgencyAI安全10 个信源在谈事件专题推荐理由:英国官方机构要测Kimi K3了,看看它能不能追上前沿水平,到时候会引爆很多安全讨论。原文稍后读已读值得跟进有用关注 Kimi K3
23:53Ethan Mollick@emollick埃森哲教授Ethan Mollick指出,中国开源权重模型已非常出色,其中K3的性能优于GLM-5.2,而GLM-5.2又超越了DeepSeek v4。这些模型正逐渐成为大型商业实体,彼此间的竞争日趋激烈。面对快速迭代的格局,Mollick质疑这些公司能否全部在竞赛中存活下来。AI模型K3GLM-5.2DeepSeek v4推荐理由:看看中国开源模型圈的新排名:K3压过GLM-5.2,GLM-5.2又干翻DeepSeek v4,竞争白热化了。原文稍后读已读值得跟进有用关注 K3
22:13小互@imxiaohuGemma 4支持140多种语言,开箱即用即可使用35种以上语言,包括中文。在LiveKit Agents中切换至Gemma 4 31B只需一行配置,调整模型指向即可。该模型专为多语言语音Agent场景优化,提供广泛的覆盖能力。AI模型Gemma 4LiveKit Agents多语言3 个信源在谈事件专题推荐理由:用LiveKit搭语音Agent?改一行配置就能切到Gemma 4 31B,支持140多种语言,中文也在内。原文稍后读已读值得跟进有用关注 Gemma 4
19:46Yangyi@YangyixxxxxAI发布的Grok-4.5模型被用户评价为速度快、自由度高,能在NewMax中执行逆向Codex等复杂任务。该模型定位为编码、智能体和知识工作的全能旗舰,支持500k上下文窗口,可配置推理强度。API定价为$2/$6每百万token,低于同类旗舰模型。在独立评测中,其每智能指数任务成本显著低于对手,输出token效率领先。AI模型Grok-4.5xAI编程助手推荐理由:Grok 4.5被用户吹爆,说它又快又便宜还能干复杂活,甚至能逆向Codex。如果你想要个干活利索、不磨叽的模型,可以试试它。原文稍后读已读值得跟进有用关注 Grok-4.5
19:13orange.ai@oran_ge本文作者对一款最新开源模型进行了全面评测。该模型在多个标准测试中表现优异,首次让开源模型跻身世界顶级水平。文章包含具体性能数据和使用感受,与主流闭源模型进行对比。AI模型开源模型模型评测体验推荐理由:一位AI博主发布了首个达到世界一流水准的开源模型测评,带你看清它和闭源模型的差距在哪里。原文稍后读已读值得跟进有用关注 开源模型
18:31shao__meng@shao__meng76°Cursor 团队在 AI Engineer 大会分享其自动化 AI 研究框架,包含外循环(基于真实用户反馈和 A/B 测试结果改进模型)和内循环(优化训练过程,如生成更难 RL 环境)。Composer 2.5 成为产品内最受欢迎模型,得益于更多 RL 环境和训练方法。团队构建大规模 agent 系统(主 agent + 子 agent)自动完成实验启动、监控和问题上报,研究者可从 Slack 直接操作。与 SpaceXAI 联合训练的 Grok 4.5 是 Cursor 迄今最强模型,训练使用了海量 Cursor 真实交互数据和强化学习。演讲还揭示了递归自我改进机制:更强主模型蒸馏出更好辅助模型,进一步加速下一代训练。AI模型CursorGrok 4.5SpaceXAI10 个信源在谈事件专题推荐理由:Cursor 团队分享了他们如何用 agent 系统自动化模型训练,还聊了和 SpaceXAI 联合训练 Grok 4.5 的细节,干货很多。原文稍后读已读值得跟进有用关注 Cursor
16:26AI Will@FinanceYF5Kimi-K3在Frontend Code Arena基准测试中获得1679分,超越Claude Fable 5排名第一。相比上一代Kimi-K2.6(排名第18),Kimi-K3跃升17位。在前端7个能力领域中,Kimi-K3在品牌与营销、参考图设计等6项中排名第一,仅在游戏领域位列第二。完整模型权重预计于7月27日前发布。AI模型Kimi-K3Claude Fable 5Frontend Code Arena10 个信源在谈事件专题推荐理由:Kimi新模型K3在前端代码基准上直接干到第一,比自家K2.6猛升17名,6个领域第一,很能打。原文稍后读已读值得跟进有用关注 Kimi-K3
16:25AI Will@FinanceYF5精选76°Kimi K3是一个具有2.8万亿参数和100万上下文窗口的原生多模态开放模型。其Kimi Delta Attention机制在百万Token解码速度最高提升6.3倍。Attention Residuals使训练效率提升约25%,额外成本低于2%。该模型面向长周期Agentic Coding和自我进化工作流。AI模型Kimi K3Kimi多模态10 个信源在谈事件专题推荐理由:月之暗面发了Kimi K3,2.8万亿参数还支持原生多模态,解码快6倍,写代码和长文处理很强。原文稍后读已读值得跟进有用关注 Kimi K3
15:01orange.ai@oran_geKimi K3 模型已上架 Cola 平台。用户可通过 Cola 体验 Kimi K3。当前 Kimi K3 在 Cola 上响应速度较慢。AI模型Kimi K3Cola月之暗面10 个信源在谈事件专题推荐理由:Kimi K3 刚上 Cola,想尝鲜的抓紧去,就是人太多可能会卡。原文稍后读已读值得跟进有用关注 Kimi K3
15:00orange.ai@oran_geKimi K3 模型现已上架到 Cola 平台。据发布者称,该模型的智能水平仅次于 Fable 和 GPT 5.6。由于访问量较大,当前推理速度可能较慢。该模型定位为高性能推理模型,适合对比测试。AI模型Kimi K3Cola推理模型10 个信源在谈事件专题推荐理由:Kimi 新模型 K3 上架 Cola,号称只比 Fable 和 GPT 5.6 差一点,想试顶尖水平可以去跑跑。原文稍后读已读值得跟进有用关注 Kimi K3
14:47AI Will@FinanceYF5Kimi K3 在多项任务上超越 ChatGPT 和 Claude Fable 5。用户用 Kimi K3 构建了 10 个应用案例,其中包括 Game Boy Advance 模拟器。这标志着 AI 模型竞争格局的重大转变。AI模型Kimi K3ChatGPTClaude Fable 510 个信源在谈事件专题推荐理由:Kimi K3 太强,能做 Game Boy Advance 模拟器这类应用,比 ChatGPT 和 Claude Fable 5 还厉害。看看这 10 个案例就懂了。原文稍后读已读值得跟进有用关注 Kimi K3
13:49AI Will@FinanceYF5精选71°Kimi K3 发布,参数规模达 2.8 万亿,支持 100 万 token 上下文和原生多模态。采用 Kimi Delta Attention 机制,百万 token 上下文中解码速度提升 6.3 倍。Attention Residuals 使训练效率提升约 25%,额外成本低于 2%。在 Online Exp、DECK-Bench、Finance-Bench 三项内部跑分中全面超过 Opus 4.8 和 GPT-5.5。该模型面向长周期 Agentic Coding 和自我进化工作流。AI模型Kimi K3Opus 4.8GPT-5.510 个信源在谈事件专题推荐理由:Kimi 新模型 K3 跑分赢了 Opus 4.8 和 GPT-5.5,2.8 万亿参数还带百万上下文,解码快到飞起,技术细节值得细看。原文稍后读已读值得跟进有用关注 Kimi K3
12:47Ethan Mollick@emollickKimi K3 是一个好模型,但人们再次过度解读 Arena 排行榜的 ELO 分数,就像之前对 Llama 4 那样。Arena 用户评分的 ELO 有局限性,前端是文本聊天,容易通过训练或系统提示让用户主观偏好表现更好,偏离真实能力评估。AI模型Kimi K3Arena评分Llama 410 个信源在谈事件专题推荐理由:别被 Arena 分数忽悠了——Kimi K3 虽好,但评分榜的坑和 Llama 4 时一样。原文稍后读已读值得跟进有用关注 Kimi K3
12:20AI Will@FinanceYF573°Kimi K3 已在 Kimi.com、Kimi Work、Kimi Code 和 Kimi API 四个平台上架。开发者可通过 platform.kimi.ai 调用 API。官方承诺模型权重在 2026 年 7 月 27 日前开放下载。技术博客 kimi.com/blog/kimi-k3 提供了详细信息。AI模型Kimi K3Kimi WorkKimi Code10 个信源在谈事件专题推荐理由:月之暗面刚公布的 Kimi K3,能在 Work、Code 和 API 里直接用,权重未来还开放,比闭源模型更灵活。原文稍后读已读值得跟进有用关注 Kimi K3
12:17AI Will@FinanceYF572°Kimi 发布了 K3 模型,结合 3D 推理、编程和视觉理解能力。它能够将文本概念、图片或视频转化为可玩的交互式 3D 体验。K3 实现了"vision in the loop"机制,模型可在代码和实时截图之间来回迭代。AI模型K3Kimi多模态推荐理由:Kimi 刚发了 K3,能把图片视频转成可交互 3D,还能边写代码边看效果,挺实用的。原文稍后读已读值得跟进有用关注 K3
12:16AI Will@FinanceYF5Kimi K3 Max在Kimi内部知识工作基准上获得三项得分:Online Exp Bench 75.5分,DECK-Bench 73.5分,Finance-Bench 62.6分。这些基准测试模拟真实用户Agent工作流中的常见任务。三项成绩均超过Claude Opus 4.8(max)和GPT-5.5(xhigh)。这表明Kimi K3 Max在Agentic知识工作上的能力和可靠性有所提升。AI模型Kimi K3 MaxClaude OpusGPT-5.52 个信源在谈事件专题推荐理由:Kimi K3 Max在三个内部知识工作基准上全面超过Claude Opus和GPT-5.5,适合关注智能体工作流的人看看。原文稍后读已读值得跟进有用关注 Kimi K3 Max
12:14AI Will@FinanceYF582°Kimi K3模型正式发布,拥有2.8万亿参数、100万Token上下文窗口,并支持原生多模态处理。其Kimi Delta Attention技术可在百万Token上下文中将解码速度提升最高6.3倍。Attention Residuals机制将训练效率提升约25%,额外成本控制在2%以内。该模型主要面向长周期Agentic Coding和自我进化工作流。AI模型Kimi K3Kimi多模态10 个信源在谈事件专题推荐理由:Kimi出了K3,2.8万亿参数还有百万级上下文,解码速度快了6倍多,做长代码任务很合适。原文稍后读已读值得跟进有用关注 Kimi K3
12:13AI Will@FinanceYF5精选Kimi 发布 K3 模型,基于两个架构更新:Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),旨在改善长序列和深层网络中的信息流动。模型采用 Stable LatentMoE 框架,在 896 个专家中激活 16 个,大幅提升稀疏性。结合训练和数据优化,K3 的扩展效率相比 K2 提升约 2.5 倍,即更高效地将算力转化为智能。AI模型K3KimiAttention Residuals推荐理由:Kimi 发了 K3,用 KDA 和 AttnRes 让长序列处理更流畅,MoE 专家数拉到 896 只激活 16 个,扩展效率翻倍,适合追新架构的朋友。原文稍后读已读值得跟进有用关注 K3
12:01小互@imxiaohu月之暗面发布 Kimi K3,参数规模达 3 万亿,成为全球首个该量级的开放模型。在多项评分中,K3 不及闭源模型 Claude Fable 5 和 GPT 5.6 Sol,但与 GPT 5.5 和 Opus 4.8 水平相当。定价方面,K3 输入 $3.00/M tokens,输出 $15.00/M tokens,较上一代 K2.6 上涨 2-3 倍。AI模型Kimi K3月之暗面开放模型10 个信源在谈事件专题推荐理由:月之暗面新出的Kimi K3是首个3万亿参数的开放模型,虽然比不上Claude Fable 5和GPT 5.6 Sol,但和GPT 5.5差不多,价格也涨了不少。原文稍后读已读值得跟进有用关注 Kimi K3
10:49orange.ai@oran_geMoonshot AI 的 Kimi K3 在内部写作基准中以 2840 Elo 排名第一,超越 Claude Fable 5。相比前代 Kimi K2.6,排名从第 21 跃升至第 1。每个脚本运行成本约 0.25 美元,比被超越的模型便宜 5 倍。这是首个开放权重模型在该基准登顶。AI模型Kimi K3Claude Fable 5Moonshot AI10 个信源在谈事件专题推荐理由:Moonshot AI 的 Kimi K3 在写作评测上干掉了 Claude Fable 5,成本还低 5 倍,开源模型也能这么强?原文稍后读已读值得跟进有用关注 Kimi K3
10:48orange.ai@oran_ge73°Kimi-K3在Frontend Code Arena中以1679分排名第一,超越Claude Fable 5。该模型从Kimi-k2.6的第18位跃升17个名次至榜首。在7个前端域中,Kimi-K3在6个领域(品牌营销、参考设计、数据分析、消费产品、模拟、内容创作工具)排名第一,仅在游戏领域落后于Fable 5位列第二。完整模型权重将于7月27日开源。AI模型Kimi-K3Kimi_MoonshotClaude Fable 510 个信源在谈事件专题推荐理由:月之暗面新模型Kimi-K3在代码排行榜上干掉了Claude Fable 5,六个子项第一,还承诺开源,看看能不能打。原文稍后读已读值得跟进有用关注 Kimi-K3
10:16官方一手歸藏(guizang.ai)@op7418Kimi K3 模型正式上线,引发广泛关注。用户反馈称其性能表现相当突出。有评论猜测该发布可能刺激 Anthropic 的 Dario 再次撰写博客强调开源模型的潜在危害。AI模型Kimi K3模型发布AI模型10 个信源在谈事件专题推荐理由:Kimi 发了新模型 K3,性能聊得很猛,想了解它为什么让 Anthropic 紧张?原文稍后读已读值得跟进有用关注 Kimi K3
10:06shao__meng@shao__mengKimi K3 是全球首个 3T(2.8T)级开源模型,支持 1M token 上下文和原生多模态,定位长时程智能体编码与知识工作。在 Frontend Code Arena 中获得 1679 分,领先第二名 Claude Fable 5 的 1631 分和第三名 GPT-5.6 Sol 的 1618 分。整体性能仅弱于 Claude Fable 5 和 GPT 5.6 Sol,在开源模型中表现最强,权重将于 7 月 27 日前开放。AI模型KimiK3开源模型推荐理由:Kimi 发了 K3 开源模型,2.8T 参数加上百万上下文,在编程评测里甚至超过了 Claude 和 GPT,做智能体特别合适。原文稍后读已读值得跟进有用关注 Kimi
09:54Amjad Masad@amasad76°Kimi-Moonshot 的蒸馏模型 Kimi-K3 在 Frontend Code Arena 中获得 1679 分,排名第一,超越此前领先的 Claude Fable 5。相比前代 Kimi-k2.6(第 18 名),Kimi-K3 跃升 17 个位次。在 7 个前端评测领域中,Kimi-K3 在 Brand & Marketing、Reference-Based Design 等 6 个领域取得第一,仅在 Gaming 领域落后于 Fable 5。完整模型权重将于 7 月 27 日前开源。AI模型Kimi-K3Claude Fable 5Kimi_Moonshot10 个信源在谈事件专题推荐理由:Kimi-Moonshot 的蒸馏模型 Kimi-K3 在前端编码基准上直接干翻了 Claude Fable 5,还开源权重,值得关注。原文稍后读已读值得跟进有用关注 Kimi-K3
09:49Gary Marcus@GaryMarcusGary Marcus转发Wenjie Ma的工作,指出神经符号AI方法schema可能使ARC-AGI-3基准变得可解。schema将经验转化为程序世界模型,并基于完整历史验证,然后搜索解决方案,无需进一步试错。该方法已在交互演示中展示效果,相关分析和演示托管在schema-harness.github.io。AI模型神经符号AIARC-AGI-3schema推荐理由:这个新方法用程序世界模型解决了ARC-AGI-3难题,不用反复试错,比纯神经网络更聪明。原文稍后读已读值得跟进有用关注 神经符号AI
09:24orange.ai@oran_ge用户发推称实测了GLM 5.2和DeepSeek两个模型。GLM 5.2和DeepSeek在对话中均能生成中文内容。该测试未提供具体任务或基准分数。结果表明这两个模型的中文处理能力符合预期。AI模型GLM 5.2DeepSeek中文能力推荐理由:有人试了GLM 5.2和DeepSeek,都说中文没问题,想确认效果可以看看。原文稍后读已读值得跟进有用关注 GLM 5.2
09:19berryxia@berryxia76°Kimi 团队发布博客,宣布 K3 模型权重即将开源,面向推理合作伙伴开放。Moonshot 选择将前沿模型权重公开,表明即使处于顶尖性能水平,开放权重也是可行路径。这一举动传递的信息是智能进步不应被少数公司垄断,领先者有底气让更多人一起使用和迭代。AI模型MoonshotK3Kimi推荐理由:Moonshot (Kimi 团队) 要把 K3 模型权重开放了,打破闭源才能领先的老规矩,你可以直接用来推理和迭代。原文稍后读已读值得跟进有用关注 Moonshot
08:09elvis@omarsar0Impossible Research 团队推出自定义 agent harness 系统 Schema,能模拟物理学家思维方式。Schema 在 ARC-AGI-3 基准上达到饱和水平,支持游戏、代码编写和复杂推理。该工具旨在解决超困难问题,已公开演示成果。AI模型SchemaARC-AGI-3Impossible Research推荐理由:他们搞了个叫 Schema 的 harness,让 AI 学物理学家那样思考,直接刷爆 ARC-AGI-3 基准,挺有意思的。原文稍后读已读值得跟进有用关注 Schema
08:05lmarena.ai@lmarena_aiKimi-K3在Frontend Code Arena中以76%的pairwise win rate排名第一,击败Claude Fable 5(63%)和GPT-5.6 Sol(58%)。该模型获得1679分,从第18位跃升至第1位。在品牌营销、参考设计、数据分析等6个领域均排名第一,仅游戏领域落后于Fable 5。Kimi-Moonshot团队将于7月27日前开源完整模型权重。AI模型Kimi-K3Claude Fable 5GPT-5.6 Sol10 个信源在谈事件专题推荐理由:Kimi-K3刚在代码前端评测中干翻Claude Fable 5,76%胜率,6个领域第一,权重还开源,绝对值得关注。原文稍后读已读值得跟进有用关注 Kimi-K3
08:04官方账号Together AI@togethercompute精选Thinking Machines Lab 联合 Together AI 发布了 Inkling 多模态 MoE 模型。该模型原生支持文本、图像、音频三种输入。它具备可控推理努力机制,允许在推理时动态调整计算量。基于 Together 的 FlashAttention-4 内核优化,显著提升 token 效率。在多个基准上展示了高效推理能力。AI模型InklingThinking Machines LabTogether AI10 个信源在谈事件专题推荐理由:Inkling 是 Thinking Machines Lab 的新多模态 MoE 模型,同时支持文本、图像、音频输入,还能控制推理计算量,效率很高。原文稍后读已读值得跟进有用关注 Inkling
07:19官方账号Greg Brockman@gdb精选GPT-5.6 Sol Pro在prinzbench上取得91/99的成绩,基本饱和该基准。该基准包含两道从未被任何模型解出的问题(各值3分),排除后模型正确回答了93题中的91题。相比GPT-5.4 Pro的79/99和GPT-5.5 Pro的82/99有明显提升。prinzbench于2026年1月发布,仅5个月后被GPT-5.6 Sol Pro饱和,加速趋势显著。AI模型GPT-5.6 Sol ProprinzbenchOpenAI10 个信源在谈事件专题推荐理由:GPT-5.6 Sol Pro把prinzbench刷到91分,比前代高出一截,连从未解出的题都快能答了,基准加速饱和太明显。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol Pro
05:54elvis@omarsar072°Kimi发布K3开源模型,拥有2.8万亿参数、100万上下文窗口和原生多模态能力。K3采用Kimi Delta Attention,在百万token上下文中实现解码速度提升6.3倍。Attention Residuals机制以不到2%的额外成本带来约25%的训练效率提升。该模型面向长程智能体编程和自演进工作流设计,开源权重计划于2026年7月27日开放。AI模型Kimi K3Moonshot AI开源模型10 个信源在谈事件专题推荐理由:Kimi新开源模型K3,参数2.8万亿,能处理百万上下文,速度还快了6倍多,做长程智能体任务很合适。原文稍后读已读值得跟进有用关注 Kimi K3
05:24官方账号Simon Willison@simonw精选Simon Willison 发布关于 Kimi K3 模型的个人笔记,指出尽管 pelican 基准测试与模型实际能力(如长对话中的智能体工具调用)脱节,但仍能从中获得洞察。pelican 基准当前得分已无法完全反映 Kimi K3 在复杂任务上的表现。Willison 强调模型在 agentic tool calling 和长上下文交互上的进步比基准分数更重要。AI模型Kimi K3pelican benchmarkSimon Willison10 个信源在谈事件专题推荐理由:Simon Willison 分享了 Kimi K3 的实测感受,还聊了 pelican 基准的局限性,想了解模型真实水平可以看看。原文稍后读已读值得跟进有用关注 Kimi K3