07:44IT之家(博客/媒体)智谱于8月14日正式发布开源模型GLM-5.3,官方称其为编程能力最强的开源模型。与GLM-5.2相比,基座模型保持不变,但通过后训练Scaling显著提升了智能上界,编程能力提升50%。新模型支持数十倍长程任务环境,并采用更丰富多样的环境类型与超长后训练时间。AI模型智谱GLM-5.3开源模型10 个信源在谈事件专题推荐理由:智谱的GLM-5.3开源模型编程能力比GLM-5.2强一半,写代码的可以试试,据说是目前最强开源编程模型。原文稍后读已读值得跟进有用关注 智谱
00:25官方账号阿里通义 Qwen@Alibaba_Qwen精选阿里云发布 Qwen3.8-Max,即 2.4T-A95B 架构。即日起可通过 DigitalOcean Serverless Inference 调用,运行在 NVIDIA HGX B300 GPU 上。模型支持 1M token 上下文,专为长时程编码任务设计。用户按 API 用量付费,无需自建基础设施。AI模型Qwen3.8-MaxDigitalOcean阿里云3 个信源在谈事件专题推荐理由:阿里云把Qwen3.8-Max放上DigitalOcean了,1M上下文,写长代码直接调,按量付费不用管服务器。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
17:36IT之家(博客/媒体)精选微软今日推出升级版编程模型 MAI-Code-1.1-Flash,面向 GitHub Copilot 工作负载优化。在 Terminal-Bench 2.1 测试中,该模型表现提升 22%,.NET 相关任务提升 15%。Token 生成速度提升 25%,完成相同任务所需 Token 减少 25%。价格降至初代 MAI-Code-1-Flash 的四分之一,每百万输入 Token 收费 0.20 美元。新模型还新增原生视觉能力,可理解图像内容,现已陆续登陆 VS Code、Visual Studio 等平台。AI模型MAI-Code微软GitHub Copilot推荐理由:微软把编程模型升级了,MAI-Code-1.1-Flash 跑分涨了 22%,价格砍到四分之一,还加了看图能力,用 Copilot 的可以试试。原文稍后读已读值得跟进有用关注 MAI-Code
11:50Amjad Masad@amasad75°Replit CEO Amjad Masad 在采访中透露,2021至2022年间他游说谷歌、Meta等公司合作开发编码专用模型,但无人重视。谷歌曾接近与Replit达成协议,最终因担心冲击搜索业务而终止。Replit不得不自行训练模型,推出了Replit-code-3b。如今Replit估值已达90亿美元,AI编程也已成为行业焦点。行业ReplitGoogleAmjad Masad推荐理由:看看Replit老板怎么爆料谷歌:当年没人看好AI写代码,谷歌还怕冲击搜索砍了合作,结果Replit自己干到90亿美元估值。原文稍后读已读值得跟进有用关注 Replit
21:20AI Will@FinanceYF5Alexandr Wang表示Muse Spark 1.1是一款具备行业竞争力的Agentic和编程模型。该模型在多个Agentic评测中与GPT-5.5和Opus 4.8相抗衡。目前可通过Meta Model API和Meta AI直接使用。AI模型Muse Spark 1.1GPT-5.5Opus 4.83 个信源在谈事件专题推荐理由:Muse Spark 1.1在Agentic任务上声称能追上GPT-5.5,还能直接用Meta API调用,挺有吸引力。原文稍后读已读值得跟进有用关注 Muse Spark 1.1
08:02官方一手marktechpost@Michal SutterSpaceXAI推出Grok 4.5,该模型使用Cursor进行训练,专为编程、智能体任务和知识工作设计。推理速度达80 TPS,成本为每百万输入token $2、输出token $6。在Harvey法律智能体基准测试中排名第一。AI模型Grok 4.5SpaceXAICursor10 个信源在谈事件专题推荐理由:Grok 4.5用Cursor训练,编程和智能体任务表现强,法律基准第一,性价比不错。原文稍后读已读值得跟进有用关注 Grok 4.5
21:33kimi_moonshot@kimi_moonshot月之暗面发布并开源了最新编程模型 Kimi-K2.7-Code,相比 K2.6 在 Kimi Code Bench v2 上提升 21.8%,在 Program Bench 上提升 11.0%,在 MLS Bench Lite 上提升 31.5%。该模型减少了过度思考,推理 token 使用量降低 30%,同时改进了长时编程任务中的指令遵循和成功率。模型已通过 Kimi API 和 Kimi Code 可用,即将推出 6 倍高速模式。AI模型编程模型开源/仓库推理效率推荐理由:Kimi-K2.7-Code 在编程和智能体任务上显著超越前代,且推理更高效,做 AI 编程或智能体开发的团队可以直接通过 API 或 Kimi Code 试用,值得关注。原文稍后读已读值得跟进有用关注 编程模型
18:45IT之家(博客/媒体)月之暗面今日发布并开源 Kimi K2.7 Code 编程模型,相比 K2.6 在长上下文编程、指令遵循和长程任务性能上显著提升,平均 token 消耗减少 30%。内外部基准测试显示,代码能力提升 11%-31.5%,Agent 自主化执行能力提升约 10%。模型已通过 Kimi API 开放平台提供,价格与 K2.6 一致,并预告 6 月 15 日推出 5-6 倍输出速度的高速版,仅需 2 倍价格。非编程任务仍推荐使用 K2.6 模型。AI模型月之暗面Kimi K2.7 Code编程模型5 个信源在谈事件专题推荐理由:Kimi K2.7 Code 在编程场景下 token 消耗降低 30%,做 AI 编程的开发者可以立刻通过 API 体验,高速版下周上线值得关注。原文稍后读已读值得跟进有用关注 月之暗面
10:58shao__meng@shao__meng精选76°Cohere 发布了其首个开源编程模型 North Mini Code,采用 MoE 架构(30B 参数,3B 激活),拥有 128 个专家,每 token 激活 8 个。模型支持 256K 输入和 64K 输出上下文,最低可在 1× H100(FP8)上运行。训练采用三阶段后训练方法,包括级联 SFT、可验证奖励强化学习(RLVR)和跨 Harness 泛化,使其在 Agent 编程任务上表现突出。在 SWE-Bench Verified 上 pass@10 达 80.2%,Terminal-Bench v2 pass@10 达 55.1%,并在同量级开源模型中领先。模型原生支持交错思考与工具调用,适合子 Agent 编排、代码审查、终端操作等场景。AI模型开源模型编程模型Agent编程6 个信源在谈事件专题推荐理由:Cohere 用 30B 参数实现了超越 120B 模型的 Agent 编程能力,做自动化代码修复和多步软件工程的开发者可以直接用起来,效率提升明显。原文稍后读已读值得跟进有用关注 开源模型
09:59elvis@omarsar0Claude Opus 4.8 在 DeepSWE Bench 上取得 58% Pass@1 的成绩,排名第二,仅次于 GPT-5.5。该模型在原始分数上略逊一筹,但在多个最新基准测试中展现出最高的可靠性和效率。这一结果延续了近期趋势:模型在追求极致性能的同时,更注重实际应用中的稳定性和资源效率。对于关注 AI 编程和模型选型的开发者来说,这是一个值得关注的信号。AI模型Claude Opus 4.8GPT-5.5DeepSWE Bench10 个信源在谈事件专题推荐理由:Claude Opus 4.8 在 DeepSWE Bench 上以 58% Pass@1 证明了自己是效率与可靠性的标杆,做 AI 编程选型的团队可以把它作为性价比参考。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
12:01官方账号arXiv cs.LG@Richard J. Young, Gregory D. Moody精选72°该论文指出,通用语言模型回答有害问题返回文本,而编程模型若遵从恶意请求可能返回可运行的武器(如键盘记录器、勒索软件)。因此,编程模型应比通用模型有更高的拒绝标准,但现有基准测试碎片化,无法有效衡量。作者整合了8个语料库(共6675条提示),通过5位评审共识协议分类,区分了可执行恶意代码请求(CODE)和有害安全知识请求(KNOWLEDGE)。最终发布了4748条CODE提示和1923条KNOWLEDGE提示,为评估编程模型对恶意代码的拒绝能力提供了可靠工具。论文安全/对齐编程模型基准测试推荐理由:编程模型的安全风险比通用模型高一个量级——返回的代码可以直接运行成武器。做AI安全评估的团队终于有了经过共识验证的测试集,建议用这个库来检验自家模型的拒绝边界。原文稍后读已读值得跟进有用关注 安全/对齐
15:02官方账号阿里云 Alibaba Cloud@alibaba_cloud83°阿里云宣布其 Qwen3.7-Max 模型在 Code Arena 评测中以 1541 分位列全球第二,仅次于 Claude。该模型专为生产环境设计,支持连续运行 35 小时任务、执行 1000 次以上工具调用,能将原本两周的项目缩短至数小时完成。这标志着国产大模型在编程领域取得重要突破,为开发者提供了高性能的替代选择。AI模型Qwen3.7-Max编程模型Code Arena推荐理由:Qwen3.7-Max 在编程能力上逼近 Claude,做自动化脚本或复杂项目开发的团队可以试试,能显著缩短交付周期。原文稍后读已读值得跟进有用关注 Qwen3.7-Max