8月14日
01:43
01:43lmarena.ai@lmarena_ai
83°
xAI 的 Grok-4.6 (High) 在 Code Arena 的 WebDev 榜单以 1630 分升至第五名,超过 Claude Fable 5 的 1627 分和 GPT-5.6 Sol xHigh 的 1622 分。相比 Grok 4.5 的 1553 分(第13位),Grok-4.6 得分提升明显。目前这三款模型分差仅 4 至 9 分,分别排在第五至第七名。
事件专题

推荐理由:Grok-4.6 刚发布就把网页开发能力冲进第一梯队,分数压过 Claude 和 GPT 的最新版,差距只有个位数,写代码的可以关注下。
8月12日
18:28
18:28官方账号Decoder@Matthias Bastian
精选
微软发布MAI Code 1.1 Flash,用于GitHub Copilot,声称比前代节省25%的token,成本降低75%。但在基准测试中,其性能被更便宜的DeepSeek V4 Flash超越。此举符合微软一贯模式:宣传开源AI,却在应用中内置更差的专有模型以保护利润。

推荐理由:微软新代码模型被DeepSeek碾压,价格性能都输,想了解Copilot背后模型真实水平的朋友可以看看。
7月14日
15:59
15:59AI Will@FinanceYF5
中国顶尖代码模型GLM5.2和Qwen3.7 Max的混合定价约1美元/百万token,而美股同档位SOTA模型定价在4-8美元。高盛测算显示,价值型Agent模型目前EBIT利润率为-30%,代码模型为-39%,企业依靠账上现金扛亏损,预计到2030年才能转正。

推荐理由:GLM5.2和Qwen3.7 Max比美股便宜4-8倍,但还在亏本卖。高盛说代码模型利润率-39%,国内价格战打到2030年才止血,做AI应用的朋友该算算这笔账。
6月19日
18:40
18:40官方账号Together AI@togethercompute
TogetherAI用Kimi K2.7 Code和Claude Fable 5各生成12个落地页。Kimi的成本仅为Claude的1/16,质量表现接近。通过设计MCP服务器提供视觉上下文后,Kimi效果更佳。这表明开源模型在落地页生成工作流中已是高性价比的实用选择。
事件专题

推荐理由:想低预算做落地页?试试Kimi K2.7 Code,便宜16倍效果不输Claude Fable 5,尤其配合MCP服务器更稳。
18:33
18:33官方账号Together AI@togethercompute
精选
Kimi Moonshot 发布 Kimi-K2.7-Code,基于 Kimi K2.6 的专用编码智能体模型。该模型面向长周期软件工程工作流,支持工具调用和代理式推理。现已通过 Together AI 的推理栈提供,针对工具密集型编码代理场景优化。模型在多个编程基准上表现优于前代。
事件专题

推荐理由:月之暗面出了个专门写代码的智能体模型 K2.7-Code,在 Together AI 上就能跑,搞长期软件工程任务挺合适。
6月12日
11:45
11:45官方账号Microsoft AI@MicrosoftAI
精选
微软AI实验室在MSBuild 2026上发布了7个新模型,涵盖推理、代码、图像、语音和转录能力。这些模型基于科学和清洁的商业安全数据构建,设计为无缝协作。微软AI负责人Mustafa Suleyman在主题演讲中展示了这些进展,标志着微软在AI领域的快速扩张。

推荐理由:微软一口气推出7个覆盖多模态的模型,做AI应用开发的团队可以直接集成这些能力,减少自研成本,值得关注。