6月1日
11:16
11:16官方账号Together AI@togethercompute
精选
MiniMax 的最新模型 M3 已正式上线,并由 Together AI 提供推理基础设施支持。双方将于明天太平洋时间下午6点在 X Spaces 进行深度对话,分享模型和基础设施的细节。这一合作意味着 M3 模型将获得高性能的推理服务,对开发者来说是一个值得关注的进展。
推荐理由:MiniMax M3 上线并由 Together AI 支持推理,意味着模型推理性能有保障,做 AI 应用开发的团队可以直接试用,值得关注。
5月29日
17:57
17:57AI SDK@aisdk
Anthropic 发布了 Claude Opus 4.8,这是 Opus 4.7 的升级版本。新模型在判断力上更加敏锐,对自身进展的表述更诚实,并且能够比前代更长时间地独立工作。该模型现已可用,价格与 Opus 4.7 相同。AI SDK 已支持集成该模型,开发者可以立即使用。
事件专题

推荐理由:Claude Opus 4.8 提升了判断力和自主工作能力,做复杂推理和长任务自动化的开发者可以直接用上,价格不变值得升级。
17:54
09:57
09:57官方一手歸藏(guizang.ai)@op7418
78°
Anthropic 发布了 Claude Opus 4.8,相比 Opus 4.7 在各项能力上均有提升。最关键的改进是模型自我审查能力显著增强,能够更有效地发现自身代码中的问题,而此前版本的自审几乎无效。新模型还拥有更敏锐的判断力、更诚实的自我评估,并能更长时间独立工作。Opus 4.8 定价与上一代相同,现已可用。
事件专题

推荐理由:对依赖 AI 编程的开发者来说,Opus 4.8 的自我纠错能力解决了代码审查的痛点——以前让模型自己 review 代码基本没用,现在可以真正信任它帮你发现 bug,建议立即升级体验。
08:20
08:20Alex Albert@alexalbert__
精选
Anthropic 在 Opus 4.8 模型上投入了大量工作来校准其思考努力程度,旨在让模型在推理时既不过度思考也不思考不足。团队正在邀请用户测试并反馈模型在具体任务上的思考表现,特别是过度或不足思考的案例。这反映了 Anthropic 对模型推理质量精细调优的重视,有助于提升用户体验。用户可以通过回复或直接联系团队成员来提供反馈。
事件专题

推荐理由:Anthropic 正在主动校准 Opus 4.8 的思考深度,这对追求模型推理效率与质量平衡的开发者来说是个好消息——如果你在用 Claude 做复杂推理,反馈你的使用体验可以直接影响模型优化方向。
08:10
08:10Lenny Rachitsky@lennysan
Anthropic 发布 Claude Opus 4.8,这是 Opus 4.7 的升级版本。新模型在判断力上更敏锐,能更诚实地评估自身进展,并且比前代能独立工作更长时间。价格保持不变,即日起可用。这次更新聚焦于提升模型的自主性和可靠性,对需要长时间无人干预任务的用户尤其重要。
事件专题

推荐理由:Claude Opus 4.8 提升了自主工作能力和判断诚实度,做复杂长任务或自动化流程的团队可以直接升级,价格不变更值得一试。
08:01
08:01Genspark@genspark_ai
Anthropic 的 Claude Opus 4.8 模型已集成至 Genspark AI Chat Agent,用户可立即使用。该版本在 Opus 4.7 基础上提升了判断准确性和自我认知的诚实度,并支持更长时间的自主工作。定价保持不变。这标志着 Claude 系列在推理和自主性上的又一次迭代,适合需要长周期、高可靠性 AI 助手的场景。
事件专题

推荐理由:Claude Opus 4.8 的自主工作能力提升对需要长时间运行复杂任务的开发者是直接利好,Genspark 用户今天就能体验,建议试试新模型的判断力。
07:36
02:12
02:12OpenRouter@OpenRouterAI
83°
OpenRouter 宣布 Opus 4.8 模型正式上线,价格与 4.7 版本相同,但在智能体编程、推理和计算机使用方面有显著提升。相比 4.7,代码缺陷遗漏率降低约 4 倍。同时推出 Opus 4.8 Fast Mode,成本仅为 2 倍,速度提升 2.5 倍。该更新对依赖 AI 编程和推理的开发者是直接利好。
事件专题

推荐理由:Opus 4.8 在不涨价的前提下大幅提升了编程和推理能力,做智能体开发或代码审查的团队可以直接在 OpenRouter 上体验,性价比很高。
5月28日
16:53
16:53官方账号阿里云 Alibaba Cloud@alibaba_cloud
阿里云发布的Qwen3.7-Max模型在OpenRouter平台上的使用量达到77.3B tokens,成功登顶趋势LLM排行榜。这一成绩表明该模型在开发者社区中获得了广泛采用和认可。阿里云表示这只是开始,暗示未来将有更多更新和优化。该模型在推理、编程等任务上表现出色,成为开源社区的热门选择。

推荐理由:Qwen3.7-Max登顶OpenRouter趋势榜,说明它在实际使用中获得了开发者认可,做AI应用或模型评测的团队值得关注这个新标杆。
11:27
11:27官方账号arXiv cs.AI@Jiazhen Huang, Xiao Chen, Xiao Luo, Yong Dai, Senkang Hu, Yuzhi Zhao
精选
本文提出 Skill-Conditioned Gated Self-Distillation (SGSD) 方法,用于改进大语言模型的推理能力。传统自蒸馏方法依赖可信的先验信息(如参考答案),而 SGSD 从经验技能库中检索技能-错误对,构建多教师池,通过验证器判断教师极性,并设计门控目标函数来蒸馏有效信息。在多个数学推理基准上,SGSD 在 Qwen3-1.7B 上平均比 GRPO 提升 6.2%,比 OPSD 提升 1.7%,且对先验信息的假设更弱。代码已开源。
推荐理由:做 LLM 推理优化的研究者可以关注——SGSD 用技能库替代参考答案作为先验,降低了蒸馏对标注数据的依赖,数学推理场景效果显著,值得在自蒸馏框架中尝试。
5月27日
13:43
13:43官方账号阿里云 Alibaba Cloud@alibaba_cloud
精选
阿里云宣布 Qwen3.7 Max 模型现已支持 Go 语言,通过 OpenCode 集成。该模型拥有 1M 上下文窗口,推理能力更强,为开发者带来更多可能性。这一更新使得 Go 语言开发者能够直接利用 Qwen3.7 Max 的强大能力进行复杂任务处理。
推荐理由:Go 开发者终于能直接调用 Qwen3.7 Max 的 1M 上下文和强推理能力了,做大型代码库分析或长文档处理的团队值得一试。