7月22日
08:09
08:09官方一手marktechpost@Asif Razzaq
精选
Poolside发布Laguna S 2.1,这是一个118B参数的MoE编码模型,每token仅激活8B参数,支持1M上下文。该模型在SWE-Bench Multilingual基准上匹配甚至超越参数规模数倍于它的模型。Laguna S 2.1采用OpenMDW-1.1开放权重许可,可在单台NVIDIA DGX Spark上运行。
事件专题

推荐理由:Poolside出了个小参数但很强的编码模型Laguna S 2.1,8B活跃参数就在SWE-Bench多语言上吊打大模型,还开放权重,单机就能跑。
7月9日
05:27
05:27官方账号OpenAI@OpenAI
OpenAI 在推特上指出,随着编码模型不断进步,现有的评估基准已不足以衡量真实进展。他们强调需要设计更难的测试、更公平的对比和更可靠的结果。这条观点引发社区对当前基准如 SWE-bench 等是否仍有效的讨论。
事件专题

推荐理由:OpenAI 自己说现在的编码测试太简单了,得加点难度和公平性。搞 AI 写代码的可以看看基准怎么改。
6月29日
6月16日
6月12日