#代码生成
Repo0通过GPT-5 mini和DeepSeek V3.2实现了更高的功能覆盖率和通过率,是设计驱动零到全代码生成的创新框架。与RPG相比,性能提升显著。
谷歌 DeepMind 的新 Flash 模型在 WebDev 榜冲到第8,比上代进步不小,做网页或数据任务可以试试。
DeepSeek新模型V4-Pro专攻代码生成,在Code Arena排第8,开源第2,仅次于Kimi K3,还超过了GPT-5.6 Sol。
Meta把Muse Spark 1.2的编码能力调强了,配Muse Code一起用,全仓库生成和调试都更顺,写大项目可以试试。
智谱新出的GLM-5.2 (Max)在前端代码测评里拿了开源第一,总分第2,把Claude Opus 4.7甩开29分。写前端的可以关注下。
Qwen 的 Qwen3.8-Max 冲到代码榜第四,只比 Claude Opus 5 High 档低一分,做前端的可以看看。
DeepSeek又出新模型,V4-Flash-High做前端代码生成在竞技场排第七,开源里第三,比预览版涨了154分,挺能打。
OpenAI 的 GPT-5.6 三兄弟开测,Sol 全栈第 3,Terra 和 Luna 也进 top20,挑模型看这个。
JetBrains把KotlinLLM开源了,这个插件让LLM生成Kotlin代码直接跑,跑完就不再调模型,开销只有1%,挺有意思。
Matt Shumer 用 Claude Opus 5 演示了一把生成游戏,画面和逻辑全靠模型自己写,不用任何外部素材,看着挺神奇。
Simon Willison说降价80%的GPT-5.6 Luna很猛,在Datasette Agent里跑得飞快,SQL、HTML、JS都能生成,开发者可以看看。
MRCoder用Map-Reduce思路解决仓库级代码生成的上下文选择难题,比现有RAG方法节省30-50% token,推理快52%,在CoderEval和DevEval上准确率更高。
这篇论文搞了个CodeSpec,让代码智能体在仓库里加新功能时先建可执行规范,在FeatureBench上用DeepSeek-V4-Pro跑到70.7%通过率,比Claude Code靠谱不少。
Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。