#代码生成
这篇论文用MineValiCoder框架搞定代码生成不可靠问题,HumanEval跑出96.34%通过率,比之前的方法强一截,搞LLM代码的同学值得看看。
NVIDIA测了Nemotron 3 Ultra在芯片设计RTL编码上的表现,九类任务平均通过率97.1%,开源模型里最强,值得关注。
想看看哪个 AI 智能体干活最靠谱、哪个写前端代码最好?这两个新排行榜给你真实用户投票结果,直接去 arena.ai 查。
Gemini 3.6 Flash 写代码不卡壳了,还能读图表写报告,开发者可以马上在 Android Studio 里试。
Sahil Lavingia 分享了他公司用 Devin 写代码的真实数据:41% 的 PR 由 AI 完成,明年还要翻倍。AI 编码已经不是概念了。
这篇论文发现AI助手写代码越来越啰嗦,还给出了一个叫TRIM的清理方法,能减少17%到33%的冗余,实测效率高,推荐给写代码的朋友。
想了解提示语言怎么影响代码生成质量?这篇实测了GPT-4o mini、DeepSeek和Claude在多种语言下的表现,结果英文不一定最好。
Kimi 新模型在前端代码上把 Claude Fable 5 比下去了,六个子项都排第一,而且权重会开源,值得试试。
Kimi-K3 刚把 Claude Fable 5 从第一拉下来,前端代码评测全面领先,很快还会开源权重,玩编程的可以关注。
这篇论文用严格安慰剂对照方法戳穿了代码模型自修复的假设,在0.5-1.5B模型上实测发现错误内容并没带来明显改善,想了解模型能力边界可以看看。
这篇论文用10个真实bug和5个流行LLM测试了它们能否直接从业务需求写测试断言,发现效果还行但差异大。如果你想了解LLM在自动化测试中的实际能力,这篇值得看看。
Together AI搞了个新基准ParallelKernelBench,专门测AI写多GPU CUDA代码的能力,比单核测试更贴近真实场景。
Meta 发了 Muse Spark 1.1,代码生成得分1541,成本只要350万美元,比同类便宜不少,适合做前端开发的玩家。
OpenAI 的 GPT-5.6 新变体在 DeepSWE 上干过了 Fable 5,还更便宜更快,值得关注。
Bun原来用Zig写的,现在直接换成Rust了,而且靠Claude Fable 5在11天里写了100多万行代码,这AI写代码的效率太吓人了。
斯坦福AI Lab搞了个新方法TRACE,让AI自己找短板补课。只用四分之一训练量就超过了GRPO和GEPA,还赢了大模型Codex 5.2和GLM 5。
这篇论文提出 ProjAgent,用过程相似性帮你找到仓库里逻辑相似的代码片段,在 REPOCOD 上 Pass@1 达到 41.14%,比传统语义检索强。
Cognition 新模型 SWE-1.7 基于 Kimi K2.7 用强化学习改进,FrontierCode 基准上 42.3% 分且每任务仅 1.97 美元,性价比突出。
Anthropic的Fable 5只用了40分钟就把160万行C++的老游戏草稿编译成iOS原生应用,连触控操作都是AI写的
Claude Fable 5 能把蜘蛛侠荡网变成可玩的 Godot 游戏,而且比 GPT-5.5 少出不少错,做游戏可以试试它。