#代码生成
这篇论文教你用强化学习把难题拆成小模块再拼起来,Qwen和Code World Model上测试比传统RL省50倍算力,还能解原本解不出的题。
Claude Opus 4.7居然能自动给MPI软件加上检查点恢复,50分钟搞定,效果媲美人工,HPC开发者可以解放双手了。
最近这几个Flash模型我帮你试了,Step 3.7 Flash写博客页和抓GitHub项目都很稳,页面好看,一次跑通,成本也就一两块钱,值得试试。
微软把自家MAI-Code-1-Flash模型放进GitHub Copilot了,写代码更快更省资源,Business和Enterprise用户赶紧试试。
微软出了个新模型 MAI-Code-1-Flash,直接在 Copilot 里跑,能自动把草图变成完整测试通过的代码,又快又便宜。
Grok 4.5 用 Cursor 数据训练,性能直逼 Opus,而且 SpaceX 要每月发新模型,代码圈和 AI 圈都该看看。
Epoch AI 搞了个新基准 MirrorCode,专测 AI 能不能凭空抄作业。Claude Opus 4.7 解了一半,但最难的题全挂,甚至有个模型烧了 19 天才花掉 2600 刀。
Anthropic工程师手把手教你用循环搭建能跑好几天的智能体,内部30%代码都这么写,比大部分500美元的vibe编程课实在。
GLM-5.2 在前端任务上干掉了 Claude Opus 系列,对 Kimi 和 Sonnet 胜率超 60%,开源模型里相当能打。
不用学设计软件,上传 Figma 或画个草图就能出 UI、视频、动画,还能一键转代码,设计师和产品经理都该试试。
这篇论文定义了Text2DSL任务,带了一个4204条规则的数据集PolkitBench,还发现喂给模型语法规则能让代码生成质量暴增,不用微调。
D 哥做的 clonesite.ai 能直接输入网址复刻网页,还原度95%以上,交付 TanStack 代码,比同类 Agent 都准。
想测AI写代码的真本事?别只看Python了。Multi-LCB覆盖12种语言,一测就知道模型是不是只会Python,结果可能让你意外。
Augment Code 分享了他们如何让一个 agent 一口气完成整个设计文档实现,省去拆 ticket 和接力,适合做大项目的人参考。
这篇论文为Solidity智能合约代码生成建了个新基准(5470个合约)和专用评分指标,测试了多个主流代码模型的各种方法,结论明确:靠谱的领域数据+微调最管用。
StepFun 的 Step 3.7 Flash 在生成物理动画上把 DeepSeek V4-Flash 比下去了,慢点但模拟和画面都好很多。
Block 内部搞了个 Builderbot,每天自动处理 20 万次操作、合并 1500 个 PR,把几个月的工作缩短到几天,效率太猛了。
LangSmith 推出了 Sandboxes,让 agent 真正跑代码并验证结果。适合做编程助手、CI 自动化或数据处理。
这篇论文用MPMWorlds测试了AI看视频写物理代码的能力,发现代码生成稳但缺位置感知,扩散模型短时准但长期漂移,混合模型效果最好。