8月25日
18:48
8月21日
10:34
10:34官方一手arXiv: DeepSeek@Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang, Yongpan Wang, Hongyu Zhang, Haibing Guan
大型语言模型在代码生成方面取得显著进展,但大多数现有系统假设预定义的仓库架构。Repo0是一个针对零到全代码生成的持续结构演化框架,通过GPT-5 mini和DeepSeek V3.2在RepoCraft的六个真实仓库上评估,Repo0在所有设置中实现了最高的功能覆盖率和通过率,与RPG相比,功能覆盖率提高20.08个百分点,通过率提高29.74个百分点。
推荐理由:Repo0通过GPT-5 mini和DeepSeek V3.2实现了更高的功能覆盖率和通过率,是设计驱动零到全代码生成的创新框架。与RPG相比,性能提升显著。
8月20日
23:04
8月14日
18:47
18:47官方账号Decoder@Matthias Bastian
72°
智谱AI发布GLM-5.3,并称其为最强的开源权重编码模型。据其自家基准,仅通过后训练就比上一代提升50%。该模型经过网络安全训练,帮助安全团队在269个项目中找到2436个漏洞。模型权重计划在两周后开源。
事件专题

推荐理由:智谱发了GLM-5.3,说是开源编码模型里最强的,后训练提升50%,还帮找出了2436个漏洞,权重两周后开源,可以关注下。
11:29
11:29官方账号arXiv cs.LG@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song
精选
Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。
推荐理由:Vero拿43个真实仓库考AI写代码加形式化证明,最强配置只过了27个,想看看代码生成靠谱程度的可以来测测。
8月8日
8月6日
07:07
07:07官方账号Meta AI@AIatMeta
精选
Meta发布Muse Spark 1.2,相比前代显著扩大编码任务的训练计算规模,并增加训练环境多样性。新模型在代码生成、复杂调试和端到端开发者工作流上均有提升。Muse Spark 1.2与Muse Code联合训练,针对全仓库生成、大型项目和自动研究任务优化。
事件专题

推荐理由:Meta把Muse Spark 1.2的编码能力调强了,配Muse Code一起用,全仓库生成和调试都更顺,写大项目可以试试。
8月4日
06:30
06:30官方账号Yann LeCun@ylecun
精选
Yann LeCun 在 X 平台回应网友评论,澄清他批评的对象是纯 LLM 所采用的自回归 token 预测。他表示,优秀的代码生成系统并不属于纯 LLM,工作方式也不是简单的自回归 token 预测。这条推文获得 133 次点赞、25 条回复,浏览量超过 1.7 万。
推荐理由:LeCun 发推澄清:别把代码生成器和纯 LLM 自回归划等号,观点直接,适合关注大模型技术路线的人。
8月1日
04:50
04:50官方账号Greg Brockman@gdb
GPT-5.6 Luna 今日降价 80%。开发者 Simon Willison 在 Datasette Agent 中实测,称其运行飞快。该模型能生成 SQL、HTML 和 JavaScript 代码。Simon 认为这是一款低成本且性能出色的模型。
事件专题

推荐理由:GPT-5.6 Luna 今天降价 80%,Simon 实测超快,写 SQL、HTML、JS 都行,便宜还强。
7月31日
10:45
10:45AI Will@FinanceYF5
75°
Matt Shumer 发布演示视频,Claude Opus 5 一次生成一个完整游戏。演示中所有画面与逻辑均为模型自定义代码,未使用任何外部素材。该游戏由 Claude Opus 5 单次编码完成,无需人工修改。
推荐理由:Matt Shumer 用 Claude Opus 5 演示了一把生成游戏,画面和逻辑全靠模型自己写,不用任何外部素材,看着挺神奇。
10:29
10:29官方账号Simon Willison@simonw
GPT-5.6 Luna今日降价80%,Simon Willison随即在Datasette Agent中实测。它生成SQL、HTML和JavaScript代码速度快,可用于Datasette Apps。推文获得101次点赞和5103次查看。
事件专题

推荐理由:Simon Willison说降价80%的GPT-5.6 Luna很猛,在Datasette Agent里跑得飞快,SQL、HTML、JS都能生成,开发者可以看看。
7月30日
09:20
09:20官方一手arXiv: DeepSeek@Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao Zhu
CodeSpec提出双可执行规范方法,从子需求语义与仓库架构配对构建可靠功能链,并编译为互补的架构和行为规范。在FeatureBench上,使用DeepSeek-V4-Pro达到70.7%、55.0%和49.9%的通过率,优于Claude Code等基线。在NL2Repo-Bench上验证了泛化性。该方法通过可执行规范保证长周期开发中设计与实现的一致性。
事件专题

推荐理由:这篇论文搞了个CodeSpec,让代码智能体在仓库里加新功能时先建可执行规范,在FeatureBench上用DeepSeek-V4-Pro跑到70.7%通过率,比Claude Code靠谱不少。
7月28日
12:14
7月27日
10:59
10:59官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA在代理芯片设计场景中测试了Nemotron 3 Ultra的RTL编码能力。该模型迭代编写芯片逻辑代码、通过仿真器运行、读取失败并重写。在九个真实设计工作类别中,Nemotron 3 Ultra平均通过率达97.1%,每次迭代消耗6629个tokens。这是测试中所有开源模型里表现最好的。
事件专题

推荐理由:NVIDIA测了Nemotron 3 Ultra在芯片设计RTL编码上的表现,九类任务平均通过率97.1%,开源模型里最强,值得关注。