10:34官方一手arXiv: DeepSeek@Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang, Yongpan Wang, Hongyu Zhang, Haibing Guan大型语言模型在代码生成方面取得显著进展,但大多数现有系统假设预定义的仓库架构。Repo0是一个针对零到全代码生成的持续结构演化框架,通过GPT-5 mini和DeepSeek V3.2在RepoCraft的六个真实仓库上评估,Repo0在所有设置中实现了最高的功能覆盖率和通过率,与RPG相比,功能覆盖率提高20.08个百分点,通过率提高29.74个百分点。论文代码生成大型语言模型Repo0推荐理由:Repo0通过GPT-5 mini和DeepSeek V3.2实现了更高的功能覆盖率和通过率,是设计驱动零到全代码生成的创新框架。与RPG相比,性能提升显著。原文稍后读已读值得跟进有用关注 代码生成
23:04宝玉@doteyClaude Design 是原型和设计一体的工具,不依赖 Figma。该工具可导入 Figma 设计稿,产出物为 React 代码与模拟数据,支持直接交互。其 Agent 功能能将设计还原为代码。AI产品ClaudeClaude DesignFigma推荐理由:Claude Design 是个新工具,能直接生成可交互的 React 原型,还能把设计稿变成代码,不用再依赖 Figma 了。原文稍后读已读值得跟进有用关注 Claude
18:12Geek@geekbbGitHub 上的一个昆虫图鉴项目把 63 种昆虫做成了交互式 3D 展台,支持旋转、拆解和点击标注。这 63 种昆虫全部通过代码实时生成,不依赖任何外部模型文件。用户无需下载 3D 资源,打开网页即可观察虫子的细微结构。项目地址为 github.com/xr843/insect-w…,适合自然爱好者和前端开发参考。AI产品昆虫图鉴3D展台GitHub推荐理由:想认虫子?这个开源项目把图鉴做成3D展台,63种虫能转能拆能点标注,不用下载模型文件,打开网页就能看。原文稍后读已读值得跟进有用关注 昆虫图鉴
18:47官方账号Decoder@Matthias Bastian72°智谱AI发布GLM-5.3,并称其为最强的开源权重编码模型。据其自家基准,仅通过后训练就比上一代提升50%。该模型经过网络安全训练,帮助安全团队在269个项目中找到2436个漏洞。模型权重计划在两周后开源。AI模型GLM-5.3Zhipu AI开源模型10 个信源在谈事件专题推荐理由:智谱发了GLM-5.3,说是开源编码模型里最强的,后训练提升50%,还帮找出了2436个漏洞,权重两周后开源,可以关注下。原文稍后读已读值得跟进有用关注 GLM-5.3
16:09官方一手marktechpost@Asif RazzaqZ.ai 于 2026 年 8 月 14 日发布 GLM-5.3,复用 743B 参数的 GLM-5.2 基础模型。GLM-5.3 的全部增益来自扩展后训练,未改动基础模型权重。Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9。网络安全方面,CyberGym 达到 84.5%,ExploitBench 翻倍以上至 54.4%。GLM-5.3 的权重约两周后发布。AI模型GLM-5.3Z.ai后训练10 个信源在谈事件专题推荐理由:GLM-5.3来了,不重训基础模型,后训练拉高Terminal-Bench到28.3,代码和长程任务提升,两周后开放权重。原文稍后读已读值得跟进有用关注 GLM-5.3
11:29官方账号arXiv cs.LG@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song精选Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。论文VeroLean 4形式化验证推荐理由:Vero拿43个真实仓库考AI写代码加形式化证明,最强配置只过了27个,想看看代码生成靠谱程度的可以来测测。原文稍后读已读值得跟进有用关注 Vero
03:53Aravind Srinivas@AravSrinivas83°谷歌在3.6 Flash发布三周后推出Gemini 3.7 Flash。新版本在编码和智能体任务上进步明显,软件工程、知识工作与网页开发均有提升。其首发价格为3.6 Flash原价的一半。模型现已通过Gemini API、Google AI Studio与Antigravity开放使用。AI模型Gemini 3.7 Flash谷歌智能体推荐理由:谷歌新出的3.7 Flash只要3.6一半价格,编码和智能体更强,适合做子智能体跑任务。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:38Google AI Developers@googleaidevs78°谷歌AI开发者宣布推出Gemini 3.7 Flash,称其为用于编码和智能体任务的最智能实干型模型。Gemini 3.7 Flash提升了指令遵循、首次代码准确率和智能体任务执行质量。官方演示中,该模型在Antigravity环境中构建了一个复杂3D网络游戏,包括生成Three.js样板代码、相机移动和碰撞检测。演示还使用Nano Banana创建PBR材质贴图和自定义精灵表,并集成了程序化音频。AI模型Gemini 3.7 FlashGoogle AI智能体推荐理由:谷歌发了Gemini 3.7 Flash,写代码和跑智能体任务更稳了,官方演示用它搭3D游戏,开发者可看看。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:23lmarena.ai@lmarena_ai81°Google DeepMind 发布 Gemini 3.7 Flash (High),已在 LMArena 的 Code Arena: WebDev 和 Text Arena 上线。该模型在 WebDev 排名从第 19 位升至第 8 位,明显优于上一代 Gemini 3.6 Flash (High)。它在数据与分析类别排名第 7,在模拟、游戏与内容创作工具类别排名第 8,在参考设计类别排名第 9。AI模型Gemini 3.7 FlashGoogle DeepMindLMArena推荐理由:谷歌 DeepMind 的新 Flash 模型在 WebDev 榜冲到第8,比上代进步不小,做网页或数据任务可以试试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
17:52lmarena.ai@lmarena_ai精选DeepSeek-V4-Pro (Max)在LMArena Code Arena WebDev榜单以1607分暂列第8,开源模型中排名第2。其分数低于Kimi K3 (Max)的1674分,也低于GPT-5.6 Sol (xHigh)的1622分。该成绩来自AutoEval早期评分,由奖励模型基于人类偏好自动投票产生,并非真人实时投票。后续真人投票加入后,最终排名可能变化。AI模型DeepSeek-V4-ProCode ArenaKimi K310 个信源在谈事件专题推荐理由:DeepSeek新模型V4-Pro专攻代码生成,在Code Arena排第8,开源第2,仅次于Kimi K3,还超过了GPT-5.6 Sol。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro
19:32The Rundown AI@therundownaiAnthropic近日发布了一项新研究,聚焦于提升Claude模型在复杂任务中的表现。该研究引入了新的训练方法,使Claude在推理和代码生成任务上取得了显著进步。在多个基准测试中,Claude的得分超越了前代版本,接近GPT-4的水平。研究团队还公开了部分技术细节,为后续模型优化提供了方向。论文AnthropicClaude推理模型10 个信源在谈事件专题推荐理由:Anthropic发了新研究,Claude在推理和代码上又强了,接近GPT-4,想了解细节的可以看看。原文稍后读已读值得跟进有用关注 Anthropic
01:59Mustafa Suleyman@mustafasuleyman微软CEO穆斯塔法·苏莱曼在X平台宣布推出MAI-Code编程模型,并附上博客链接。该模型面向代码生成与编程辅助场景,是微软MAI系列的最新成员。目前公开信息有限,具体性能参数与基准测试结果待博客披露。AI模型MAI-Code微软编程助手推荐理由:微软官方刚官宣的编程模型,做开发的朋友可以点进博客看细节。原文稍后读已读值得跟进有用关注 MAI-Code
09:49Paul Graham@paulgPaul Graham在X上表示,他最近遇到一位创始人,靠AI工具一天能写5万行代码。此前他曾提到这位创始人每天写1万行代码,当时已引发热议。这次他把数字提高到5万,并称这是极限案例。这位创始人熟悉AI工具,每天工作12小时,但代码质量并不差。行业Paul GrahamAI编程代码生成推荐理由:Paul Graham说有个创始人靠AI一天能写5万行代码,比上次说的1万行还夸张,想看看AI编程上限的可以来围观。原文稍后读已读值得跟进有用关注 Paul Graham
04:59官方账号Simon Willison@simonwSimon Willison用Codex Desktop和GPT-5.6 Sol Ultra开发他的Raccoon Heist游戏,新版本“Moonlight & Mayhem”让一群浣熊洗劫博物馆争夺Golden Sardine。他表示这次效果比Claude Fable 5做得更好。相关推文获得6036次查看和45个点赞。AI模型CodexGPT-5.6 Sol UltraClaude Fable 52 个信源在谈事件专题推荐理由:Simon用Codex和GPT-5.6做浣熊劫案游戏,效果超Claude Fable 5,AI做游戏可参考。原文稍后读已读值得跟进有用关注 Codex
10:28官方一手arXiv: OpenAI@Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen精选ProDVI是一个利用大语言模型为强化学习智能体提供初始化先验的新框架。它让代码生成模型输出Python函数,编码对环境动力学的粗略假设,再生成合成转移数据。这些数据用于预训练actor-critic价值网络的状态-动作编码器,使智能体在在线强化学习开始前获得动力学感知的表示。在OpenAI Gym和DeepMind Control Suite任务上,ProDVI显著提升了无模型强化学习算法的样本效率。论文ProDVI强化学习大语言模型10 个信源在谈事件专题推荐理由:这篇论文用大语言模型写代码来初始化强化学习,不用模拟器和预收集数据,在Gym和Control Suite上都能省样本。原文稍后读已读值得跟进有用关注 ProDVI
08:10Paul Graham@paulgPaul Graham在X上发帖(17238次查看)称,用更抽象的语言编写代码能降低LLM生成时的token成本。他认为LLM并不排斥前缀表示法,这也是抽象语言值得尝试的原因(该帖有35条评论)。这条推文获得161个赞、6次转发和42次分享。技巧Paul GrahamLLMtoken成本推荐理由:Paul Graham说,想让LLM写代码更省token,就换更抽象的语言,连前缀表示法它也不怕。原文稍后读已读值得跟进有用关注 Paul Graham
07:07官方账号Meta AI@AIatMeta精选Meta发布Muse Spark 1.2,相比前代显著扩大编码任务的训练计算规模,并增加训练环境多样性。新模型在代码生成、复杂调试和端到端开发者工作流上均有提升。Muse Spark 1.2与Muse Code联合训练,针对全仓库生成、大型项目和自动研究任务优化。AI模型Muse SparkMuse CodeMeta10 个信源在谈事件专题推荐理由:Meta把Muse Spark 1.2的编码能力调强了,配Muse Code一起用,全仓库生成和调试都更顺,写大项目可以试试。原文稍后读已读值得跟进有用关注 Muse Spark
10:17官方账号arXiv cs.AI@Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo论文提出首个视觉模式完成偏差基准,基于Design2Code数据集的30个网页生成1440张测试截图。评估5个多模态大语言模型,平均偏差率在卡片宽度扰动上达69.78%,文字字号上达80.22%,准确率仅21.17%和7.89%。Codex-5.3表现最佳,但准确率从卡片任务的68.61%降至文字任务的13.89%,Flash-3.0在文字任务上偏差率高达96.11%。噪声、更细微扰动和边界位置会进一步提高偏差率。论文Codex-5.3Flash-3.0Design2Code推荐理由:论文测了五个多模态模型做截图转代码填空,发现它们都按重复UI模式猜答案,最强Codex-5.3文字准确率也只有13.89%。原文稍后读已读值得跟进有用关注 Codex-5.3
02:10Yangyi@Yangyixxxx开发者 @yangyi 在 X 上发布《Vibe Coding 八荣八耻》,用 8 组对比调侃 AI 辅助编码中的典型行为。例如“以不看生成代码为荣,以逐行读懂代码为耻”“以密钥硬编码并推上 public repo 为荣”等。帖子还以“vibe 出 30 个 app 一分不赚”为荣作结,并说本周五课上默写。该帖目前已有 1145 次查看和 4 个赞。技巧Vibe CodingAI编程代码生成推荐理由:@yangyi 把 vibe coding 的迷惑行为编成八荣八耻,条条扎心,适合当反例自嘲,也提醒你别真这么干。原文稍后读已读值得跟进有用关注 Vibe Coding
06:30官方账号Yann LeCun@ylecun精选Yann LeCun 在 X 平台回应网友评论,澄清他批评的对象是纯 LLM 所采用的自回归 token 预测。他表示,优秀的代码生成系统并不属于纯 LLM,工作方式也不是简单的自回归 token 预测。这条推文获得 133 次点赞、25 条回复,浏览量超过 1.7 万。行业Yann LeCun代码生成LLM推荐理由:LeCun 发推澄清:别把代码生成器和纯 LLM 自回归划等号,观点直接,适合关注大模型技术路线的人。原文稍后读已读值得跟进有用关注 Yann LeCun
06:04lmarena.ai@lmarena_ai精选72°GLM-5.2 (Max)在LMArena的Code Arena: Frontend榜单排名第2,位列开源模型第1。该模型比Claude Opus 4.7 (Thinking)高出29分,仅次于Fable 5。其在React子榜单排名第2,HTML子榜单排名第4,并在Brand & Marketing、Data & Analytics等6个子类别中排名第一。智谱AI(Zai_org)披露下一代GLM即将发布。AI模型GLM-5.2智谱Claude Opus推荐理由:智谱新出的GLM-5.2 (Max)在前端代码测评里拿了开源第一,总分第2,把Claude Opus 4.7甩开29分。写前端的可以关注下。原文稍后读已读值得跟进有用关注 GLM-5.2
16:35官方账号阿里通义 Qwen@Alibaba_Qwen精选Qwen3.8-Max 在 Arena.ai 的 Frontend Code Arena 排行榜上拿下 1668 分,位列第四。它落后于 Claude Opus 5 (Max) 的 1705 分和 Kimi K3 (Max) 的 1676 分,与 Claude Opus 5 (High) 的 1669 分几乎持平。细分领域中,Consumer Product 排第二,Brand & Marketing、Reference-based design、Gaming、Content Creation Tools 均排第三。Data & Analytics 排第四,Simulations 排第五。阿里 Qwen 官方称该模型在 Text Arena 的真实任务中也有表现。AI模型Qwen3.8-MaxAlibaba_QwenArena.ai推荐理由:Qwen 的 Qwen3.8-Max 冲到代码榜第四,只比 Claude Opus 5 High 档低一分,做前端的可以看看。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
13:41AI Will@FinanceYF5DeepSeek-V4-Flash-High在Frontend Code Arena综合排名第七,得分1586分,在开放模型中位列第三。相比DeepSeek-V4-Flash-High-Preview,得分提升了154分;相比DeepSeek-V4-Pro-Preview,提升了121分。分类排名中,它在Consumer Product排第四,在Reference-based Design、Data & Analytics和Gaming排第六,在Brand & Marketing排第七。AI模型DeepSeekDeepSeek-V4-Flash-HighFrontend Code Arena推荐理由:DeepSeek又出新模型,V4-Flash-High做前端代码生成在竞技场排第七,开源里第三,比预览版涨了154分,挺能打。原文稍后读已读值得跟进有用关注 DeepSeek
04:50官方账号Greg Brockman@gdbGPT-5.6 Luna 今日降价 80%。开发者 Simon Willison 在 Datasette Agent 中实测,称其运行飞快。该模型能生成 SQL、HTML 和 JavaScript 代码。Simon 认为这是一款低成本且性能出色的模型。AI产品GPT-5.6 LunaDatasette Agent编程助手1 个信源在谈事件专题推荐理由:GPT-5.6 Luna 今天降价 80%,Simon 实测超快,写 SQL、HTML、JS 都行,便宜还强。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
03:42lmarena.ai@lmarena_aiOpenAI 的 GPT-5.6 家族 Sol、Terra、Luna 已在 ChatGPT、Codex 和 API 中开始推出。在 LMArena 全栈代码竞技场中,Sol 以 1638 分排全栈第 3,总榜第 5;Terra 全栈 1579 分列第 10,总榜第 20;Luna 全栈 1568 分列第 14,总榜第 18。Opus 5 (Max) 即将加入全栈榜单。AI模型GPT-5.6OpenAILMArena10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 三兄弟开测,Sol 全栈第 3,Terra 和 Luna 也进 top20,挑模型看这个。原文稍后读已读值得跟进有用关注 GPT-5.6
18:35官方一手marktechpost@Michal SutterJetBrains Research将KotlinLLM以Apache License 2.0协议开源。这款IntelliJ IDEA插件原型提供asLlm和mockLlm两个智能宏,其主体是生成的Kotlin源码而非实时模型调用。KotlinLLM通过JDI捕获运行时值,让LLM Agent生成窄范围代码更新,编译后重定义已加载类。在改造版Spring Petclinic项目上,24个场景全部完成,热重载成功率100%,运行时开销约1%。AI产品JetBrainsKotlinLLMIntelliJ IDEA推荐理由:JetBrains把KotlinLLM开源了,这个插件让LLM生成Kotlin代码直接跑,跑完就不再调模型,开销只有1%,挺有意思。原文稍后读已读值得跟进有用关注 JetBrains
12:11官方一手arXiv: DeepSeek@Minghao Hu, Lannan Luo, Allen Roush, Phillip HowardCoGate是一种针对大模型代码生成安全问题的置信度门控协同解码方法。它通过结合小型安全专家模型与目标模型,根据专家模型的置信度控制其影响,避免在未见模式或分布外场景下产生误导。研究在CodeGen、DeepSeek-Coder、Qwen-Coder和StarCoder等多个后端上进行了评估,覆盖HumanEval、安全套件和CWEval基准。相比现有协同解码方法CoSec+,CoGate在CWEval上实现了高达12.6%的Func-Sec@10提升。论文CoGateCoSec+代码生成推荐理由:这篇论文提出了CoGate,让安全专家模型在没把握时少掺和,代码生成更安全,比CoSec+最高提升了12.6个百分点。原文稍后读已读值得跟进有用关注 CoGate
10:45AI Will@FinanceYF575°Matt Shumer 发布演示视频,Claude Opus 5 一次生成一个完整游戏。演示中所有画面与逻辑均为模型自定义代码,未使用任何外部素材。该游戏由 Claude Opus 5 单次编码完成,无需人工修改。AI模型Claude Opus 5Matt Shumer游戏生成推荐理由:Matt Shumer 用 Claude Opus 5 演示了一把生成游戏,画面和逻辑全靠模型自己写,不用任何外部素材,看着挺神奇。原文稍后读已读值得跟进有用关注 Claude Opus 5
10:29官方账号Simon Willison@simonwGPT-5.6 Luna今日降价80%,Simon Willison随即在Datasette Agent中实测。它生成SQL、HTML和JavaScript代码速度快,可用于Datasette Apps。推文获得101次点赞和5103次查看。AI产品GPT-5.6 LunaDatasette Agent代码生成1 个信源在谈事件专题推荐理由:Simon Willison说降价80%的GPT-5.6 Luna很猛,在Datasette Agent里跑得飞快,SQL、HTML、JS都能生成,开发者可以看看。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
00:48mem0@mem0ai精选71°Mem0是一个外部记忆层,能让AI模型跨会话保留用户偏好。没有Mem0时,新会话默认使用列表推导式;有了Mem0,Claude直接输出显式for循环。Claude的/clear命令只清除模型上下文,不清除Mem0存储的记忆,因此偏好可通过MCP服务器持久访问。AI产品Mem0ClaudeMCP/工具推荐理由:想让你家AI记住你之前怎么写的代码?Mem0让Claude跨会话用for循环,不用瞎猜默认语法。原文稍后读已读值得跟进有用关注 Mem0
09:22官方一手arXiv: DeepSeek@Peiding Wang, Li Zhang, Fang LiuMRCoder采用Map-Reduce范式,在Map阶段通过轻量草稿模型和结构感知草稿引导选择(SADGS)筛选信息上下文,在Reduce阶段聚合上下文并利用并行验证加速解码。在CoderEval和DevEval基准上,使用Qwen2.5-Coder和DeepSeek-Coder作为骨干模型时,MRCoder提升了代码生成准确率,同时减少了30%到50%的token消耗,推理时间降低最多52%。该方法相比现有RAG及上下文选择方法更高效地平衡了质量和计算开销。论文MRCoderQwen2.5-CoderDeepSeek-Coder推荐理由:MRCoder用Map-Reduce思路解决仓库级代码生成的上下文选择难题,比现有RAG方法节省30-50% token,推理快52%,在CoderEval和DevEval上准确率更高。原文稍后读已读值得跟进有用关注 MRCoder
09:20官方一手arXiv: DeepSeek@Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao ZhuCodeSpec提出双可执行规范方法,从子需求语义与仓库架构配对构建可靠功能链,并编译为互补的架构和行为规范。在FeatureBench上,使用DeepSeek-V4-Pro达到70.7%、55.0%和49.9%的通过率,优于Claude Code等基线。在NL2Repo-Bench上验证了泛化性。该方法通过可执行规范保证长周期开发中设计与实现的一致性。论文CodeSpecDeepSeek-V4-ProFeatureBench4 个信源在谈事件专题推荐理由:这篇论文搞了个CodeSpec,让代码智能体在仓库里加新功能时先建可执行规范,在FeatureBench上用DeepSeek-V4-Pro跑到70.7%通过率,比Claude Code靠谱不少。原文稍后读已读值得跟进有用关注 CodeSpec
00:15lmarena.ai@lmarena_ai82°Anthropic 的 Claude Opus 5 (Max) 在 Agent Arena 中排名第二,基于超过 7000 次真实代理会话,净提升 11.88%。Opus 5 (High) 紧随其后排名第三,净提升 11.73%,两者均低于第一名 Fable 5,但高于 GPT-5.6 Sol (xHigh)。在 Frontend Code Arena 中,Opus 5 Max 排名第一,Opus 5 High 排名第三(落后于 Kimi K3)。在 Text Arena(事实性开启)中,Opus 5 Max 位列第一,Opus 5 High 第二。这些成绩基于全球社区的百万级真实长周期任务评测。AI模型Claude Opus 5Agent ArenaAnthropic10 个信源在谈事件专题推荐理由:Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。原文稍后读已读值得跟进有用关注 Claude Opus 5
12:25官方账号arXiv cs.AI@Fabian Kreppel, Reza Salkhordeh, Ferdinand Schmidt-Kaler, André BrinkmannClaude Opus 4.7首次生成并迭代优化了离子阱穿梭编译器的完整Python代码,从线性分段陷阱扩展到有结架构,最终适用于广泛连接图。在基准量子电路测试中,线性架构的穿梭time steps减少76%,有结架构减少39%。对于密集连接、结丰富的架构,穿梭time steps比走廊式架构降低一个数量级。Claude Fable 5复现了结果,在大电路上超越手工编译器的次数更多。开发时间从数月缩短到数天。论文Claude Opus 4.7Claude Fable 5量子编译器2 个信源在谈事件专题推荐理由:论文用Claude Opus 4.7自动写量子穿梭编译器,性能超手工,开发时间从数月缩到数天,效率提升惊人。原文稍后读已读值得跟进有用关注 Claude Opus 4.7
12:14官方一手歸藏(guizang.ai)@op7418归藏推文称 Codex 今天可能会重置。目前尚无具体版本号或新功能细节。用户需留意后续官方更新或重置后的参数变化。该重置可能影响基于 Codex 的编程工作流。AI模型CodexOpenAI代码生成10 个信源在谈事件专题推荐理由:归藏说 Codex 要重置了,如果你在用 Codex 写代码,建议留意一下今天的变动。原文稍后读已读值得跟进有用关注 Codex
09:46官方账号arXiv cs.LG@Ishpuneet Singh, Shreyas Mahajan, Gurjot Singh, Maninder Singh一项研究评估了5款AI编码助手(如GitHub Copilot、Amazon CodeWhisperer等)在生成认证代码时的安全性,采用静态代码分析加动态渗透测试的双模态评估框架,并映射到NIST SP 800-63B标准。结果发现,基础或通用安全提示下生成的代码普遍缺少暴力破解防护、会话管理和密码处理等关键保护。即使给出一次性NIST提示,合规性虽有提升但仍结构不足。只有通过迭代重提示(Reprompting)迫使模型进行上下文自审计,才能实现完整的深度防御安全架构。研究证实当前AI编码助手无法默认生成安全代码,企业需从一次性提示转向持续、标准驱动的验证流程。论文LLMAI安全代码生成推荐理由:想了解AI写代码到底安不安全?这篇论文用具体基准和测试告诉你,目前主流的编码助手都靠不住,必须用迭代重提示才能堵上漏洞。原文稍后读已读值得跟进有用关注 LLM
12:15官方账号arXiv cs.AI@Zhen Zhao, Qihang Yang, Feifei Dai, Xiangfang Li, Bo LiMineValiCoder 提出一种协作闭环测试驱动开发(TDD)框架,包含三个模块:测试用例质量挖掘(TCQM)通过自验证过滤缺陷测试,并行TDD迭代优化生成高质量代码候选,二分图代码-测试互验(BiCoTeV)动态建模代码-测试交互进行可靠选择。在 HumanEval 上 Pass@1 达 96.34%,MBPP 上 87.40%,APPS 上 64.00%,LiveCodeBench 上 51.33%,显著优于现有方法。MineValiCoder 有效缓解了 LLM 随机性导致的不稳定代码生成问题。论文MineValiCoder测试驱动开发代码生成推荐理由:这篇论文用MineValiCoder框架搞定代码生成不可靠问题,HumanEval跑出96.34%通过率,比之前的方法强一截,搞LLM代码的同学值得看看。原文稍后读已读值得跟进有用关注 MineValiCoder
10:59官方账号NVIDIA AI@NVIDIAAI精选NVIDIA在代理芯片设计场景中测试了Nemotron 3 Ultra的RTL编码能力。该模型迭代编写芯片逻辑代码、通过仿真器运行、读取失败并重写。在九个真实设计工作类别中,Nemotron 3 Ultra平均通过率达97.1%,每次迭代消耗6629个tokens。这是测试中所有开源模型里表现最好的。AI模型Nemotron 3 UltraNVIDIARTL编码10 个信源在谈事件专题推荐理由:NVIDIA测了Nemotron 3 Ultra在芯片设计RTL编码上的表现,九类任务平均通过率97.1%,开源模型里最强,值得关注。原文稍后读已读值得跟进有用关注 Nemotron 3 Ultra
07:18官方一手AWS Machine Learning Blog@Sandeep SinghAmazon Bedrock Guardrails可配置为代码生成工作流加入安全防护,防止生成有害或不合规代码。本文详细介绍了如何结合编码助手(如Amazon Q Developer)设置内容过滤器、敏感信息屏蔽和主题限制。通过实施这些最佳实践,企业能实现有效的容量规划并确保安全覆盖。文中还提供了示例策略和配置步骤,帮助开发者快速落地。技巧Amazon BedrockGuardrails代码生成推荐理由:AWS官方教你给代码生成加护栏,用Bedrock Guardrails防有害代码,还能规划容量,适合用编程助手的人。原文稍后读已读值得跟进有用关注 Amazon Bedrock
01:15Lovable@lovable_devAI 开发平台 Lovable 今日宣布获得 AIUC-1 认证,该标准由 AI Underwriting 制定,是业界领先的第三方 AI 安全、可靠性和安全性基准。认证过程包括对不安全代码生成、密钥泄露等风险的压测。Lovable 成为首批通过该认证的平台之一。行业LovableAIUC-1AI安全推荐理由:Lovable 拿到了 AIUC-1 安全认证,意味着它过了一道严格的代码安全测试关,用着放心。原文稍后读已读值得跟进有用关注 Lovable