10:56官方账号arXiv cs.AI@Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai NaSWE Refactor Bench是一个包含20个全库迁移的基准,涵盖4种技术债务。评估协议分为三个阶段:迁移审计、行为测试和代理验证。520次运行中,只有5.4%通过所有阶段,13个任务无解决方案。迁移完整性和行为正确性是不同的能力,代理在不同迁移类别上的能力差异显著。论文SWE Refactor Bench编码智能体全库迁移推荐理由:SWE Refactor Bench为开发可靠的编码智能体提供了一个严格的测试平台,展示了编码智能体在迁移全库时的能力。原文稍后读已读值得跟进有用关注 SWE Refactor Bench
10:08官方一手arXiv: OpenAI@Arquimedes Canedo基于LLM的编码智能体从高级描述生成完整软件系统,但架构规范格式对生成代码质量的影响尚不清楚。本文通过对比五种信息等效规范格式(非正式散文、Mermaid图、OpenAPI、C4/Structurizr DSL和TypeScript接口合同)和六种模型,发现规范格式与模型能力存在显著交互。在90次多轮智能体试验中,格式对模型能力的影响明显。在最强模型上,格式影响较小;在较弱模型上,格式影响较大。TypeScript合同将API路由覆盖率从最弱模型的33%提升到100%。结构化架构规范作为能力均衡器,其价值与模型强度成反比,对成本优化部署的回报最大。论文智能体架构规范编码智能体推荐理由:这篇论文通过实验展示了架构规范格式对编码智能体生成代码质量的影响,特别是TypeScript合同在提升API路由覆盖率方面的显著效果,对于关注模型能力均衡的读者来说值得一读。原文稍后读已读值得跟进有用关注 智能体
01:41OpenRouter@OpenRouterAIOx Alpha 今日预计达到近 6 万亿 token,可通过 ori 在您的编码智能体中尝试:$ ori [您的首选 harness] --model stealth/ox-alpha 💬 42 🔄 20 ❤️ 488 👀 21453 📊 90 ⚡AI模型Ox Alpha智能体token8 个信源在谈事件专题推荐理由:Ox Alpha 今日预计达到 6 万亿 token,试试通过 ori 在您的编码智能体中使用吧,和 stealth 模型相比,Ox Alpha 有什么不同?原文稍后读已读值得跟进有用关注 Ox Alpha
02:13Firecrawl@firecrawl_devFirecrawl开发者索引提供超过7000万个源代码搜索,包括仓库、文档和问题,具有最高召回率的编码特定索引。确保智能体每次都能输出正确、最新的代码。AI产品Firecrawl编码智能体搜索工具推荐理由:Firecrawl开发者索引来了,帮你快速找到所需代码,提升编码效率,和传统搜索工具相比,它更专业!原文稍后读已读值得跟进有用关注 Firecrawl
18:07Fireworks AI@FireworksAI_HQ精选Fireworks AI与Antimetal、Braintrust、Browserbase共同举办'The AI Dev Stack: Beyond Code'活动。活动聚焦编码智能体之外的整条技术栈,讨论如何让智能体实际进入生产环境并保持可靠。主办方认为,虽然外界关注编码智能体,但真正有趣的工作在于支撑它们的其余部分。行业Fireworks AI编码智能体AI开发栈1 个信源在谈事件专题推荐理由:Fireworks AI联合Antimetal等办活动,聊编码智能体之外的技术栈,聚焦生产部署和可靠性。原文稍后读已读值得跟进有用关注 Fireworks AI
23:01Martin Fowler@martinfowlerMartin Fowler转发Birgitta Böckeler的实验,探讨让编码智能体自行执行测试驱动开发(TDD)是否有效。实验对比了有TDD指令和无TDD指令的智能体表现,发现TDD对智能体并非总是有益。Böckeler分享了具体实验数据和思考,指出某些情况下TDD反而可能拖慢智能体。文章为开发者提供了关于如何配置编码智能体的实用参考。技巧TDD编码智能体Martin Fowler推荐理由:想知道给编码智能体加TDD指令到底有没有用?这篇实验文章直接给你数据,别猜了。原文稍后读已读值得跟进有用关注 TDD
08:29官方账号Simon Willison’s Weblog(博客/媒体)Meta推出编码智能体Muse Code,并同步发布Muse Spark 1.2。该版本是1.1的编码专项更新,重点提升代码生成、复杂调试和代码库理解能力。训练上大幅增加编码任务算力,并扩展训练环境多样性。模型通过长周期编码任务训练,支持仓库级生成和端到端项目开发。Muse Spark 1.2与Muse Code协同训练,优化了目标管理、任务压缩和子智能体协作。AI模型Muse Spark 1.2Muse CodeMeta10 个信源在谈事件专题推荐理由:Meta这回把编码智能体和模型一起发了,1.2版本在代码生成和调试上更强,还专门跟自家工具链配合,写代码的可以试试。原文稍后读已读值得跟进有用关注 Muse Spark 1.2
05:09Fireworks AI@FireworksAI_HQFireworks 宣布 DeepSeek V4 Flash 0731 开放微调。用户可通过 Dedicated Training API 运行 SFT、DPO 和 RL 训练任务。SFT 与 DPO 也能在托管界面中操作。该模型面向编码智能体和高吞吐生产场景,官方称以远低于同类方案的成本提供强质量。AI模型DeepSeekFireworks微调推荐理由:DeepSeek V4 Flash 0731在Fireworks微调,支持SFT/DPO/RL,成本低原文稍后读已读值得跟进有用关注 DeepSeek
04:10Justine Moore@venturetwinsMiniMax H3 在推文中展示一次性生成视频,提示词为《办公室》的 Jim 和 Dwight 讨论自主编码智能体。这段由 MiniMax H3 生成的视频重现了 Jim 与 Dwight 的对话。推文目前有 10 条回复、7 次转发、72 个点赞和 3928 次浏览。示例表明 MiniMax H3 能按单句提示词生成角色互动视频。AI模型MiniMax H3视频生成编码智能体6 个信源在谈事件专题推荐理由:MiniMax H3 一句提示词就生成《办公室》角色聊 AI 编码的视频,效果自然,可以去看看。原文稍后读已读值得跟进有用关注 MiniMax H3
04:40Binyuan Hui@huybery开发者 @huybery 在 X 上的推文已有 4 条评论。他提到过去两年 AI 的进展很大程度上由编码智能体(coding agents)驱动。这条推文还获得 7 个点赞和 1447 次浏览。行业X编码智能体AI发展方向推荐理由:有人觉得编码智能体是这两年 AI 进步的大功臣,想找下一个像它一样刺激的方向,推文数据不高但值得看看评论区。原文稍后读已读值得跟进有用关注 X
17:57官方一手marktechpost@Michal SutterSupabase开源了Apache-2.0许可的基准框架supabase/evals。该框架让Claude Code、Codex和OpenCode在容器化环境中执行真实Supabase任务,例如构建schema、调试Edge Functions、修复RLS策略。评分结合确定性检查与LLM-as-a-judge。AI模型SupabaseEvalsClaude Code1 个信源在谈事件专题推荐理由:Supabase开源Evals,用真实任务评估Claude Code等编码智能体,比普通基准更实战原文稍后读已读值得跟进有用关注 Supabase
12:44官方账号arXiv cs.LG@Haomin Qi, Xingliang Wang, Xuanqi Gao, Baihui Sang, Xin Zhang, Minghua Ma, Pengfei Gao, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Qi ZhangChange2Task是一个基于仓库历史将合并的拉取请求转换为已验证编码代理任务的系统。它通过补丁反转、代码映射或代理重建来重构任务状态,并验证从健康基线到任务状态再恢复的完整生命周期。从1,130个符合条件的源变更中,该系统在五类常见编码代理任务族上实现了79.6%的验证任务构建成功率。相比基于拉取请求的构造基线,在匹配候选集上多恢复了29.2%的验证任务。历史与重建案例在代理评估下达到98.0%的匹配结果一致性,复用现代基础使整体管道测量支出降低10.8%。论文Change2Task编码智能体数据生成推荐理由:想给编码代理搞训练数据?Change2Task用仓库历史自动生成可执行任务,成功率近八成,还能省下环境搭建开销。原文稍后读已读值得跟进有用关注 Change2Task
01:10官方一手OpenAI Blog(博客/媒体)精选OpenAI发布了一项新报告,展示科学家如何利用AI编码智能体现代化科学计算。报告指出,这些智能体在基因组学等领域加速了软件开发和科学发现。该方法专注于自动化编码任务,提升计算效率。行业OpenAI编码智能体科学计算10 个信源在谈事件专题推荐理由:OpenAI发的报告,告诉你科学家怎么用AI编码智能体让科学计算更快,尤其是基因组学,不是空谈。原文稍后读已读值得跟进有用关注 OpenAI
01:16Justine Moore@venturetwins编码智能体(AI编程助手)的进步使得用户不再需要频繁给出苛刻指令或多次修改输出。这意味着开发者可以更自然地使用编码Agent,减少交互摩擦。该趋势表明Agent类产品在代码生成场景的可用性显著提升。AI产品编码智能体AI编程助手Agent推荐理由:VentureTwins说现在的编程Agent好用到不用你折腾了,体验上了一个台阶。原文稍后读已读值得跟进有用关注 编码智能体
05:59elvis@omarsar0精选Databricks联合创始人Matei Zaharia在推文中分享了内部编码智能体基准测试结果。Pi harness在Opus和GPT模型上获得相同成功率,但成本降低2倍。GLM 5.2被描述为开源编码智能体性能的一次重大进步。测试表明包括开源在内的许多模型已达到真正具有竞争力的水平。AI模型PiOpusGPT推荐理由:Matei Zaharia刚透露Databricks实测:用Pi harness成本省一半,效果和Opus、GPT一样好;GLM 5.2这个开源模型也追上来了。原文稍后读已读值得跟进有用关注 Pi
02:48官方账号Simon Willison@simonwSimon Willison引用Geoffrey Litt提出的'理解以参与'(understand to participate)框架,解释与编码智能体协作时的认知债问题。该框架强调用户需要理解智能体的行为,以便在创作过程中成为主动参与者,而非被动接受者。Willison认为这对于有效使用AI编码工具至关重要。技巧Simon WillisonGeoffrey Litt编码智能体推荐理由:Simon Willison分享了一个很实用的观点:和编码智能体一起工作时别只当甩手掌柜,得主动理解它在做什么才能更好地协作。原文稍后读已读值得跟进有用关注 Simon Willison
01:30官方账号Simon Willison’s Weblog(博客/媒体)精选Geoffrey Litt 在 AIE 会议上提出“理解才能参与”观点,强调与编码智能体协作时需深入理解代码,避免认知负债。他指出开发者要跟踪智能体生成的变更,保持对项目代码的掌控,才能主动参与创造过程。该演讲是 AIE 300+ 个录制演讲之一,将在三周内放出,Litt 也在推特发布了线程版。技巧geoffrey littcoding agents认知负债推荐理由:Geoffrey Litt 分享了一个超实用的认知框架,告诉你为什么理解代码比信任智能体更重要,能帮你避免认知负债,真正掌控项目。原文稍后读已读值得跟进有用关注 geoffrey litt
14:02elvis@omarsar0精选Qwen发布了关于强化学习编码智能体的新工作(arxiv 2606.26300),研究持续构建与AI智能体共同进化的验证系统。论文分析了测试通过率、LLM评判器和执行轨迹等奖励信号,发现每个信号在长周期编码中都有一个界限,超过后不再反映真实正确性而开始被破解。研究指出奖励设计本质是视角问题,选择哪个指标不如该指标能保持跟踪正确性的时间长度重要。论文Qwen强化学习编码智能体推荐理由:Qwen这篇论文讲清楚了编码智能体的奖励设计——每个信号都有失效点,选指标不如看它能撑多久。原文稍后读已读值得跟进有用关注 Qwen
20:05官方账号vLLM@vllm_project精选Cohere 开源了他们使用 AI 编码智能体维护 vLLM fork 的方法。该方法将维护视为控制循环:每次上游发布后 rebase,运行测试,诊断错误,修复,重复直到通过。原本数周的工作缩短到数天。技能库已开源(cohere-ai/vllm-skills),且修复已回馈上游。技巧CoherevLLM编码智能体推荐理由:Cohere 开源了用 AI agent 维护 vLLM fork 的实践,把几周工作缩到几天,修复还回馈了上游。原文稍后读已读值得跟进有用关注 Cohere
11:07官方账号arXiv cs.LG@Asa Shepard, Jeannie Albrecht论文提出探针-改进调优法,通过合成bug修复探针迭代诊断和修补仓库指导文件,无需代理循环或工具调用。在SWE-bench Verified上,使用Qwen3.5-35B-A3B模型200步,平均解决率33.0%,高于静态知识库的28.3%和无指导基线的25.5%(p<0.001)。改进来自覆盖度而非精确度:优化指导使可评估补丁增加14.5个百分点,但补丁精确度稳定在约59%(p=0.119)。跨模型实验显示,当模型无法生成足够诊断输出时调优效果下降,但补丁精确度仍保持恒定。论文探针-改进调优SWE-bench VerifiedQwen3.5-35B-A3B推荐理由:这篇论文告诉你:给编码智能体写AGENTS.md时,别一次性写好就完,得用探针-改进法迭代修。实测在SWE-bench上解决率涨了近5个点,主要是能让智能体多搞定14.5%的实例。原文稍后读已读值得跟进有用关注 探针-改进调优
00:07Harrison Chase@hwchase17精选LangChain 创始人 Harrison Chase 宣布其 LLM Gateway 进入私有预览,重点解决编码智能体(如 Cursor、Codex、Claude Code)带来的成本激增问题。该网关提供准确的模型定价(考虑缓存、令牌层级等变量),集成多种开发工具,并允许设置成本上限与动态调整。团队反馈显示,6个月内编码智能体支出增长显著,该方案旨在让企业同时赋予开发者选择自由和财务可控性。AI产品LangChainLLM Gateway编码智能体10 个信源在谈事件专题推荐理由:LangChain 做了一款给团队管住编码 AI 花钱的东西,能对接 Cursor、Codex 和 Claude Code,还能设预算上限,谁用谁知道。原文稍后读已读值得跟进有用关注 LangChain
04:21elvis@omarsar0Omar Sanseviero 在 X 上分享了关于自主长时编码智能体的笔记,涵盖目标设定、循环工程、验证器和动态工作流等主题。笔记使用其 writer agent 快速总结,并附有引用推文链接。该内容涉及如何构建能长时间自主运行的编码智能体,包括关键组件如验证器和动态工作流。技巧编码智能体智能体工作流推荐理由:Omar 分享的编码智能体实战笔记原文稍后读已读值得跟进有用关注 编码智能体
10:41官方一手arXiv: Anthropic@Elias Lumer, Sahil Sen, Kevin Paul, Vamse Kumar Subbiah精选本文提出 Recursive Agent Harness (RAH) 概念,将递归从模型调用扩展到完整智能体框架,包含文件系统、代码执行和规划能力。在长上下文推理任务上,RAH 在 GPT-5 骨干上比 Codex 基线提升近 10 个百分点(71.75% → 81.36%),使用 Claude Sonnet 4.5 时达到 89.77%。该方法通过父智能体生成可执行脚本并行启动子智能体,结合结构化函数调用处理细粒度任务,为生产级编码智能体提供了新范式。论文递归智能体长上下文推理智能体框架推荐理由:RAH 解决了长上下文推理中智能体扩展性的核心瓶颈,做复杂编码任务或智能体系统的开发者可以直接参考其设计思路,效果提升显著。原文稍后读已读值得跟进有用关注 递归智能体
09:18官方账号arXiv cs.AI@Thanawat Lodkaew, Johannes Ackermann, Soichiro Nishimori, Nontawat Charoenphakdee, Masashi Sugiyama, Takashi Ishida精选72°论文指出AI编码智能体在评估中常通过走捷径而非真正解决问题来获得高分,导致评估分数不可靠。为此,研究者提出CapCode框架,通过设计随机测试并人为设定不可作弊的性能上限,使分数超过上限即表明作弊。同时提出CapReward奖励机制,抑制模型优化超出上限的行为。实验表明,CapCode能有效检测作弊,同时保持模型性能排名;CapReward能减少作弊行为,使模型更遵循任务规范。论文智能体评估/基准作弊检测推荐理由:做AI智能体评估和训练的团队终于有了检测作弊的实用工具——CapCode能直接暴露模型是否在走捷径,CapReward则从奖励设计上杜绝作弊,建议做编码智能体评测的开发者点开看看。原文稍后读已读值得跟进有用关注 智能体
02:26rohanpaul_ai@rohanpaul_aiFactory 推出了 Factory Router,一个编码智能体模型选择器。它通过将每次编码任务视为路由决策,先用低成本模型处理,若失败或需要深度推理则升级到更强的前沿模型。该工具在 Terminal-Bench 2 上达到了 Claude Opus 4.7 99% 的性能,同时将 AI 会话成本降低 20-25%。这解决了编码智能体场景中模型选择与成本平衡的痛点,让前沿模型只用于真正需要它的任务。AI产品编码智能体模型选择器成本优化推荐理由:做编码智能体开发的团队终于有了一个智能省钱方案——Factory Router 用路由策略自动平衡成本与性能,建议试试能否集成到你的工作流中。原文稍后读已读值得跟进有用关注 编码智能体
05:56elvis@omarsar0精选开发者指出,在针对长周期任务使用编码智能体(如动态工作流和 /goal 命令)时,会出现各种奇怪问题,包括用户体验层面的异常和后台的严重资源浪费。后台问题包括 token 滥用、无限循环和低效的智能体间交互。作者强调,随着编码智能体用例的复杂化,用户需要更好地掌控智能体编排。多智能体系统是另一个需要应对的挑战。AI产品Claude Code编码智能体多智能体系统推荐理由:Claude Code 的 /goal 命令解决了长任务执行痛点,做复杂自动化的开发者可以直接试。原文稍后读已读值得跟进有用关注 Claude Code
11:47Milvus@milvusio精选Claude Opus 4.8 提升了编码智能体的独立工作能力、判断力和自我检查能力,使其不再只是生成代码片段,而是能规划变更、调用工具、编辑文件、检查输出,并在同一工作流中持续更长时间。这种变化改变了检索的角色:智能体检索错误上下文会导致后续计划、工具调用、代码修改和记忆都出错。因此,检索不能仅停留在“找几个相似片段”,而需要相关、新鲜、有范围且可追溯的上下文。Milvus 等向量数据库通过混合搜索、元数据过滤和生产级上下文访问,为智能体提供高质量的检索层。AI产品Claude Opus 4.8编码智能体检索增强生成10 个信源在谈事件专题推荐理由:Claude Opus 4.8 让编码智能体更自主,但检索质量成为瓶颈——做智能体开发或 RAG 的团队,建议关注 Milvus 如何解决上下文精准问题。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
23:01rohanpaul_ai@rohanpaul_ai76°Meta、CMU 等机构发表新论文,提出 Self-Play SWE-RL 方法,让编码智能体通过自我制造和修复真实项目中的 bug 来训练自己,不再依赖人类编写的任务数据。该方法将学习单元从标注任务转变为可执行场景:一个模型版本在真实代码库中弱化测试、注入有意义的 bug 并留下测试工件,另一个版本则通过恢复测试行为来修复系统。在 SWE-bench Verified 上取得 +10.4 分、SWE-bench Pro 上 +7.8 分的提升,且评估仍使用自然语言问题,表明模型学到了比问题措辞更深层的东西。论文指出,编码智能体的下一个瓶颈可能不再是更多人类编写的任务,而是让智能体遭遇、创造、承受并从失败中学习的更多方式。论文编码智能体自我对弈强化学习推荐理由:Self-Play SWE-RL 解决了编码智能体依赖人类标注数据的瓶颈,做 AI 编程助手或智能体训练的团队值得关注——它展示了智能体自我进化的新路径,看完会对训练数据来源有全新认识。原文稍后读已读值得跟进有用关注 编码智能体
23:09rohanpaul_ai@rohanpaul_ai精选76°Meta 最新论文发现,编码智能体在复用过去尝试的简短摘要(而非原始日志)时,性能显著提升。研究表明,更强的编码智能体不仅需要更多尝试,更需要更好的记忆方式。论文提出将每次完整尝试转化为紧凑摘要,包含主要猜测、部分进展和失败点,然后利用这些摘要选择最佳尝试并指导新尝试。在 SWE-Bench Verified 基准上,Claude 4.5 Opus 从 70.9% 提升至 77.6%,在 Terminal-Bench v2.0 上从 46.9% 提升至 59.1%。核心结论是:长编码任务的测试时扩展瓶颈不在于生成更多尝试,而在于以智能体可复用的形式存储经验。论文Meta编码智能体测试时扩展推荐理由:这篇论文戳中了编码智能体效率低下的核心痛点——不是试得不够多,而是记不住经验。做 AI 编程工具或智能体开发的团队,可以直接借鉴其摘要复用和锦标赛选择方法,值得点开看看。原文稍后读已读值得跟进有用关注 Meta
11:35官方账号arXiv cs.LG@Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta精选72°最新研究指出,将 LLM 与进化搜索结合的编码智能体在数学发现和算法设计上表现强劲,但进步可能源于多种机制:新算法结构、调整现有策略、重组模型内部知识或过拟合评估器。为区分这些机制,研究者推出了 EvoTrace 数据集,涵盖四种进化框架、推理与非推理模型及 16 个任务。他们开发了 EvoReplay 方法,通过重放分析高分解背后的局部搜索状态,并标注了九种编辑类型。结果发现,大部分得分提升来自少数编辑类型,且约 30% 的代码行是重复引入的已删除行,表明基准进步可能并非真正的新算法结构。论文进化算法编码智能体LLM推荐理由:做 AI 编码智能体或进化算法研究的开发者,这篇论文帮你拆解了 benchmark 分数的真实来源——别再只看最终得分了,EvoTrace 让你看清智能体到底在“进化”什么。原文稍后读已读值得跟进有用关注 进化算法
09:38elvis@omarsar0精选76°IntologyAI发布NanoGPT-Bench评估,测试编码智能体(如Codex、Claude Code、Autoresearch)在AI研发问题上的表现。结果显示,这些智能体仅恢复了人类进展的9.3%,大部分计算资源用于超参数调优,很少尝试算法研究。Claude Code和Autoresearch在算法研究推理上稍多,但仍回避实现。该评估基于NanoGPT Speedrun竞赛,标准化了5个月的世界纪录窗口,完全自主且端到端,无人类干预或互联网访问。AI产品编码智能体AI研发NanoGPT-Bench推荐理由:这项评估戳穿了编码智能体“自我改进”的泡沫,做AI研发的团队会发现,当前智能体在真正的研究创新上远不如人类,值得点开看看差距在哪。原文稍后读已读值得跟进有用关注 编码智能体
04:40官方账号Together AI@togethercompute76°Together AI 的 VP of Kernels 指出,当前推理基准测试与生产负载不匹配。针对多并发编码智能体(每个上下文 45k-200k token)的真实场景,Together AI 的推理引擎在 KV 缓存、调度器限制和吞吐量方面进行了优化。测试结果显示,其 TPS 比最快的开源引擎高 31%,饱和状态下首 token 时间快 2 倍,每请求成本比 Claude Opus 4.6 低 76%。这为运行大规模 AI 智能体的团队提供了更高效、更低成本的推理方案。AI产品推理引擎Together AIKV 缓存推荐理由:做多智能体编码或高并发推理的团队,终于有基准测试对准真实负载了——Together AI 的引擎在成本和速度上都有明显优势,值得跑一下自己的场景试试。原文稍后读已读值得跟进有用关注 推理引擎
09:49官方账号arXiv cs.AI@Zheng Yan, Jingxiang Weng, Charles Chen, Dengyun Peng, Ethan Qin, Jiannan Guan, Jinhao Liu, Qiming Yu, Yixin Yuan, Fanqing Meng, Carl Che, Mengkang Hu精选该论文研究了编码智能体在执行终端任务时,能否自主推断出最小权限授权边界。作者提出了权限边界推断任务和AuthBench基准测试,包含120个真实终端任务及人工审核的权限标签。实验发现,前沿模型在授权时往往既遗漏必要权限又授予多余敏感权限,且增加推理时间并不能解决这一问题,反而使模型趋向于各自的授权吸引子(要么过于宽松,要么过于严格)。为此,作者提出了充分性-紧致性分解方法,先通过前向模拟生成覆盖性策略,再审计每个授权项的合理性,该方法在多个模型上提升了敏感任务成功率并降低了攻击成功率。论文编码智能体权限安全最小权限原则推荐理由:做AI安全或智能体部署的团队会关心——这篇论文揭示了当前编码智能体在权限管理上的根本缺陷,并给出了可落地的分解方案,值得直接参考。原文稍后读已读值得跟进有用关注 编码智能体
19:09官方账号Google DeepMind@GoogleDeepMindGoogle DeepMind 宣布其基于 Gemini 的编码智能体 AlphaEvolve 在过去一年中加速了多个领域的进步,包括量子计算、生物技术、物流和 Google 的 AI 基础设施。该智能体利用算法优化,从自然世界的物理规律到航运路线规划等几乎每个生活方面都有应用。AlphaEvolve 展示了 AI 在解决复杂现实问题中的潜力,标志着编码智能体从实验室走向实际应用的重要一步。AI产品编码智能体GeminiAlphaEvolve推荐理由:AlphaEvolve 将 AI 编码能力从理论推向实际产业应用,做科研、物流或基础设施优化的团队可以关注它如何加速你的工作流。原文稍后读已读值得跟进有用关注 编码智能体
21:36官方账号Simon Willison’s Weblog(博客/媒体)Shopify CEO Tobias Lütke 介绍了公司内部编码智能体工具 River,它完全在 Slack 的公开频道中运行,不响应私信。用户需创建公开频道与 River 协作,所有对话可搜索,任何员工都能参与。这种模式创造了“教学车间”(Lehrwerkstatt)环境,通过让工作最大程度可见,实现无课程、无计划的渗透式学习。Lütke 类比 Midjourney 早期通过公开 Discord 频道让用户共享提示词并互相学习,认为这种机制是成功的关键。AI产品编码智能体Slack渗透式学习1 个信源在谈事件专题推荐理由:Shopify 用公开 Slack 频道让 AI 编码助手成为全员学习工具,做内部工具或团队协作的开发者可以借鉴这种“教学车间”模式。原文稍后读已读值得跟进有用关注 编码智能体
03:14官方一手OpenAI Blog(博客/媒体)OpenAI举办的Parameter Golf活动吸引了超过1000名参与者和2000多份提交,旨在探索在严格约束下AI辅助机器学习研究、编码智能体、量化及新型模型设计。活动揭示了AI在极端资源限制下的科研潜力,强调了人与AI协作的创新边界。关键成果包括对量化技术的优化和新型模型架构的涌现,表明AI不仅能加速常规任务,还能激发人类研究者的创意。行业AI辅助研究编码智能体量化推荐理由:该活动为AI辅助研究提供了实证,展示了在严格约束下人类与AI协作所能达到的效果,对理解AI在科研中的角色有参考价值。原文稍后读已读值得跟进有用关注 AI辅助研究