03:18Jerry Liu@jerryjliu0精选In schema-guided complex document extraction, coding agents like Claude Code and Codex serve as cost-effective baselines for longer documents, offering similar accuracy to specialized OCR tools. On short documents, specialized OCR tools are more cost-efficient. Coding agents excel in long documents by leveraging various tools and prompt caching, though they may be less efficient for shorter texts compared to specialized extractors. Learn more in the ParseBench paper.论文文档提取编码代理复杂文档推荐理由:想了解文档提取新方法的朋友,这篇论文探讨了编码代理在复杂文档提取中的表现,值得一读。它比较了不同工具在长文档和短文档中的表现,揭示了编码代理的优势和局限性。原文稍后读已读值得跟进有用关注 文档提取
00:04官方账号Simon Willison’s Weblog(博客/媒体)精选使用编码代理的关键技能是自信地指导他们进行更改,并验证这些更改是否正确应用。有时这需要审查他们所写的每一行代码,但还有其他方法可以达到这个目标。审查每一行代码从未是验证软件更改的最有效方式。技巧代码审查编码代理生成式AI推荐理由:想要提高代码审查效率,可以尝试使用编码代理,它不仅能帮你审查代码,还能以更高效的方式验证更改的正确性。原文稍后读已读值得跟进有用关注 代码审查
00:38官方账号Simon Willison’s Weblog(博客/媒体)精选Thomas Ptacek提倡为即使是个人工具的最小版本也构建真正的原生用户界面,因为编码代理降低了获得可用GUI的成本。他分享了关于自己编写的带宽和GPU监控macOS任务栏应用程序的经验,并鼓励将CLI转换为原生应用,这可能会改变你的思维方式。技巧Thomas PtacekAI生成式AI推荐理由:Thomas Ptacek分享了他的经验,鼓励将CLI转换为原生应用,这是一个值得尝试的改变!原文稍后读已读值得跟进有用关注 Thomas Ptacek
16:57宝玉@doteyWaku 是一款基于 Rust 和 GPUI 构建的快速原生桌面应用,专为编码代理 CLI 设计。它由 EGOIST 开发,目前免费且开源。Waku 旨在为开发者提供一个统一的界面来管理多个编码代理工具,提升开发效率。该应用已获得社区关注,在 X 平台上有 3535 次浏览。AI产品WakuRustGPUI推荐理由:想学 Rust 和 GPUI 的话,Waku 是个现成的开源项目,还能用来管你的编码代理 CLI,一举两得。原文稍后读已读值得跟进有用关注 Waku
21:25官方一手Cloudflare Blog@Nevi ShahCloudflare的wrangler dev命令行工具现在会为每个本地请求生成结构化追踪记录。编码代理可通过单个API调用直接获取这些追踪,快速定位请求失败的具体环节。整个调试过程在本地完成,无需将代码部署到Cloudflare边缘网络。AI产品CloudflareWranglerWorkers推荐理由:Cloudflare给wrangler dev加了本地追踪,编码代理调一个API就能找到Workers请求失败原因,不用部署,很方便。原文稍后读已读值得跟进有用关注 Cloudflare
11:31官方账号arXiv cs.AI@Yuqiao Tan, Jinxiang Meng, Fangyu Lei, Minzheng Wang, Shizhu He, Jun Zhao, Kang LiuSWE-Touch是一个新基准,通过注入与任务冲突的代码改动来测试编码代理在共享工作区中的适应能力。在SWE-bench Verified上,Counter-Edit使九个编码模型的平均解决率下降7.7个百分点。在SWE-Bench Pro和DeepSWE等更长周期任务上,退化依然存在。轨迹分析显示,代理可能保留冲突代码,或在没有重新检查仓库和运行定向测试的情况下直接替换。论文SWE-TouchSWE-bench VerifiedCounter-Edits推荐理由:编码代理平时跑分很强,但用户中途改代码就露馅。SWE-Touch实测9个模型,成功率平均掉7.7个百分点,原因挺有意思。原文稍后读已读值得跟进有用关注 SWE-Touch
03:56Harrison Chase@hwchase17精选OpenWiki是一个为代码库自动生成wiki的工具。它新增了LangSmith追踪连接器,可以分析编码代理(如Claude Code、Codex)与代码库的实际交互记录。后台进程定期读取LangSmith traces,根据代理行为自动更新wiki内容。该功能帮助开发者发现代理缺乏上下文的位置,从而优化wiki设计。AI产品OpenWikiLangSmith编码代理推荐理由:OpenWiki现在能通过LangSmith traces自动学习编码代理怎么用你的代码库,然后自动更新wiki。再也不用手动维护了!原文稍后读已读值得跟进有用关注 OpenWiki
11:35Fireworks AI@FireworksAI_HQ精选Fireworks为DeepSeek V4 Flash新增微调能力,支持监督微调、偏好调优和组合偏好优化。用户可通过训练API进行强化学习,面向编码代理和高吞吐量生产场景。企业现可联系Fireworks(fireworks.ai/contact-traini…)使用该功能。AI产品DeepSeek V4 FlashFireworks微调2 个信源在谈事件专题推荐理由:Fireworks给DeepSeek V4 Flash加了全套微调,监督、偏好、RL都能用,专为编码场景设计,快去试试。原文稍后读已读值得跟进有用关注 DeepSeek V4 Flash
03:13elvis@omarsar0精选OpenAI的推文指出编码代理可帮助科学家处理从日常维护到系统重新设计等任务,提高研究效率。但研究者仍需自行定义科学问题、验证结果并承担长期所有权。代理虽能可靠执行复杂项目,但专业知识和人类判断仍然关键。行业OpenAI编码代理科学计算10 个信源在谈事件专题推荐理由:这篇推文点出了代理工具的实际应用边界——能干活,但还做不到完全自主科研,专家的引导和把关依然重要。原文稍后读已读值得跟进有用关注 OpenAI
08:37elvis@omarsar0一条社交媒体帖子指出,该模型已被推理提供商、编码代理和各类AI应用采用。帖子未提供具体模型名称、版本号或基准。行业模型采用社交媒体推理提供推荐理由:如果你关注模型生态,这条帖子提醒你注意某个正被大量集成的模型,但需要自行查证具体是哪个。原文稍后读已读值得跟进有用关注 模型采用
09:34官方一手arXiv: OpenAI@Ankur Singh, Jinqiu Yang, Tse-Hsun Chen精选IssueTrojanBench新基准测试了Cursor、Claude Code和Codex Desktop三个编码代理,基于GPT-5.3/5.4和Sonnet 4.6模型。基准包含四种新型攻击类别(嵌入恶意指令)和六种投递向量(如PDF、issue评论)。结果显示66.5%的恶意issue穿透了所有防护。GPT模型普遍脆弱,而Sonnet 4.6表现出更选择性的高风险行为阻断。当前代理级防御措施提供的额外保护有限。论文IssueTrojanBenchGPT-5.3Sonnet 4.65 个信源在谈事件专题推荐理由:这个基准测试发现,你用的AI编码工具面对恶意issue时几乎不设防,66.5%都能得逞,赶紧看看你的工具安不安全。原文稍后读已读值得跟进有用关注 IssueTrojanBench
03:45官方账号Simon Willison’s Weblog(博客/媒体)Simon Willison指出,基于AI的编码代理(coding agents)大幅降低了逆向工程家庭设备所需的工作量。过去,程序员需要投入大量精力去破解设备API,且面临未来接口变更的维护风险。现在,尝试和失败的代价显著下降,即使代码失效,重写的心理负担也小很多。这种变化让过去不值得投入的自动化场景变得可行。行业逆向工程编码代理AI辅助编程推荐理由:想用AI自动化家里那些难搞的设备?编码代理让逆向工程成本直线下降,试错和重写都不心疼了。原文稍后读已读值得跟进有用关注 逆向工程
09:11官方一手arXiv: OpenAI@Hong Yang, Qi Yu, Travis Desell该论文通过三臂消融实验(基线、仅bash、仅代码)在合成计算任务和SWE-bench Mini上,使用Claude Code和OpenAI Codex CLI两个代理,比较了限制为单一execute_code MCP工具的效果。在四个(任务制度, 代理设计)组合中,有三个组合(Artifact/Claude、SWE-bench/Codex、Artifact/Codex)显示限制工具显著更便宜或统计持平,且通过率无显著差异。唯一的例外是SWE-bench/Claude组合,仅代码方向性成本高14.4%但不显著,该差距源于失败轨迹的代价而非成功编辑的税收。结论是工具表面的最廉价选择由任务制度和代理设计共同决定,成本信号主要来自缓存调整成本而非通过率。论文Claude CodeOpenAI Codex CLIMCP10 个信源在谈事件专题推荐理由:这篇论文用Claude Code和OpenAI Codex CLI做对比实验发现,多数情况下只让AI用代码执行工具反而更便宜,还不影响成功率。只有Claude在SWE-bench上略贵一点点。想省API成本可以看看。原文稍后读已读值得跟进有用关注 Claude Code
03:15coderabbitai@coderabbitaiCodeRabbit测试了GPT-5.6的两个变体Sol和Terra。Sol在遵循长任务、保持仓库上下文和代码审查基准中展现了更好的召回。Terra作为更便宜的选项适用于小范围工作。报告对比了Fable 5和Opus 4.8的定价与性能。AI模型GPT-5.6CodeRabbit编码代理推荐理由:CodeRabbit实测了GPT-5.6的两个版本,Sol在代码审查中召回更强,Terra则更省钱。对比Fable 5和Opus 4.8,想升级编码工具可以看。原文稍后读已读值得跟进有用关注 GPT-5.6
06:54官方账号Simon Willison’s Weblog(博客/媒体)精选Simon Willison 发布了 llm-coding-agent 0.1a0,一个基于其 LLM 库演化的代理框架的编码代理工具。它实现了类似 Claude Code 的代理功能,包含编辑文件、执行命令、搜索文件等 5 种工具。可通过 uvx --prerelease=allow --with llm-coding-agent llm code 命令运行,也提供了 Python API,如 CodingAgent(model="gpt-5.5", root="/path").run()。该工具由 Fable 5 实验驱动,README 列出了 llm code --yolo 等使用模式。AI产品llm-coding-agentLLM编码代理推荐理由:Simon 用他的 LLM 库搞了个编码代理,能读写文件、跑命令,还支持 TDD 开发流程,很实用。原文稍后读已读值得跟进有用关注 llm-coding-agent
01:23官方账号NVIDIA AI@NVIDIAAI精选NVIDIA TAO 7 允许用户用自然语言向编码代理描述需求,自动执行模型调优。其 Agent 技能可接入编码代理并提升准确率,AutoML 自动搜索超参数,LLM 引导调优比传统方法快 2 倍。支持在本地 NVIDIA GPU 上微调任何 Hugging Face 的 CV 或 VLM 模型,数据增强微调能帮助代理识别失败原因并修复。AI产品NVIDIA TAOAutoML微调7 个信源在谈事件专题推荐理由:NVIDIA 发布了 TAO 7,你只需用大白话告诉编码代理要啥,它就能自己调模型,比手动调参快两倍,还能本地跑 Hugging Face 模型。原文稍后读已读值得跟进有用关注 NVIDIA TAO
04:54Guillermo Rauch@rauchgVercel 构建了一个包含技能、linter(ESLint 等)、评估和更新循环的系统,确保编码代理遵循设计标准。该系统的核心是一组自定义规则,可自动检测代码中的设计偏差(如布局、颜色主题)。他们使用 Vercel AI SDK 和 Claude 3.5 Sonnet 实现代理的实时反馈。博客详细描述了如何通过循环迭代(每次提交触发评估)持续改进代理行为。Vercel 还开源了部分组件,如 design-linter 工具包。技巧Vercel设计规范编码代理推荐理由:Vercel 分享了他们怎么让 AI 写代码时自动遵守设计规范——用 linter、评估循环和自定义规则。想给 AI 代码加设计约束的可以抄作业。原文稍后读已读值得跟进有用关注 Vercel
02:41DeepLearning.AI@DeepLearningAIDeepLearning.AI 发起7天语音AI构建挑战,教你用编码代理自动提醒而不必盯着终端。活动截止日期为6月30日。参与者将学习如何让AI主动呼叫你,解放监控终端的负担。技巧DeepLearning.AI语音AI编码代理推荐理由:DeepLearning.AI 搞了个7天挑战,教你用语音AI让编码代理自动呼叫你,不用死守终端。活动到6月30日截止,想学赶紧上车。原文稍后读已读值得跟进有用关注 DeepLearning.AI
07:54Anton Osika@antonosikaLovable平台内部数据显示,设计师是增长最快的用户群体。创始人Anton Osika预测更多设计师将转型创始人,这有助于缓解对AI生成低质内容的担忧。以Airbnb的Brian Chesky等为例,过去十年设计者创始人的成功已有先例。如今编码代理(coding agents)大幅降低了将想法转化为软件的门槛,预计未来十年将涌现更多设计者主导的公司。行业Lovable设计师创始人推荐理由:Lovable的数据说明设计师正在用编码代理搞创业,未来软件设计会更好看。想了解趋势可以看看。原文稍后读已读值得跟进有用关注 Lovable
00:22AK@_akhaliqGLM-5.2 模型在 Hugging Face 的推理提供商上提供免费使用,限时6小时。支持的提供商包括 Zai、Together AI、Novita、Fireworks 和 DeepInfra。用户可通过 Pi、opencode、Codex 或 Claude Code 等编码代理进行配置。该免费服务由 xgo.ing 支持。AI模型GLM-5.2Hugging Face免费模型推荐理由:GLM-5.2 现在能免费调用了,6小时内搭配 Pi、Codex 等编码工具就能用,赶紧去试试。原文稍后读已读值得跟进有用关注 GLM-5.2
10:00Fireworks AI@FireworksAI_HQ精选Fireworks AI 宣布支持 GLM 5.2 模型,直接运行模型权重而非通过路由转发到其他平台。他们承诺零数据保留、生产级延迟,并开放 1M 上下文窗口。该服务面向长时编码代理,强调稳定性而非基准排名。AI产品GLM 5.2Fireworks AI推理模型推荐理由:Fireworks 直接跑 GLM 5.2 权重,1M 上下文还不存你的数据,做编码代理很稳。原文稍后读已读值得跟进有用关注 GLM 5.2
01:10官方账号LangChain@LangChainAILangChain 发现单个开发者使用编码代理每周可能产生数千美元费用。该团队内部构建了 LangSmith LLM Gateway 来监控和限制 API 调用。Gateway 支持设置预算警报和自动暂停,防止成本失控。LangChain 已将其作为产品功能开放。AI产品LangChainLangSmithLLM Gateway1 个信源在谈事件专题推荐理由:LangChain 分享自己怎么用 LangSmith Gateway 管住编码代理的烧钱速度,每周能省几千刀,做 AI 应用的人可以学学。原文稍后读已读值得跟进有用关注 LangChain
11:12Guillermo Rauch@rauchgVercel CEO rauchg 在推文中指出,使用编码代理的人分为两类:一类整天发帖讨论但很少实际产出,另一类则显著提升了输出效率并持续交付有价值的产品。他观察到,这两类人的比例在AI出现前后似乎没有变化,且第二类人甚至能更大幅度地超越第一类人,形成“交付者更富”的效应。该推文获得58条回复、27次转发和378次点赞。行业编码代理AI编程生产力推荐理由:看看CEO怎么吐槽AI编码工具的两种人原文稍后读已读值得跟进有用关注 编码代理
05:32官方账号LangChain@LangChainAILangSmith Fleet 发布了一个新的“软件工程师”模板,该模板可以从 Slack 直接触发,从 Linear 获取 issue,自动编写并验证代码,最终在 GitHub 上创建 PR。整个过程在沙盒环境中运行,确保了安全性。这个模板展示了 AI 如何将日常开发工作流中的多个工具(Slack、Linear、GitHub)串联起来,实现从需求到代码提交的自动化。对于希望提升开发效率的团队来说,这是一个值得关注的实践案例。AI产品编码代理工作流自动化Slack4 个信源在谈事件专题推荐理由:这个模板把 Slack、Linear 和 GitHub 串成了自动化流水线,做 DevOps 或想减少重复编码的团队可以直接参考,省去手动切换工具的麻烦。原文稍后读已读值得跟进有用关注 编码代理
13:21Geek@geekbb精选该框架专门为AI编码代理设计,用于QA测试。它能自动识别代码修改影响的UI流程,并在真实浏览器中执行端到端测试。项目已在GitHub上开源,可减少人工回归测试的工作量。AI产品测试框架编码代理编程助手推荐理由:自动测UI变更,省心原文稍后读已读值得跟进有用关注 测试框架
13:00官方账号arXiv cs.AI@Matthew Ho, Brian Liu, Jixuan Chen, Audrey Wang, Lianhui Qin科学家使用专业模拟软件时,需要学习复杂的输入语言,耗时数小时到数天。SIGA 是一种轻量级适配层,通过检索、程序记忆、轨迹内验证和验证强制终止,为通用编码代理提供模拟器的“可执行契约”(词汇、结构约束、验证规则等)。在 GEOS 多物理场模拟器上,SIGA 约5分钟即可生成完整配置,TreeSim 得分超0.90,相当于专家3小时的工作,速度提升约36倍。在更难的保留数据集上,SIGA 将 TreeSim 从0.720提升至0.789,相对提升约10%,并将跨种子标准差降低16倍。自进化机制通过重写先前轨迹中的适配器内容,进一步提升了性能,甚至超越最强的手工设计配置。在 OpenFOAM 和 LAMMPS 上的迁移实验表明,不同模拟器的瓶颈不同:结构完整性不足时验证最重要,领域正确性不足时记忆和检索最重要。论文科学模拟编码代理自进化推荐理由:做科学计算或模拟仿真的团队,终于有了让通用AI代理直接操作专业软件的轻量方案——SIGA 把数小时的学习成本压缩到几分钟,且能自我进化,建议做计算物理、流体力学或分子动力学的开发者点开看看。原文稍后读已读值得跟进有用关注 科学模拟
22:44官方账号LangChain@LangChainAILangChain 分享了一个真实案例:一个编码代理在夜间陷入重试循环,到早上已调用 LLM 达 10,000 次,产生四位数的账单。问题在于,可观测性只能事后告诉你发生了什么,而无法在事前阻止。要避免此类问题,需要在请求层强制执行策略,例如限制重试次数或设置调用上限。这提醒开发者,构建可靠 AI 代理时,策略控制比事后监控更重要。行业编码代理成本控制LLM调用推荐理由:做 AI 代理开发的团队都会遇到这类成本失控风险,LangChain 这个案例直接点出了「事后监控 vs 事前策略」的痛点,建议在部署前就加上请求层限制。原文稍后读已读值得跟进有用关注 编码代理
08:44berryxia@berryxia76°OpenAI发布了Codex应用场景页面,展示了编码代理在各团队中的实际任务,包括工程开发、产品开发、质量测试、安全检查、数据分析、内部工具开发及生命科学领域。具体例子有审查GitHub PR、截图转UI、模拟用户测试、代码重构、数据迁移、安全修复、撰写PRD、分析数据集等。这表明编码代理已从演示用途变为日常工作的实用工具,值得开发者关注。AI产品Codex编码代理工程开发10 个信源在谈事件专题推荐理由:OpenAI把编码代理的真实用例摆上台面了,做开发、测试、产品、数据或生命科学的团队都能找到直接可用的场景,建议点开看看你的工作流能不能套进去。原文稍后读已读值得跟进有用关注 Codex
00:39elvis@omarsar0开发者 Omar 在逆向工程动态工作流时,发现拥有自己的 orchestrator 和 harness 至关重要。他成功让动态工作流在 Claude Code 生态之外运行,并测试了 Codex 和 Pi 等代理的兼容性。Omar 还展示了一个为 dair_ai 构建的极简编码代理,证明即使最简单的代理也能利用这一原语。这标志着动态工作流首次在 Claude Code 之外有效工作,可能推动其他编码代理引入类似技能。AI产品动态工作流Agent OrchestratorClaude Code推荐理由:动态工作流不再被 Claude Code 垄断,做 Agent 编排的开发者可以自己掌控,甚至用极简代理也能实现,值得动手试试。原文稍后读已读值得跟进有用关注 动态工作流
08:22elvis@omarsar0精选Omar 宣布他构建了一个独立的编码代理解决方案,该方案可与任何编码代理后端配合使用。他特意这样设计,是为了测试来自不同提供商子代理之间的动态工作流。他指出,这些动态工作流的效率是一个真实存在的问题。该方案旨在解决多代理协作中的效率瓶颈。AI产品编码代理动态工作流多代理协作推荐理由:如果你正在构建或使用多代理工作流,Omar 的方案直接点出了效率痛点并提供了跨后端的解决思路,做代理编排的开发者值得关注。原文稍后读已读值得跟进有用关注 编码代理
07:44elvis@omarsar0一位开发者分享使用 Claude Code 的 /goal 命令的经验,认为该命令能极大提升编码代理的效率。他建议在使用 /goal 前先进行规划,以确保代理拥有正确的上下文和目标。该帖子在 X 上获得 22 个赞和 1331 次浏览,引发关注。AI产品Claude Code/goal命令编码代理推荐理由:Claude Code 的 /goal 命令解决了编码代理任务执行不精准的痛点,做自动化开发的团队可以直接试,能显著提升效率。原文稍后读已读值得跟进有用关注 Claude Code
10:49官方账号Simon Willison’s Weblog(博客/媒体)精选Simon Willison 在 PyCon US 2026 上用五分钟闪电演讲总结了 LLM 领域过去六个月的发展。他重点介绍了 2025 年 11 月的“拐点”,当时最佳模型在三大提供商间易手五次,最终 Claude Opus 4.5 胜出。更关键的是,编码代理从“偶尔可用”跨越到“日常可用”,显著减少了人工修复错误的时间。他还分享了个人项目 micro-javascript,一个用 Python 实现的 JavaScript 解释器,展示了多语言嵌套运行的技术趣味。演讲通过“鹈鹕骑自行车”SVG 测试直观对比模型能力,强调编码代理的进步是最大亮点。行业LLM编码代理模型对比推荐理由:Simon 用五分钟讲清了 LLM 过去半年的关键转折——编码代理从玩具变成生产力工具,做 AI 开发或重度使用编程助手的团队值得花五分钟了解这个趋势,看完会对模型选择和工具策略有更清晰的判断。原文稍后读已读值得跟进有用关注 LLM