Linear 工程负责人 10 月 14 日在纽约讲编码智能体的上下文问题,还让你带上 agent 老出错的任务现场分析。
#编码智能体
研究员一年烧 180 万美元调编码智能体,Altman 亲测 ultra fast 档,这组真实用量数据太扎眼了。
给做代码智能体的朋友:这个新基准不测修 bug,测的是治理仓库,10 个模型里 Kimi-K3 在完整对比里表现最好,评分方法也挺有意思。
同一模型放进 Claude Code 和 Codex 跑同样的任务,结果居然会一个升一个降,这篇论文用 PowerPoint 重建实验讲清楚了 harness 的影响。
DeepLearningAI本周精选:Ng谈编码智能体技能,OpenAI和Anthropic更新企业隐私政策,Zai发布GLM-5.3-Flash多模态模型。
这篇论文通过实验展示了架构规范格式对编码智能体生成代码质量的影响,特别是TypeScript合同在提升API路由覆盖率方面的显著效果,对于关注模型能力均衡的读者来说值得一读。
Ox Alpha 今日预计达到 6 万亿 token,试试通过 ori 在您的编码智能体中使用吧,和 stealth 模型相比,Ox Alpha 有什么不同?
Matei Zaharia刚透露Databricks实测:用Pi harness成本省一半,效果和Opus、GPT一样好;GLM 5.2这个开源模型也追上来了。
这篇论文告诉你:给编码智能体写AGENTS.md时,别一次性写好就完,得用探针-改进法迭代修。实测在SWE-bench上解决率涨了近5个点,主要是能让智能体多搞定14.5%的实例。
LangChain 做了一款给团队管住编码 AI 花钱的东西,能对接 Cursor、Codex 和 Claude Code,还能设预算上限,谁用谁知道。
RAH 解决了长上下文推理中智能体扩展性的核心瓶颈,做复杂编码任务或智能体系统的开发者可以直接参考其设计思路,效果提升显著。
做AI智能体评估和训练的团队终于有了检测作弊的实用工具——CapCode能直接暴露模型是否在走捷径,CapReward则从奖励设计上杜绝作弊,建议做编码智能体评测的开发者点开看看。
做编码智能体开发的团队终于有了一个智能省钱方案——Factory Router 用路由策略自动平衡成本与性能,建议试试能否集成到你的工作流中。
Claude Opus 4.8 让编码智能体更自主,但检索质量成为瓶颈——做智能体开发或 RAG 的团队,建议关注 Milvus 如何解决上下文精准问题。
Self-Play SWE-RL 解决了编码智能体依赖人类标注数据的瓶颈,做 AI 编程助手或智能体训练的团队值得关注——它展示了智能体自我进化的新路径,看完会对训练数据来源有全新认识。
这篇论文戳中了编码智能体效率低下的核心痛点——不是试得不够多,而是记不住经验。做 AI 编程工具或智能体开发的团队,可以直接借鉴其摘要复用和锦标赛选择方法,值得点开看看。
做 AI 编码智能体或进化算法研究的开发者,这篇论文帮你拆解了 benchmark 分数的真实来源——别再只看最终得分了,EvoTrace 让你看清智能体到底在“进化”什么。