15:31IT之家(博客/媒体)DeepSeek已注册微信公众号“Deepseek Harness 团队”,目前尚未发文。据IT之家5月援引甲子光年消息,DeepSeek内部已组建Harness团队,主攻代码智能体产品,对标Anthropic的Claude Code。DeepSeek资深研究员陈德里证实了该传闻,新团队将专注产品研发,做DeepSeek Code Harness。DeepSeek还在招聘Harness产品经理和研发工程师,工作地点限北京。AI产品DeepSeekClaude Code代码智能体10 个信源在谈事件专题推荐理由:DeepSeek正式下场做代码智能体了,直接对标Claude Code,还注册了公众号,想跟进动态的可以关注下。原文稍后读已读值得跟进有用关注 DeepSeek
09:30官方账号arXiv cs.AI@Ishaan Bhola, Adithyan Krishnan, Mukunda NSSuperScout 先用 7B 的 SuperScout-7B 搜索代码仓库,生成经过沙箱验证的交接报告,再由路由器把任务分给四个前沿修复模型。在 SWE-bench Pro 的 Python 切片(266 个任务)官方预算档下,SuperScout 解决 159 个,最佳单模型解决 158 个,单次解决总成本约为后者的五分之一。在同一个 266 任务的 SWE-bench Pro 上,去掉路由器、只用最便宜修复模型加交接报告,成绩与路由系统并列,说明交接报告而非路由决策带来了成绩。配对校准研究(N=99)显示,交接报告让三个较便宜修复模型提升、最强模型略降,但各修复模型效应仅有方向性;搜索器的隐藏状态改善了成本路由,而交接报告文本本身没有。SuperScout-7B 的搜索计算在每个任务上只增加不到半美分 GPU 时间。论文SuperScoutSWE-bench Pro代码智能体推荐理由:7B搜索器先看仓库再路由,SWE-bench Pro追平最强模型,成本降五分之一,换新修复模型不用重训。原文稍后读已读值得跟进有用关注 SuperScout
01:10Cognition@cognition_labs精选Cognition 发布 FrontierCode 1.1 Extended 基准,用于评估真实工程任务的合并性与质量。Kimi K3 在该基准上取得 58.2% 的得分和 63.6% 的通过率。在 Devin 环境下,Kimi K3 在复现漏洞和环境管理方面表现突出。该结果来自 devin.ai/blog/kimi-k3。AI模型Kimi K3DevinFrontierCode10 个信源在谈事件专题推荐理由:Kimi K3 在真实工程任务基准上拿了 58.2%,而且在 Devin 里特别擅长修 bug 和管理环境,值得做开发的看看。原文稍后读已读值得跟进有用关注 Kimi K3
02:22AK@_akhaliqDataFlow-Harness 是一个基于代码智能体的开源平台,用于构建和编辑 LLM 数据管道。该平台允许用户通过自然语言描述数据需求,自动生成 Python 代码管道。它支持可视化编辑和迭代调整,无需手动编写复杂的数据处理脚本。项目已发布在 GitHub 上,获得社区关注。AI产品DataFlow-Harness代码智能体LLM数据管道推荐理由:想做 LLM 数据流水线但不想写代码?DataFlow-Harness 用对话就能生成可编辑的管道,省时省力。原文稍后读已读值得跟进有用关注 DataFlow-Harness
10:01官方账号arXiv cs.AI@Yunze Han研究者对Qwen2.5-Coder-7B-Instruct模型在SWE-trajectory数据集(67,074条轨迹,32,161条已解决)上进行LoRA微调,提出效率和风格两维度质量评分框架,并通过16组对照实验分析策略、规模与消融。在7B模型SWE-bench解决率近零的情况下,采用交叉熵损失替代评估,发现其与ROUGE-L完全秩相关(Spearman ρ=-1.00)。结果揭示规模依赖的质量-数量权衡:500到1000条时数据翻倍降低约12.7%损失,但TopQ与随机差距小于1%;2000条时差距扩大到3.6%(p=0.016)。消融实验确认错误重试率是主导子维度,表现与完整复合指标相当(Δ<0.2%)。论文Qwen2.5-CoderLoRASWE-trajectory推荐理由:这篇论文系统测试了用SWE-trajectory数据微调Qwen2.5-Coder时,不同轨迹筛选方法的效果,发现数据质量和数量在不同规模下影响不同,值得参考。原文稍后读已读值得跟进有用关注 Qwen2.5-Coder
05:00官方一手marktechpost@Asif Razzaq精选文章对比了Mistral Vibe for Code、Claude Code、Cursor和Codex四个代码智能体在Scaffold-to-PR任务上的表现。评估维度涵盖成本、开源权重、自托管能力和异步代理界面。读者可以了解各智能体在相同任务下的优劣势。AI产品Mistral Vibe for CodeClaude CodeCursor10 个信源在谈事件专题推荐理由:想知道哪个代码Agent更省钱、更开放?这篇文章把Vibe、Claude Code、Cursor和Codex拉到同一个任务上比,结果很清楚。原文稍后读已读值得跟进有用关注 Mistral Vibe for Code
11:41IT之家(博客/媒体)以色列研究团队发现名为 HalluSquatting 的 AI 漏洞,利用模型幻觉生成虚假代码仓库地址。Claude 等智能体在陌生项目名称上幻觉率最高达 85%,2025 年新仓库地址错误率 92.4%。在 OpenClaw 及其变体上攻击成功率达 80%-100%,Cursor、Gemini CLI、Copilot 为 20%-35%。攻击者可诱导智能体下载恶意代码,引发数据窃取或挖矿。行业HalluSquattingAI幻觉代码智能体10 个信源在谈事件专题推荐理由:这个 HalluSquatting 漏洞能让 AI 代码助手自动跑去假仓库下载恶意代码,Attackers 用起来成功率近 100%,用 Cursor 或 Claude 写项目时千万留意。原文稍后读已读值得跟进有用关注 HalluSquatting
10:16官方账号arXiv cs.AI@Shuangxiang Kan, Shuanglong Kan, Sebastian ErtelAria系统将Claude Code等通用LLM代码智能体与验证框架结合,无需预设策略即自动生成Coq证明。在Iris分离逻辑的4257个引理和Rust标准库的217个引理上,Aria全部证明成功,零失败。在reglang基准上,此前LLM证明器仅能证明八分之一(约40个),Aria则证明了全部318个。在iris-lean的Lean 4移植中,Aria还自动证明了72个未移植引理,表明该方法不限于Coq。所用模型为Claude Opus 4.7。论文AriaClaude Code形式化验证4 个信源在谈事件专题推荐理由:Aria让代码智能体自由探索,不用手动设计策略,就能把Iris和reglang上所有定理都自动证出来,比之前的方法强太多了。原文稍后读已读值得跟进有用关注 Aria
10:34IT之家(博客/媒体)精选76°英伟达研究团队发布开源框架 Polar,通过在不改动现有智能体框架(如 Codex、Claude Code、Qwen Code)的前提下接入 GRPO 强化学习训练,大幅提升代码智能体在 SWE-Bench 上的表现。Polar 将智能体与模型的接口作为训练边界,而非重写执行框架,从而保留原生工具调用和上下文组织能力。实验显示,基于 Qwen3.5-4B 模型,Codex 的 pass@1 分数从 3.8% 提升至 26.4%,涨幅达 594.74%。同时,Polar 通过 prefix_merging 等技术将训练效率提升约 5.39 倍,GPU 利用率从 20.4% 升至 87.7%。该框架解决了智能体强化学习从单步任务转向长流程任务时的接入难题,为代码仓库修改、浏览器操作等复杂场景提供了高效训练方案。AI产品英伟达PolarGRPO1 个信源在谈事件专题推荐理由:做代码智能体训练的团队终于有了一个不用重写框架就能接入强化学习的方案——Polar 让 Codex 跑分暴涨近 6 倍,建议搞 AI 编程的开发者直接看论文和代码。原文稍后读已读值得跟进有用关注 英伟达
01:12官方一手marktechpost@Asif Razzaq76°NVIDIA 研究人员推出 Polar,一个 token 忠实展开框架,用于通过强化学习训练语言智能体,无需修改其智能体框架。Polar 在框架和推理服务器之间放置模型 API 代理,捕获 token 级交互并重建训练器就绪轨迹。基于 Qwen3.5-4B 基础模型使用 GRPO,Polar 在 Codex 框架下将 SWE-Bench Verified pass@1 提升 22.6 个百分点,在 Claude Code 下提升 4.8 个百分点,在 Pi 下提升 6.2 个百分点。该框架已注册为 NeMo Gym 环境,并在 ProRL Agent Server 仓库中发布。AI模型NVIDIAPolarGRPO4 个信源在谈事件专题推荐理由:Polar 解决了 RL 训练智能体时需修改框架的痛点,做代码智能体或 RL 训练的开发者可以直接集成,无需改动现有工具链,值得一试。原文稍后读已读值得跟进有用关注 NVIDIA
08:00IT之家(博客/媒体)83°DeepSeek 已内部组建全新 Harness 团队,主攻代码智能体产品,直接对标 Anthropic 的 Claude Code。该团队由资深研究员陈德里证实,将专注研发 DeepSeek Code Harness,旨在将前沿模型能力转化为领先的 Agent 产品。目前开放 Harness 产品经理和研发工程师两个关键岗位,工作地点限北京。此举标志着 DeepSeek 正式进入代码智能体赛道,与 Claude Code 等产品展开竞争。AI产品代码智能体DeepSeekClaude Code10 个信源在谈事件专题推荐理由:代码智能体是 AI 编程的下一个战场,DeepSeek 直接对标 Claude Code 组建 Harness 团队,做 AI 编程工具或 Agent 产品的开发者值得关注其后续动作。原文稍后读已读值得跟进有用关注 代码智能体