一篇教代码智能体"怎么从自己的纠错里学到更多"的论文,在 DeepSeek/CodeARC 上把 Pass@1 从 15.0% 拉到 20.4%,做法挺有意思。
#代码智能体
共 14 条 · 7 天 1 条 · 30 天 2 条
信息流里打上「代码智能体」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月7日
EESD:用 Dirichlet 证据加权改进代码智能体自我纠错学习
9月20日
华为发布基于昇腾超节点训练的星辰轻量级代码智能体大模型 Xing4.0-29B
华为发布了基于昇腾超节点训练的星辰轻量级代码智能体大模型Xing4.0-29B,这个模型总参数29B,激活参数仅4B,能根据用户目标自主规划任务路径、调用工具并完成复杂任务。
8月25日
8月11日
8月6日
7月28日
Kimi K3 在 FrontierCode 1.1 Extended 上得分 58.2%,通过率 63.6%
Kimi K3 在真实工程任务基准上拿了 58.2%,而且在 Devin 里特别擅长修 bug 和管理环境,值得做开发的看看。
7月23日
7月21日
论文10:01
代码智能体轨迹数据筛选对LoRA微调的效果:系统评估这篇论文系统测试了用SWE-trajectory数据微调Qwen2.5-Coder时,不同轨迹筛选方法的效果,发现数据质量和数量在不同规模下影响不同,值得参考。
7月15日
Mistral Vibe/Claude Code/Cursor/Codex:四代码Agent Scaffold-to-PR任务对比
想知道哪个代码Agent更省钱、更开放?这篇文章把Vibe、Claude Code、Cursor和Codex拉到同一个任务上比,结果很清楚。
7月10日
AI 仓库调用漏洞 HalluSquatting 攻击成功率最高 100%
这个 HalluSquatting 漏洞能让 AI 代码助手自动跑去假仓库下载恶意代码,Attackers 用起来成功率近 100%,用 Cursor 或 Claude 写项目时千万留意。
7月8日
5月28日
英伟达开源 Polar 框架,Codex 跑分暴涨 594.74%
做代码智能体训练的团队终于有了一个不用重写框架就能接入强化学习的方案——Polar 让 Codex 跑分暴涨近 6 倍,建议搞 AI 编程的开发者直接看论文和代码。
NVIDIA 发布 Polar:跨 Codex、Claude Code 和 Qwen Code 的 GRPO 训练框架
Polar 解决了 RL 训练智能体时需修改框架的痛点,做代码智能体或 RL 训练的开发者可以直接集成,无需改动现有工具链,值得一试。
5月21日
DeepSeek 组建 Harness 团队,正面对决 Claude Code
代码智能体是 AI 编程的下一个战场,DeepSeek 直接对标 Claude Code 组建 Harness 团队,做 AI 编程工具或 Agent 产品的开发者值得关注其后续动作。