12:06官方账号arXiv cs.AI@Yunjia Qi, Zehua Yin, Xintong Shi, Hao Peng, Songyuanyi Lu, Yixian Liu, Richeng Xuan, Yuhong Liu, Zhichao Hu, Xiaozhi Wang, Lei Hou, Bin Xu, Juanzi LiTrajDebug提出错误生命周期追踪框架,通过多粒度历史压缩和基于证据的错误识别,解决长轨迹中的错误发现难题。该框架追踪每个错误的解决状态和终端影响,实现关键归因。研究构建了TrajErrBench基准,包含来自Tau2Bench和SWE-Bench Pro的486个手动标注失败轨迹。实验表明TrajDebug在多个智能体基准上优于现有基线,其诊断结果可提升下游智能体成功率。论文TrajDebugTrajErrBenchSWE-Bench Pro推荐理由:TrajDebug能从长轨迹里精准揪出导致最终失败的那个错误,486条真实数据验证过,比现有方法都靠谱。原文稍后读已读值得跟进有用关注 TrajDebug
12:23官方账号arXiv cs.AI@Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang, Shibo Hu, Hangxi Guo, Yilin Chen, Yuzhe Zhang, Fan Yang, Chuan Wen, Xian Zhang, Xuanhe Zhou, Zhijie DengArgus 是一个自进化的智能体运行时,由 Manager、Planner、Engineer、Reviewer 四个角色在持久项目状态上执行任务。在 SWE-Bench Pro 上达到约 78% 的通过率,高于 Direct Copilot 的 59%,但 token 消耗为后者的 1.41 倍。经过验证门控自进化后,成熟阶段的求解 token 比启动阶段少 21%,活动时间少 15%,并记录了 34 次验证器恢复和 22 次审查循环救援。在 AARRI-Bench 上取得 76.8%,数学数据合成差距为 28 分;优化后的 RWKV6 内核已合并到上游。论文Argus智能体SWE-Bench Pro推荐理由:Argus 这个智能体运行时,SWE-Bench Pro 拿到 78%,比 Direct Copilot 高 19 个点,还会自我进化省 token,挺新鲜。原文稍后读已读值得跟进有用关注 Argus
08:47小互@imxiaohu82°OpenAI对GPT-5.6系列进行了发布以来最大幅度降价。Luna模型输入价格下降80%,成为OpenAI最便宜的GPT-5.6模型。Terra输入输出价格下降约20%,Sol价格不变,同时新增High Speed API模式。性能方面,在SWE-Bench Pro代码基准上,Sol达64.6%,Terra 63.4%,Luna 62.7%,均超过GPT-5.5的59.4%。网络安全基准(Capture the Flag)上,Sol达96.7%,Terra 91.8%,Luna 85.2%。AI模型GPT-5.6OpenAI降价10 个信源在谈事件专题推荐理由:GPT-5.6 Luna输入价格砍了八成,比GPT-5.5还强,代码和网络安全分数都涨了,性价比碾压Gemini。原文稍后读已读值得跟进有用关注 GPT-5.6
21:37官方账号Decoder@Maximilian Schreiner精选73°OpenAI 审查了 SWE-Bench Pro 基准测试,发现约30%的任务存在缺陷。该公司已在官网上撤回对该测试的先前认可。SWE-Bench Pro 常被用于评估AI模型(如 GPT-4)的编程能力,但OpenAI指出许多任务存在数据污染或描述不清的问题。行业OpenAISWE-Bench Pro基准测试10 个信源在谈事件专题推荐理由:OpenAI自己查了SWE-Bench Pro,发现三成测试题有毛病,所以不认这个榜了。做AI编程的可以看看。原文稍后读已读值得跟进有用关注 OpenAI
15:46IT之家(博客/媒体)精选72°OpenAI 分析 Scale AI 推出的编程基准 SWE-Bench Pro,在 731 个公开测试任务中约 30% 存在评测缺陷。前沿模型通过率从 2024 年初的 23.3% 升至 8 个月后的 80.3%,OpenAI 认为该基准已无法有效评估模型能力。人工标注识别出 249 个失效任务(占 34.1%),问题包括测试过严、提示不充分、范围过窄和误导性提示。典型错误是要求行首 1 个空格但隐藏测试要求 2 个空格。OpenAI 撤回对其的采用建议,呼吁设计新基准。行业OpenAISWE-Bench ProScale AI10 个信源在谈事件专题推荐理由:OpenAI 扒了权威编程基准的皮,发现三成题有坑,想测 AI 写代码别轻信 SWE-Bench Pro 了。原文稍后读已读值得跟进有用关注 OpenAI
09:23shao__meng@shao__meng88°OpenAI 审计发现 SWE-Bench Pro 中约30%的任务存在致命缺陷,包括过严测试、题面欠指定、低覆盖测试和误导性题面。此前公开731题上,前沿模型通过率八个月内从23.3%升至80.3%,但分数飙升主要源于评测噪声而非能力提升。OpenAI 采用自动化质检、人机协同深审和人工标注三层流程,人工审核更常判出“坏题”(约30%)。OpenAI 因此撤回对 SWE-Bench Pro 的推荐,呼吁社区设计更可靠、难刷的编程评测基准。行业SWE-Bench ProOpenAI基准测试10 个信源在谈事件专题推荐理由:OpenAI 发现一个流行代码基准有30%的题有问题,分数虚高,直接影响了部署和安全判断。做评测或选模型的人得看这个。原文稍后读已读值得跟进有用关注 SWE-Bench Pro
05:30官方账号OpenAI@OpenAI精选78°OpenAI对SWE-Bench Pro进行了审计,发现该基准存在约70%的噪音上限,已无法可靠衡量前沿编码能力。该基准在业界广泛使用,但目前已被认为饱和。OpenAI决定撤回之前推荐研究社区使用该基准作为主要编码评估的建议。行业OpenAISWE-Bench Pro基准测试10 个信源在谈事件专题推荐理由:OpenAI发现SWE-Bench Pro这个编码基准有70%噪音上限,已经饱和了,不再适合用来衡量最强AI编码能力。原文稍后读已读值得跟进有用关注 OpenAI
05:28官方账号OpenAI@OpenAIOpenAI 在审计 SWE-Bench Pro 时部署了模型驱动的调查代理,并搭配五名独立资深软件工程师进行人工复审。该方法在规模化检查任务的同时保持专家判断为核心。审计结果未被详细披露,但流程强调了自动代理与人工协作的可行性。行业SWE-Bench ProOpenAI模型驱动代理10 个信源在谈事件专题推荐理由:OpenAI 公布了一种审计 SWE-Bench Pro 的新方法,结合模型代理和五名资深工程师的独立评审,适合关注基准测试可靠性和自动审计的朋友。原文稍后读已读值得跟进有用关注 SWE-Bench Pro
04:11官方一手OpenAI Blog(博客/媒体)OpenAI的最新分析指出了SWE-Bench Pro基准测试中存在的信号噪声问题,影响了对AI模型编码能力的评估准确性。该分析发现SWE-Bench Pro存在评估指标不稳定、模型分数波动等问题。这引发了对该基准可靠性的质疑,可能影响模型比较和性能判断。行业OpenAISWE-Bench Pro编码基准10 个信源在谈事件专题推荐理由:OpenAI发文说SWE-Bench Pro这个编码基准有噪声问题,做评估的得留个心眼。原文稍后读已读值得跟进有用关注 OpenAI