09:48OpenRouter@OpenRouterAI精选Qwen在长期任务和视觉智能体基准上报告了新成绩。PaperBench从64.8升至93.0,OSWorld-Verified从73.3升至86.1,Vision2Web从42.1升至69.0。数据由OpenRouter推文转述。AI模型Qwen3.7 MaxPaperBenchOSWorld-Verified推荐理由:Qwen放出了新基准分,PaperBench直接到93,比之前64.8涨了一大截,智能体任务可以关注。原文稍后读已读值得跟进有用关注 Qwen3.7 Max
14:22官方账号AlphaSignal@AlphaSignalAI精选CUA-Gym是一个端到端流水线,通过三个协调编码智能体自动生成可验证的计算机使用任务。它构建了94个流行应用的模拟版本,包括Slack、Notion、Salesforce和Gmail克隆,并直接读取状态设计奖励函数。生成的训练数据集包含32,112个验证元组,覆盖110个环境。基于该数据训练的模型在OSWorld-Verified基准上达到72.6%,与Claude Sonnet 4.6持平。一个3B参数的小模型以十分之一参数匹配了17B基座模型的性能。AI模型CUA-GymClaude SonnetOSWorld-Verified5 个信源在谈事件专题推荐理由:CUA-Gym用三个AI智能体自动生成训练数据,省去人工标注。它克隆了94个常用软件,训练出的模型追平了Claude Sonnet 4.6,小模型3B参数达到17B效果,还完全开源。原文稍后读已读值得跟进有用关注 CUA-Gym