MacAgentBench:在真实macOS桌面上评估AI智能体的基准
这篇论文发布了MacAgentBench,一个包含676个macOS桌面任务的智能体基准。它用细粒度评分发现Claude Opus 4.6配合OpenClaw能拿到73.7%的正确率,而且不同模型表面分一样但实际完成能力差很多,值得研究智能体的去看。
这篇论文发布了MacAgentBench,一个包含676个macOS桌面任务的智能体基准。它用细粒度评分发现Claude Opus 4.6配合OpenClaw能拿到73.7%的正确率,而且不同模型表面分一样但实际完成能力差很多,值得研究智能体的去看。
300 个子代理的集群让桌面自动化从“单步指令”跃升到“多任务并行”,做办公自动化或开发测试的团队可以直接用它替代繁琐的脚本和手动操作。
做办公自动化或 AI 工作流的开发者,终于有了一个能直接操控 WPS 和 Adobe 的开源方案,建议试试这个 Harness 项目。
OpenComputer 解决了计算机使用智能体评估缺乏可靠验证的问题,做智能体开发和自动化研究的团队可以直接用它来测试和训练模型,比 LLM 裁判更靠谱。