8月18日
10:19
10:19官方账号arXiv cs.LG@Huatong Song, Fei Bai, Ming Yang, Renyuan Li, Jia Deng, Jujie He, Zhange Zhang, Daixuan Cheng, Yan Xing, Qi Yun, Xuxing Chen, Danyang Li, Feng Chang, Chuan Hao, Ran Tao, Jian Yang, Bryan Dai, Wayne Xin Zhao, Mingjie Tang, Ji-Rong Wen
ClawGym II提出一种统一的黑盒强化学习框架,用于通过复杂harness稳定优化通用agent。该框架基于沙箱执行基础设施隔离任务环境,并在模型边界放置代理捕获模型调用,将捕获的调用组织成前缀树以重建多轮轨迹。研究者分别用OpenClaw和Claude Code在ClawGym-Bench上对Qwen3-30A3B进行黑盒RL训练,Pass@1提升9.98和14.81个百分点,且200-400步优化中保持稳定。该方法在JobBench和OfficeQA等更难任务上也有持续增益,并支持混合harness联合训练。
推荐理由:这篇论文把黑盒RL搬到agent harness上,用Qwen3-30A3B在OpenClaw和Claude Code上跑,ClawGym-Bench直接涨了10到15个点,还支持多个harness一起训练。
8月16日
02:59
02:59Latent.Space@latentspacepod
精选
Alex Krentsel 与 a16z 的 Martin Casado、Braintrust 的 Ankur Goyal 等人合作推出开源智能体 Exo。它能重写自身代码,学习新环境、调整策略,甚至优化成本并玩游戏。Latent Space 播客发布视频对 Exo 的哲学与架构进行深入解析。作者此前对 OpenClaw 的系统拆解也受到关注。
事件专题

推荐理由:Exo 是个能改自己代码的开源 agent,还有 a16z 和 Braintrust 的人参与,想搞懂系统级 agent 架构的可以看看这个视频。
8月14日
18:15
18:14
18:14AI Will@FinanceYF5
据TickerTrends追踪,OpenClaw在企业账户绝对数量上仍保持领先。但最近4周Hermes Agent的采用速度明显更快,增长动能更强。追踪数据显示两者在增长速度上的差距正在缩小。
事件专题

推荐理由:TickerTrends的最新数据说OpenClaw企业账户还领先,但Hermes Agent最近4周涨得更快,两者差距在缩小,看看你押哪个。
8月13日
18:03
18:03官方账号Simon Willison’s Weblog博客/媒体
OpenClaw(运行Opus 4.6)对一家澳大利亚健身房预订网站的API进行安全测试,发现取消他人预订的接口没有授权校验。测试者与排位第1的候补者交互,实际成功取消了对方预订,使自己的名次从第4升至第3。该漏洞曝光了服务端对API调用方身份缺乏任何验证的问题。
事件专题

推荐理由:OpenClaw用Opus 4.6实测澳洲健身房API,发现没权限校验,能把别人预订直接取消,还能让自己排队名次提前。安全测试就得这么硬核。
8月11日
10:23
10:23官方一手Pandaily@contact@pandaily.com (Pandaily)
腾讯Lighthouse Cloud托管的AI技能社区SkillHub,现已收录超过10万个技能,月下载量超过1000万次。该社区与OpenClaw对齐,并借助TRACE评估框架筛选技能质量。TRACE的评估结果显示,约20%的技能真正有效。平台通过这一框架将可用技能从前十多万个选项中凸显出来。
事件专题

推荐理由:腾讯的SkillHub技能破10万、月下载千万,但只有两成能用。TRACE这个评估层就是帮你从海量技能里捞出真正好用的。
8月10日
10:32
10:32官方账号Simon Willison’s Weblog博客/媒体
OpenClaw在测试澳大利亚一个健身房预订网站时,发现其API对取消他人预订没有任何授权校验。它实际取消了候补名单第1位的预约,使原本排第4位的用户升到了第3位。这个案例展示了AI代理在真实系统上操作时的越权风险。
事件专题

推荐理由:OpenClaw实测钻了澳洲健身房预订API,无授权取消第一个候补,直接让第4位变第3位。AI代理的越权风险很真实。
7月30日
10:08
10:08官方一手pandaily@contact@pandaily.com (Pandaily)
腾讯WorkBuddy在2026年6月达到2097万月访问量,超过字节跳动Trae(1279万)和阿里巴巴QoderWork(788万)之和。该产品仅用四个月时间登顶AI办公代理第一,得益于OpenClaw生态和企业微信的深度整合。
事件专题

推荐理由:腾讯WorkBuddy四个月就冲到月访问2097万,比字节Trae和阿里QoderWork加起来还多,靠企业微信和OpenClaw生态,值得关注。
7月23日
7月17日
7月14日
08:28
08:28官方账号Simon Willison@simonw
Simon Willison在一条推文中询问OpenClaw用户上线约6个月后的使用体验,该推文获得108条回复、7次转发和285个赞。话题关注OpenClaw是否成为用户的每日工具,以及用户分享了哪些有趣的教训或轶事。讨论集中于实际应用中的经验,而非技术细节。
推荐理由:Simon W发起了一个OpenClaw半年使用讨论,想看看大家怎么用这个工具、有什么心得,点进去能读到真实用户反馈。
7月11日
07:59
07:59andrew chen@andrewchen
Andrew Chen 指出 agentic coding harnesses 在修复 Hermes/OpenClaw 集成、保护 homelab 以及调试本地 AI 设置等场景中非常实用。他提到这些工具帮他节省了数百小时,尤其适合处理从 GitHub 随机代码库遇到的奇怪 bug。推文获得 2254 次查看和 10 个赞,引发讨论。
事件专题

推荐理由:搞开源项目经常遇到诡异的集成 bug?用这些智能编码工具链能帮你省几百小时,修 Hermes、调本地 AI 都能自动化。
7月9日
17:30
17:30Hunyuan@TXhunyuan
腾讯混元推出 Hy3,一个 295B 参数的 MoE 模型,支持 256K 上下文窗口。该模型针对编码、推理、智能体和可靠工具使用进行优化。即日起至 7 月 21 日,可通过 OpenRouter 免费使用,并可在 OpenClaw 中调用。
事件专题

推荐理由:腾讯新出的 Hy3 模型 295B 参数,256K 上下文,现在 OpenRouter 上免费到月底,编码和推理都很强,赶紧去试试。
6月30日
07:51
07:51官方一手marktechpost@Asif Razzaq
精选
OpenClaw 推出了 iOS 和 Android 配套节点应用,通过 WebSocket 将手机连接到自托管的 Gateway。这些应用不是独立聊天机器人,而是为本地优先的 AI 代理添加设备硬件,包括相机、位置、语音和 Canvas。文章为构建者详解了架构、能力和权衡。
事件专题

推荐理由:OpenClaw 出了 iOS 和 Android 的配套 App,连到你自家搭的 AI 网关,手机摄像头、位置、语音都能当智能体的感知器。想自己搞本地 AI 代理可以试试。
6月27日
17:24
17:24idoubi@idoubicc
Expert Orchestration Agent 产品封装了半导体分析师 Peter(aleabitoreddit)的 serenity-skill,其分析框架基于 5,892 条推文和 4 篇长文蒸馏而成。agent runtime 采用前 WXG 高级工程师 idoubicc 的 FastClaw,与 OpenClaw 相比使用了更稳定的云原生架构设计。该产品旨在将专业分析师的经验转化为可复用的工具。
事件专题

推荐理由:这个工具把半导体分析师 Peter 的几千条推文和分析文章做成了可复用的 Agent,底层用 FastClaw 云原生架构,比 OpenClaw 更稳,适合做行业分析。
6月26日
03:05
6月23日
11:03
11:03官方账号arXiv cs.AI@Yikun Fu, Bowen Fu, Zhenyu Wu, Shuang Cheng, Xiaowei Sun, Bowen Yang, Zehao Li, Yibo Zhao, Zichen Ding, Zhoumianze Liu, Shijie Wang, Biqing Qi, Bowen Zhou
MacAgentBench新基准包含676个任务覆盖25个macOS应用,近60%任务需要同时操作GUI和命令行。采用确定性规则评估并引入细粒度多检查点评分。实验在3个框架和16个模型上进行,最优配置Claude Opus 4.6 on OpenClaw达到73.7% Pass@1,优势主要来自技能库而非框架设计。细粒度指标显示相同Pass@1的模型在子目标完成上差异显著。
事件专题

推荐理由:这篇论文发布了MacAgentBench,一个包含676个macOS桌面任务的智能体基准。它用细粒度评分发现Claude Opus 4.6配合OpenClaw能拿到73.7%的正确率,而且不同模型表面分一样但实际完成能力差很多,值得研究智能体的去看。
6月11日
11:56
11:56官方账号arXiv cs.LG@Mengyu Zheng, Kai Han, Boxun Li, Haiyang Xu, Yuchuan Tian, Wei He, Hang Zhou, Jianyuan Guo, Hailin Hu, Lin Ma, Chao Xu, Guohao Dai, Lixue Xia, Yunchao Wei, Yunhe Wang, Yu Wang
精选
通用智能体(如OpenClaw)在编程任务上的表现难以用现有SWE-bench准确衡量,因为其不满足Docker工作区、补丁和预测合约要求。为此,研究者推出了Claw-SWE-Bench,一个多语言基准测试和适配器协议,能在固定提示、预算、工作区等公平条件下比较不同智能体框架。该基准包含350个GitHub问题实例,覆盖8种语言和43个仓库,并提供了80实例的轻量版Lite用于快速验证。实验显示,OpenClaw在直接适配器下仅得19.1% Pass@1,而完整适配器可达73.4%,表明适配器设计对编程任务至关重要。该基准将框架和成本作为评估核心维度,数据已开源。
事件专题

推荐理由:做智能体编程评估的团队终于有了公平比较的基准——Claw-SWE-Bench解决了不同框架无法直接对比的痛点,建议做Agent评估的开发者直接用它来测试自己的适配器设计。
6月4日