8月6日
21:56
21:16
19:13
19:13官方账号阿里通义 Qwen@Alibaba_Qwen
精选
Qwen3.8-Max在Artificial Analysis Intelligence Index上排名第五,并在Agentic Index上位列第一。该模型由阿里通义千问团队发布,当前基准成绩显示了其在智能体任务上的领先表现。团队表示将继续推进模型迭代。

推荐理由:阿里刚发的Qwen3.8-Max,智能体能力跑到第一了,总榜第五,想追新模型可以看看。
14:59
14:59AI Will@FinanceYF5
精选
该观点提出,AI时代的全栈需要将模型、代码、数据、工具和任务流程这5类要素整合为智能体系统。这与传统只掌握前端、后端和数据库这3项技能的全栈定义明显不同。该推文在X平台已有502次浏览。

推荐理由:X用户@FinanceYF5 提出,AI全栈的核心是搭智能体系统,比传统前后端思路更贴合项目实战。
12:23
12:23官方账号arXiv cs.AI@Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang, Shibo Hu, Hangxi Guo, Yilin Chen, Yuzhe Zhang, Fan Yang, Chuan Wen, Xian Zhang, Xuanhe Zhou, Zhijie Deng
Argus 是一个自进化的智能体运行时,由 Manager、Planner、Engineer、Reviewer 四个角色在持久项目状态上执行任务。在 SWE-Bench Pro 上达到约 78% 的通过率,高于 Direct Copilot 的 59%,但 token 消耗为后者的 1.41 倍。经过验证门控自进化后,成熟阶段的求解 token 比启动阶段少 21%,活动时间少 15%,并记录了 34 次验证器恢复和 22 次审查循环救援。在 AARRI-Bench 上取得 76.8%,数学数据合成差距为 28 分;优化后的 RWKV6 内核已合并到上游。
推荐理由:Argus 这个智能体运行时,SWE-Bench Pro 拿到 78%,比 Direct Copilot 高 19 个点,还会自我进化省 token,挺新鲜。
12:14
12:14官方账号arXiv cs.AI@Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen
ABSeeker基于Qwen3.5-4B,仅用8500个示例训练,在BrowseComp上达到37.3%,在BrowseComp-ZH上达到39.1%。加入上下文管理后,成绩分别提升至55.3%和52.9%,超过同规模4B智能体,并赶上约30B参数的更大模型。其核心是ABC框架,通过答案回溯恢复线索,再将搜索每一步与线索比对,生成细粒度步骤级奖励。
推荐理由:它用答案倒推给搜索智能体每一步打分,4B模型在BrowseComp上拼到55.3%,能对标30B模型,值得看方法。
09:59
09:59官方账号arXiv cs.AI@Xiaoyan Gu, Yifang Wang, Wenqing Zheng, Haozhong Liu, Yixia Zheng, Peiyi Jiang, Wenjie Ning, Wei Zhang, Wei Chen
论文提出双向人机增强框架BiHAA,并在ArtAnno系统中实现。系统基于多智能体架构,包含主动式智能体支持模块和交互驱动进化模块。研究团队与20名艺术品标注人员开展形成性研究,并通过用户研究和两个案例评估效果。结果显示该方法减少了标注者信息检索和核验成本,同时提升了标注效率。
推荐理由:做艺术标注的可以看:ArtAnno用LLM智能体挖隐含语义,还把标注经验回传给AI,双向增强。
09:28
09:28官方账号arXiv cs.LG@Xuanyu Lei, Yiqi Zhu, Chenliang Li, Kaiming Liu, Peng Li, Ming Yan, Jieping Ye, Ya-Qin Zhang, Yang Liu
State2State是一种从环境交互中派生训练目标的方法,无需外部指定的任务或人工监督。它通过规则匹配状态来验证智能体是否到达目标状态,从而提供可扩展且可验证的训练信号。在ALFWorld和ScienceWorld基准上,State2State作为独立训练阶段在多数设置下提升了智能体性能。用作下游强化学习的初始化时,它进一步提高了最终性能和采样效率,并展现出跨环境泛化的潜力。
推荐理由:这篇论文提出了一种不用人工任务标注的训练方法,让LLM智能体自己从环境里找目标学,在ALFWorld和ScienceWorld上有效,还能给后续强化学习打底子。
08:47
07:35
07:35Notion@NotionHQ
Notion 在 Share menu 中新增了 Custom Agents 作为分享目标。用户可直接将页面分享给 Custom Agents。该功能让 Custom Agents 获得页面上下文更省事。这次更新是 Notion 的一次 QoL 改进。
事件专题

推荐理由:Notion现在能从分享菜单一键把页面丢给你的Custom Agents,不用再复制粘贴搬上下文了,挺实用。