11:22量子位@量子位的朋友们墨奇智能首次亮相国内,公开展示其新近发布的具身智能模型MoRA架构,该模型在WRC场景下的长程任务实战中表现出色,完成超5小时连续作业,展现出具身大脑的技术革新AI模型MoRA墨奇智能具身智能推荐理由:墨奇发的MoRA模型,能让机器人做长程任务,比普通模型实战效果更好原文稍后读已读值得跟进有用关注 MoRA
16:09官方一手marktechpost@Asif RazzaqZ.ai 于 2026 年 8 月 14 日发布 GLM-5.3,复用 743B 参数的 GLM-5.2 基础模型。GLM-5.3 的全部增益来自扩展后训练,未改动基础模型权重。Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9。网络安全方面,CyberGym 达到 84.5%,ExploitBench 翻倍以上至 54.4%。GLM-5.3 的权重约两周后发布。AI模型GLM-5.3Z.ai后训练10 个信源在谈事件专题推荐理由:GLM-5.3来了,不重训基础模型,后训练拉高Terminal-Bench到28.3,代码和长程任务提升,两周后开放权重。原文稍后读已读值得跟进有用关注 GLM-5.3
23:41lmarena.ai@lmarena_ai74°Agent Arena 使用数百万个真实世界长程智能体任务评测模型。模型获得网页搜索、文件系统和终端工具,完成写代码、制作幻灯片、网络研究、构建应用和分析文档等工作流。评测采用因果追踪方法衡量模型的净改进,即相对平均模型提升结果的程度。完整排行榜见 arena.ai/leaderboard/ag…。AI模型Agent Arena智能体模型评测推荐理由:想知道哪个模型最能搞定真实长任务?Agent Arena 用几百万个任务跑分,还给模型上网、文件、终端工具,比谁净提升大。原文稍后读已读值得跟进有用关注 Agent Arena
11:32官方账号arXiv cs.AI@Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan精选73°RoboTTT将机器人模型的视觉运动上下文从单步或短历史扩展到8000个时间步,比最先进策略提升三个数量级且不增加推理延迟。它实现了从人类视频演示的一次性上下文模仿、在线策略改进、对扰动的鲁棒性以及在多阶段长程任务上更强的性能,并首次观察到预训练上下文长度与闭环性能的稳定提升。在真实机器人操作任务上,RoboTTT比单步上下文基线整体性能提升87%,可完全完成五分钟十阶段装配任务。使用8000时间步上下文训练的模型比1000时间步的相同模型性能高出62%,表明上下文长度是机器人基础模型的新缩放轴。AI模型RoboTTT测试时训练机器人策略2 个信源在谈事件专题推荐理由:NVIDIA发布了RoboTTT,能把机器人策略的上下文窗口做到8000步,看懂人类演示后直接模仿,长任务完成率比单步模型高87%。想了解机器人怎么学更长历史可以看这个。原文稍后读已读值得跟进有用关注 RoboTTT
00:01elvis@omarsar0精选Meta研究人员定义了智能体的“行为状态衰减”(behavioral state decay),即任务事实、先前尝试和未完成的子目标被埋没在上下文窗口中。他们提出一个即插即用的记忆模块:一个独立的记忆智能体维护结构化记忆库,每一步决定是否注入基于记忆的提醒。在Terminal-Bench 2.0和tau-squared-Bench上,该方法将pass@1提高了多个百分点,且不修改原有动作智能体。论文MetaAgent行为状态衰减推荐理由:Meta发现智能体做长任务会忘事,加了个外挂记忆模块,在Terminal-Bench 2.0上明显提升pass@1,而且即插即用。原文稍后读已读值得跟进有用关注 Meta
09:48AI产品黄叔@PMbackttfuture提出构建Agent社群的想法,目标是将更多Token消耗用于长程任务和自动任务。提出了“协作强度”概念,旨在让Agent承担更多工作。该观点目前被认为独此一家。帖文获得239次阅读和1次评论。行业智能体Agent社群Token消耗推荐理由:分享了一个关于Agent协作与Token消耗的新视角,提出“协作强度”概念,适合关注Agent社群构建的人看。原文稍后读已读值得跟进有用关注 智能体