12:53官方账号arXiv cs.AI@Woongkyu Lee, Jungwook Choi这项研究在 OSWorld 基准上测试了 Qwen3-VL-8B/30B-A3B、UI-TARS-1.5-7B 和 OpenCUA-7B 三类本地计算机使用智能体。结果表明,上下文扩展可提升轨迹稳定性但收益很快饱和,时间扩展减少 max-step 停滞却不提升任务成功率。结构分解会引入规划和格式化开销,并行扩展能部分缓解但计算成本显著增加。研究建议本地高效智能体需要选择性计算分配和失败感知控制机制。论文Qwen3-VLUI-TARSOSWorld推荐理由:这篇论文实测了三个本地模型在 OSWorld 上的推理时扩展,发现多算不一定提升成功率,反而换着花样失败。做本地 CUA 部署的可以当避坑参考。原文稍后读已读值得跟进有用关注 Qwen3-VL
01:59rohanpaul_ai@rohanpaul_ai72°Apodex-1.0-H 是一个用于深度研究的重型智能体团队,通过将网络研究任务分配给多个智能体,并在生成答案前审计每条证据链,声称达到 SOTA 结果。它将深度研究视为 AI 智能体的分布式系统问题:一个编排器分配子智能体不同的上下文和工具,然后事实核查、冲突审查和草稿审查智能体测试薄弱声明。真正的亮点在于,Apodex 展示了一条可能的“推理时扩展”路径,即更好的答案不是来自更大的模型,而是来自多个协调的搜索智能体、持久追踪和独立的验证层。AI产品智能体深度研究推理时扩展推荐理由:做深度研究或复杂信息检索的开发者,值得关注 Apodex 的分布式智能体思路——它可能改变“大模型=好答案”的惯性认知,用多智能体协作+验证层来提升结果可信度。原文稍后读已读值得跟进有用关注 智能体