09:39
09:39 官方账号 arXiv cs.AI @Xiaoshuai Song, Liancheng Zhang, Kangzhi Zhao, Yutao Zhu, Zhongyuan Wang, Guanting Dong, Jinghan Yang, Han Li, Kun Gai, Ji-Rong Wen, Zhicheng Dou WebSwarm是一种渐进式递归委托框架,通过动态实例化具有本地目标和搜索模式的智能体搜索节点,实现任务分解、递归扩展和智能体协作。每个节点可自行求解目标或委托子节点,完成后向上返回证据和结果,支持父节点进一步扩展或聚合。在BrowseComp-Plus、WideSearch、DeepWideSearch和GISA四个基准上,WebSwarm在深度、广度及交织任务中持续优于单智能体和多智能体基线。消融实验、难度分析、网络工具效率和模型泛化验证了其有效性。 推荐理由: 想找能同时把深挖和广搜做到极致的搜索方法?看WebSwarm怎么用递归多智能体搞定的,测试结果比单智能体强不少。
稍后读 已读 值得跟进 有用 关注 WebSwarm
09:36
09:36 官方账号 arXiv cs.AI @Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu UltraX 提出一种函数调用精炼框架,通过引入插入操作完成编辑函数空间,实现细粒度实例级编辑。该框架通过数据集自适应提示优化指导专家LLM生成高质量精炼文本,再通过行对齐映射和动态上下文替换转换为结构化程序监督。实验表明 UltraX 在所有语料库上取得最高平均性能,并使用更少训练 token 匹配或超越基线,展现更强数据效率和精炼可靠性。 推荐理由: UltraX 搞了个新框架,用程序化编辑替代传统规则和LLM方式,既能细粒度编辑又保证效率,精炼预训练数据效果不错。
稍后读 已读 值得跟进 有用 关注 UltraX
09:31
09:31 官方账号 arXiv cs.AI @João Matos, Olivia Buege, Donny Cheung, Gary S. Collins, Paula Dhiman, Nan Li, Bingyu Mao, Benjamin W. Nelson, Michail Ouroutzoglou, Paul Varghese, Jonathan Amar 该论文分析了2053个真实患者与AI聊天机器人的对话,发现用户交流模式和情绪表达差异显著。研究开发了患者模拟器,分别建模临床内容、情感状态、对话策略和交流风格。在15位人类评分员的图灵测试中,模拟对话与真实对话几乎无法区分,准确率仅55%。使用5种患者角色和1164个临床医生评分案例,评估了4个LLM的紧急评估性能,发现交流风格显著改变分诊结果。 推荐理由: 别只看用理想病人测AI的论文,这篇用2053个真实对话发现,交流风格直接改变分诊结果,准确率才55%!
稍后读 已读 值得跟进 有用 关注 LLM
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档 (侧边栏 → AI 日报 → 顶部「往期日报」)。