12:11官方账号arXiv cs.AI@Hang Ni, Weijia Zhang, Fan Liu, Mengqian Lu, Hao LiuSIREN-Bench基准包含600个问答实例、19个任务,覆盖4个独立预警流程和1个端到端预警链。现有天气智能体框架在SIREN-Bench上表现出显著能力差距。研究者提出SIREN,一种结合历史案例检索、技能蒸馏和预测建模的经验驱动智能体框架。实验显示SIREN在独立预警流程和端到端预警链上均超越基线。该框架利用异构天气证据和工具集成环境,提升预警自动化水平。论文SIREN极端天气LLM Agent推荐理由:想了解LLM智能体在极端天气预警中怎么用?这篇论文建了个600题的基准,还搞了个历史案例驱动的框架,比现有方案强不少。原文稍后读已读值得跟进有用关注 SIREN