00:41官方账号arXiv cs.LG@Tommaso Bendinelli, Artur Dox, Christian HolzTraceBench是一个基于模拟的框架,用于生成受控的根因归因任务。研究团队使用三个可解释的机械系统生成任务,评估了四个LLM智能体在受控实验条件下的表现。结果显示,智能体从领域上下文中获益显著,主要通过数值控制台输出而非可视化探索数据。当要求生成Python脚本映射时间序列样本时,智能体表现通常较差。论文TraceBenchLLM agents时间序列推荐理由:TraceBench发布了首个LLM智能体时间序列根因评估框架,包含数据集、实验结果和排行榜,tracebench.github.io可访问。原文稍后读已读值得跟进有用关注 TraceBench