10:31官方账号arXiv cs.AI@Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing HuangAgentHPOBench 提出一个包含30个可执行机器学习任务的序列化基准,覆盖7个研究类别,用于评估LLM智能体的超参数优化能力。每个任务从已验证的基线运行开始,智能体需逐步观察配置、指标和日志后提出下一组超参数。研究在统一协议下评测了12种智能体和传统HPO基线。结果显示当前智能体具备初步实验优化能力,但在持续迭代改进、复杂日志诊断和逼近参考性能方面仍有明显局限。论文AgentHPOBench超参数优化智能体推荐理由:想用LLM自动调超参?这个基准测了12个智能体,告诉你它们能做什么、卡在哪。原文稍后读已读值得跟进有用关注 AgentHPOBench