主要来源arXiv: DeepSeek
查看原文事件专题 ·官方一手
AgenticBBO-Bench:评测 LLM 智能体黑盒优化能力的跨域基准
研究团队发布 AgenticBBO-Bench,覆盖合成函数、超参数优化、数据库调优、芯片设计和分子设计五个领域,统一有限预算评测协议。实验显示 agentic BBO 在全部五个领域的平均得分高于直接使用 LLM 的方法,并在其中四个领域超过最佳数值优化器。分析发现额外增加数值工具并不总是提升性能,任务语义信息普遍有用,具体先验知识反而不够可靠。在五任务前沿挑战中,七款 LLM 在 Codex agent 框架下评测,GPT-6 Astra 和 DeepSeek-V4.1-Flash 位于性能与成本的 Pareto 前沿。
当前结论
想用 LLM 智能体做黑盒优化的可以看看,五个领域统一评测,还拆了哪些设计选择真有用、哪些是伪收益。
11 个信源37° AI 热度最后更新 2026/10/8 15:48:07
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。