主要来源腾讯混元
查看原文事件专题 ·单一信源
腾讯发布探索基准测试ExplorationBench
腾讯、复旦大学和清华大学联合推出探索基准测试ExplorationBench,包含两个沙盒环境AlienCode和AlienLogic,共101个任务。测试显示,获取反馈比单独思考更有效,最佳系统在四轮反馈后准确率从15.7%提升至89.0%。同一系统在不同沙盒中的表现差异巨大,准确率从5.7%到79.0%不等。
当前结论
腾讯团队推出探索基准测试,评估AI系统发现规则的能力,10个前沿模型测试结果揭示重要发现。
2 个信源67° AI 热度最后更新 2026/9/30 13:29:01
证据链
2 个信源相关来源 1Hunyuan
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。