事件专题 ·单一信源

腾讯发布探索基准测试ExplorationBench

腾讯、复旦大学和清华大学联合推出探索基准测试ExplorationBench,包含两个沙盒环境AlienCode和AlienLogic,共101个任务。测试显示,获取反馈比单独思考更有效,最佳系统在四轮反馈后准确率从15.7%提升至89.0%。同一系统在不同沙盒中的表现差异巨大,准确率从5.7%到79.0%不等。

当前结论

腾讯团队推出探索基准测试,评估AI系统发现规则的能力,10个前沿模型测试结果揭示重要发现。

2 个信源67° AI 热度最后更新 2026/9/30 13:29:01

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。