主要来源arXiv: DeepSeek
查看原文事件专题 ·官方一手
CTE-Bench:评估状态化软件模拟器的反事实追踪
CTE-Bench-Core-v1 包含 255 个场景,覆盖 6 个确定性 Python 服务,每个模型需进行 10,200 次预测。主要评分指标是效果步骤值匹配(VM),在干预改变的 2,476 个未来调用中,四个 API 托管模型(DeepSeek V4-Flash、Kimi K2.5、Qwen3.6-35B-A3B 和 Claude Sonnet 4.6)在正确反馈下达到 54.3%-61.5% 的效果步骤 VM。隐藏这些响应后,效果步骤 VM 降至 23.2%-28.9%,基于自我生成预测的条件下为 24.8%-33.2%,最多只有 1.2% 的场景被完全预测。
当前结论
CTE-Bench 评估模型能否预测干预如何改变状态化服务的未来行为,揭示了当前模型在缺乏正确反馈时的局限性。
2 个信源41° AI 热度最后更新 2026/9/29 03:49:10
证据链
2 个信源相关来源 1ARC Prize
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。