事件专题 · 多源确认

LLM测试时计算扩展:2年后仍被忽视的教训

自OpenAI o1发布以来,业界已知LLM的测试时计算扩展(test-time compute scaling)能显著提升模型性能。然而两年后,实验室仍仅报告标量评估结果,安全组织在发现脚手架通过100倍推理获得更好表现时仍感惊讶,且RSP(责任扩展政策)在决定关键阈值时仍忽略推理预算。这暴露了AI安全评估中的系统性盲点,即未将推理计算量作为关键变量纳入考量。

当前结论

AI安全评估的盲点被戳穿了——忽视推理预算的RSP和标量评估正在让安全组织措手不及,做AI安全或模型评估的团队值得反思自己的测试框架。

11 个信源58° AI 热度最后更新 2026/6/12 03:48:05

证据链

主要来源Noam Brown (OpenAI 推理)
查看原文
相关来源 6Mira Murati (TML)
查看原文
相关来源 7Dylan Patel (SemiAnalysis)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情