主要来源Noam Brown (OpenAI 推理)
查看原文事件专题 · 多源确认
LLM测试时计算扩展:2年后仍被忽视的教训
自OpenAI o1发布以来,业界已知LLM的测试时计算扩展(test-time compute scaling)能显著提升模型性能。然而两年后,实验室仍仅报告标量评估结果,安全组织在发现脚手架通过100倍推理获得更好表现时仍感惊讶,且RSP(责任扩展政策)在决定关键阈值时仍忽略推理预算。这暴露了AI安全评估中的系统性盲点,即未将推理计算量作为关键变量纳入考量。
当前结论
AI安全评估的盲点被戳穿了——忽视推理预算的RSP和标量评估正在让安全组织措手不及,做AI安全或模型评估的团队值得反思自己的测试框架。
11 个信源58° AI 热度最后更新 2026/6/12 03:48:05
证据链
相关来源 1John Schulman
查看原文相关来源 2IT之家
查看原文相关来源 3Decoder
查看原文相关来源 4OpenAI Blog
查看原文相关来源 5AI Will
查看原文相关来源 6Mira Murati (TML)
查看原文相关来源 7Dylan Patel (SemiAnalysis)
查看原文相关来源 8Gary Marcus
查看原文相关来源 9小互
查看原文相关来源 10rohanpaul_ai
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。