10:09官方一手arXiv: OpenAI@Binglin Chen, Rajarshi Haldar, Max Fowler, Matthew West, Craig Zilles本文针对编程入门阶段开放式简答题的反馈,提出一个基于教育文献的五项标准评估反馈质量,包括认可正确部分、识别错误、提供改进指导、保持答案适当隐藏和使用合适的对话语气。研究比较了OpenAI o1 LLM生成的反馈与九位助教对90份学生回答的反馈,结果显示LLM在人类评估者眼中平均表现优于助教,但LLM在评估自身输出时存在自我偏好偏差,这为LLM在教育环境中应用提出方法论上的挑战。论文OpenAI o1教育反馈LLM评估1 个信源在谈事件专题推荐理由:这篇论文详细比较了人类助教和LLM在编程反馈上的表现,揭示了LLM评估自身输出的偏差问题,对于关注教育领域AI应用的人来说值得一读。原文稍后读已读值得跟进有用关注 OpenAI o1
11:48官方账号Noam Brown (OpenAI 推理)@polynoamial精选自OpenAI o1发布以来,业界已知LLM的测试时计算扩展(test-time compute scaling)能显著提升模型性能。然而两年后,实验室仍仅报告标量评估结果,安全组织在发现脚手架通过100倍推理获得更好表现时仍感惊讶,且RSP(责任扩展政策)在决定关键阈值时仍忽略推理预算。这暴露了AI安全评估中的系统性盲点,即未将推理计算量作为关键变量纳入考量。行业测试时计算扩展AI安全推理预算10 个信源在谈事件专题推荐理由:AI安全评估的盲点被戳穿了——忽视推理预算的RSP和标量评估正在让安全组织措手不及,做AI安全或模型评估的团队值得反思自己的测试框架。原文稍后读已读值得跟进有用关注 测试时计算扩展