AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

采样验证

共 1 条相关 AI 资讯
8月19日
11:38
11:38官方账号arXiv cs.LG@Javier Aguilar Martín
该研究探讨了Code World Model范式中LLM合成的可执行世界模型在连续控制环境下的认证问题。研究发现GPT-5.x在105个包含模式的样本中修复了被省略的1D夹具,在56个仪器流块中有50次完全准确(95%置信区间[0.781, 0.960])。在2D区域实验中,156个样本中没有任何工件能恢复规则,而8个有针对性的干预措施未能解决失败问题。研究证明了版本空间证书表明识别是类相对的,在最宽剂量下,20个块中有20个 declared fit 成功,20个样本一致圆中有18个在容差范围内。
论文Code World ModelGPT-5.x连续控制

推荐理由:GPT-5.x修复代码模型缺陷的实验揭示了采样验证的局限性
原文
精选全部日报登录