11:38官方账号arXiv cs.LG@Javier Aguilar Martín该研究探讨了Code World Model范式中LLM合成的可执行世界模型在连续控制环境下的认证问题。研究发现GPT-5.x在105个包含模式的样本中修复了被省略的1D夹具,在56个仪器流块中有50次完全准确(95%置信区间[0.781, 0.960])。在2D区域实验中,156个样本中没有任何工件能恢复规则,而8个有针对性的干预措施未能解决失败问题。研究证明了版本空间证书表明识别是类相对的,在最宽剂量下,20个块中有20个 declared fit 成功,20个样本一致圆中有18个在容差范围内。论文Code World ModelGPT-5.x连续控制推荐理由:GPT-5.x修复代码模型缺陷的实验揭示了采样验证的局限性原文稍后读已读值得跟进有用关注 Code World Model