10:11官方一手arXiv: DeepSeek@Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei一项新研究让大语言模型在1小时内从空文件开始编写ASP理论,并用求解器在环评估。在CLEVR、GQA、CLEVRER三个VQA基准上,Claude Sonnet 4.6、Claude Opus 4.7、DeepSeek V4 Pro均达CLEVR 100%、GQA 92.8%-98.8%。GPT-5在CLEVR达98.7%,但在GQA仅41.8%。加入其他数据集的手写参考理论后,GPT-5准确率下降3-19个百分点,而其他前沿模型变化不超过±3.4个百分点。研究者已开源代码、提示词和蒸馏出的理论。论文答案集编程CLEVRGQA推荐理由:让模型自己从零写ASP规则,Claude、GPT-5等九个模型限时1小时。CLEVR有人拿满分,GQA上GPT-5跌到41.8%。原文稍后读已读值得跟进有用关注 答案集编程