10:17官方账号arXiv cs.AI@Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo论文提出首个视觉模式完成偏差基准,基于Design2Code数据集的30个网页生成1440张测试截图。评估5个多模态大语言模型,平均偏差率在卡片宽度扰动上达69.78%,文字字号上达80.22%,准确率仅21.17%和7.89%。Codex-5.3表现最佳,但准确率从卡片任务的68.61%降至文字任务的13.89%,Flash-3.0在文字任务上偏差率高达96.11%。噪声、更细微扰动和边界位置会进一步提高偏差率。论文Codex-5.3Flash-3.0Design2Code推荐理由:论文测了五个多模态模型做截图转代码填空,发现它们都按重复UI模式猜答案,最强Codex-5.3文字准确率也只有13.89%。原文稍后读已读值得跟进有用关注 Codex-5.3