论文11:10Evaluating VLMs for Agent-Driven Geometry Clipping Detection in Game QA这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。#Gemini#GPT#Qwen#GemmaaarXiv cs.AI@Carlos Celemin 等 5 人原文稍后读已读值得跟进有用关注 Gemini
论文精选11:21TempGlitch:评估视觉语言模型在游戏视频中的时间性故障检测能力游戏QA团队和VLM研究者终于有了专门测试时间性故障的基准——当前模型表现接近随机,说明这是个硬骨头,做自动化测试的值得关注。#视觉语言模型#游戏QA#故障检测#时间推理aarXiv cs.AI@Yakun Yu 等 7 人原文稍后读已读值得跟进有用关注 视觉语言模型