做T2I模型开发或选型的团队,终于有了一个能区分真实创意能力的评测标准,不再只看基础对齐分,建议直接拿自己的pipeline跑一遍,数据会说话。
Qwen团队推出新基准Qwen-Image-Bench,将文本到图像(T2I)评测从简单的提示词对齐提升到真实世界保真度和创意生成能力。该基准包含56个细粒度评估维度,并配备Q-Judger自动评分器,与人类判断的相关性高达ρ=0.92。测试显示,OpenAI、Gemini、Grok、Flux等现有模型的排名被重新洗牌,差距明显。开发者、Prompt工程师和企业可用此基准评估模型、优化提示词或选择供应商。Qwen此举不仅自卷模型,还推动了评测标准的进步。
Qwen新发布的Qwen-Image-Bench,把T2I评测从“生成”直接拉到“创作”: 56个…
Qwen新发布的Qwen-Image-Bench,把T2I评测从“生成”直接拉到“创作”:
56个细粒度facet + ρ=0.92人类对齐Q-Judger,OpenAI、Gemini、Grok、Flux全得重排座次!
大家还在死磕提示词对齐,Qwen却证明:真实世界保真度和创意生成能力才是真正差距。
新基准1000条prompt+56个rubric,可解释诊断,现有SOTA模型差距肉眼可见。
那么,对于我们有什么实际使用价值呢?
实际怎么用?(收藏) 1. 开发者/研究者:把自己的T2I pipeline(不管是Qwen自家模型、GPT-4o图像、Gemini的Imagen系列、Grok的Flux集成还是开源SD3)扔到这个benchmark上跑一遍。
重点看Real-world Fidelity和Creative Generation两个支柱的得分,就能知道真实差距在哪。
2. Prompt工程师:以后写复杂创意prompt时,可以用Q-Judger先自测一下生成结果在56个facet上的表现,快速迭代,而不是靠人工肉眼判断。
3. 企业/产品方:要选T2I供应商或者自研图像生成时,把Qwen-Image-Bench当作新标杆。
别再只看“prompt alignment”这种基础分了,直接看创意和保真度得分,更接近真实商业场景。
4. 对比实验:论文已经证明,它在区分领先模型上的分离度远超老基准。
想验证自己模型有没有进步?用这个跑前后对比,数据会说话。
Qwen这次的打法很清晰:不光自己卷模型,还把评测标准往前推了一大步。
就像当年Scaling Law出来后大家才知道该怎么卷参数一样,这次Qwen-Image-Bench把“从生成到创作”的评价框架给立住了。