主要来源berryxia
查看原文事件专题 · 多源确认
Qwen发布Qwen-Image-Bench,T2I评测从生成升级到创作
Qwen团队推出新基准Qwen-Image-Bench,将文本到图像(T2I)评测从简单的提示词对齐提升到真实世界保真度和创意生成能力。该基准包含56个细粒度评估维度,并配备Q-Judger自动评分器,与人类判断的相关性高达ρ=0.92。测试显示,OpenAI、Gemini、Grok、Flux等现有模型的排名被重新洗牌,差距明显。开发者、Prompt工程师和企业可用此基准评估模型、优化提示词或选择供应商。Qwen此举不仅自卷模型,还推动了评测标准的进步。
当前结论
做T2I模型开发或选型的团队,终于有了一个能区分真实创意能力的评测标准,不再只看基础对齐分,建议直接拿自己的pipeline跑一遍,数据会说话。
11 个信源72° AI 热度最后更新 2026/5/28 15:27:26
证据链
相关来源 1宝玉
查看原文相关来源 2@OpenAIDevs
查看原文相关来源 3OpenAI Blog
查看原文相关来源 4shao__meng
查看原文相关来源 5AI Will
查看原文相关来源 6Geek
查看原文相关来源 7rohanpaul_ai
查看原文相关来源 8小互
查看原文相关来源 9Lenny Rachitsky
查看原文相关来源 10Greg Brockman
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。