SciFigQual-Bench:面向科学图像质量评估的全文本基准
SciFigQual-Bench是一个全新的科学图像质量评估基准,涵盖2020至2025年间顶级计算机科学会议的6308张图像,由多个领域专家在清晰度、布局、标题匹配、上下文相关性和误导风险五个维度进行独立评分并聚合为黄金标准。该基准将每张图像与其标题、引用句和论文上下文绑定,不同于仅做视觉表面比较的以往研究。在eval1200测试子集上,配备GPT-5.6-Sol的SFQ-Agent(F3)取得了最低平均绝对误差0.418和最高一致率93.4%,显著优于直接评估和辅助VLM方案。