7月21日
12:33
12:33官方账号arXiv cs.AI@Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tran Dinh Tien, Ahmed Elhagry, Salwa K. Al Khatib, Tianjun Yao, Yonina C. Eldar, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen
本研究针对ChatGPT、Gemini、Qwen-Image等现代VLM的像素级图像篡改检测,提出简单域泛化训练框架,包含平衡小批量采样和后期注入策略。在OOD VLM(GPT-Images-2.0、Gemini-3.1、FLUX.2、Seedream 4.5)上,该方法相比先前最优PIXAR,平均gIoU和cIoU分别相对提升26.1%和26.8%。代码已开源于GitHub。
推荐理由:他们用两个简单技巧,让检测AI改图的模型在GPT、Gemini等新模型上比之前最好的PIXAR强了26%多,代码也开源了,搞图像安全的可以试试。