AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

Qwen2.5-VL-7B-Instruct

共 2 条相关 AI 资讯
7月13日
09:17
09:17官方账号arXiv cs.LG@Spiros Baxevanakis, Peng-Jian Yang
研究测试时扩展(TTS)是否适用于小规模开源视觉语言模型,使用EXAMS-V多语言视觉多项选择基准。实验对比self-consistency、describe-then-reason结合PRM引导束搜索等方法,基于Qwen2.5-VL-7B-Instruct和Qwen3.5-4B。关键因素是链的可解析性:提示格式导致链正确但不输出答案,加入答案提示和修复步骤后改善。每链token上限从1k升至2k恢复3.7个百分点,但增加链数从8到16仅提升0.15个百分点。PRM束搜索落后普通self-consistency 0.39个百分点且成本高8倍,最佳配置在ImageCLEF 2026测试集达84.1%并排名第一。
论文Qwen2.5-VL-7B-InstructQwen3.5-4BEXAMS-V

推荐理由:这篇论文告诉你,在小模型上用测试时扩展,关键是让模型把答案写出来,而不是复杂搜索。Qwen2.5-VL调参后性价比很高。
原文
7月3日
09:42
09:42官方一手arXiv: Google DeepMind@Ismail Ismail Tijjani, Ahmad Abubakar Mustapaha, Sunusi Ibrahim Muhammad, Muhammad Bashir Aliyu
本研究评估了五种视觉语言模型(Gemini 2.0 Flash Exp、Qwen2.5-VL-7B-Instruct、GPT-4o、Claude 4 Sonnet、Llama 3.2 Vision 90b)在尼日利亚车牌识别中的零样本学习表现。使用包含88张真实环境图像的测试集,基于字符错误率(CER)指标,Gemini与Qwen在准确性和鲁棒性上显著优于其他模型。该工作对比了VLM与传统YOLO+OCR管线的优劣,并质疑了模型提供商的性能宣称。
论文Gemini 2.0 Flash ExpQwen2.5-VL-7B-Instruct零样本学习

推荐理由:用真实非洲场景测了5个主流VLM,发现Gemini和Qwen在车牌识别上比YOLO+OCR更准,有数据有对比。
原文
精选全部日报登录