#Qwen3-VL
共 12 条 · 7 天 2 条 · 30 天 6 条
信息流里打上「Qwen3-VL」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
10月6日
Infinite-Dreamer:用图像编辑世界模型合成 GUI 智能体训练数据
GUI 智能体缺训练数据的老问题,这篇用图像编辑模型自己造数据,Qwen3-VL 微调后 AndroidWorld 成绩还涨了不少,代码开源可以直接试。
9月26日
用 SkyRL 在 Amazon SageMaker HyperPod 上做多模态 RL 训练
AWS 出的实操教程,手把手教你在 HyperPod 上用 SkyRL 给 Qwen3-VL-8B 做 GRPO 多模态训练,最后还能部署 LoRA 推理。
9月18日
研究揭示视觉语言模型抗干扰能力与提示词冗长的关系
这个研究挺有意思的,它发现给AI模型问问题的时候,用更详细、更啰嗦的描述,能让模型在处理有问题的图片时更不容易出错,比如把‘有猫吗?’改成‘请仔细看并回答:有猫吗?’。
9月11日
8月5日
论文11:41
CARE-X:统一辅助监督与奖励对齐的胸片视觉语言模型医学影像领域的小伙伴可以看看这篇,CARE-X 把胸片分类、定位、报告生成整合到一个模型里,还靠工具调用做解剖测量,临床实用性比纯生成模型强不少。
7月31日
论文12:53
本地 Computer-Use Agent 的推理时扩展:失败模式与计算权衡这篇论文实测了三个本地模型在 OSWorld 上的推理时扩展,发现多算不一定提升成功率,反而换着花样失败。做本地 CUA 部署的可以当避坑参考。
7月24日
7月1日
论文10:08
操作级视觉令牌跳过:高效多模态大模型推理方法这篇论文告诉你如何在不牺牲性能的前提下大幅降低多模态大模型的计算量。他们在Qwen3-VL上砍了33.7%的算力,性能只掉了0.5%,方法很巧妙。
6月15日
5月15日
MultiEmo-Bench:多标签视觉情感分析基准,评估多模态大模型
做多模态情感分析或评估 MLLMs 情感能力的团队,终于有了一个更可靠的多标签基准——MultiEmo-Bench 解决了现有数据集低估模型的问题,值得直接用于模型评测。