#MLLM
共 27 条 · 7 天 1 条 · 30 天 4 条
信息流里打上「MLLM」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月5日
10月2日
9月25日
研究揭示 MLLM 视觉-文本对齐分数可能是几何假象
有人测试了 13 个多模态模型,发现 CKA 这些常用的对齐指标根本测不出视觉信息是否真被用上,还给出了新指标 PA gap,做可解释性分析的值得看看。
9月10日
9月9日
8月14日
8月12日
8月11日
7月17日
论文09:59
多模态大模型的科学可视化素养基准测试这篇论文用49道题测了Gemini、GPT-4等6个模型对科学图表的理解力,发现Gemini最强但人类平均还是更高,开源模型差距明显,想了解模型真实视觉推理能力可以一读。
7月16日
7月15日
论文09:19
1B以下多模态情感语言模型Light-MER:知识蒸馏实现高效识别他们挑战了多模态情感模型必须大的假设,用知识蒸馏搞出<1B的Light-MER,9个基准超了大模型还更快,做部署的可以看看。
7月13日
论文10:50
十年视觉语言AI模型进化:准确性与视觉认知错误分析这篇论文用新数据集CSB系统地测了十年间视觉语言模型的进化,发现最新模型在复杂社交场景上已经跟人类顶级描述差不多准了,只有空间依赖错误还没完全解决。
7月1日
论文10:08
操作级视觉令牌跳过:高效多模态大模型推理方法这篇论文告诉你如何在不牺牲性能的前提下大幅降低多模态大模型的计算量。他们在Qwen3-VL上砍了33.7%的算力,性能只掉了0.5%,方法很巧妙。
6月29日
6月26日
6月25日
相同证据不同答案:多模态大模型中排序敏感性的审计
这篇论文用Facet-Probe测试了18个主流多模态大模型,发现它们对输入顺序都很敏感,最好的模型也错13.4%,提醒我们模型可靠性还不是想象中那么好。
6月24日
论文12:11
IV-CoT:隐式视觉思维链用于结构感知文本到图像生成这篇论文解决了文生图模型在物体数量、空间位置等结构细节上经常翻车的问题,用隐式思维链单次前向传播搞定,在GenEval和T2I-CompBench上效果更好。
6月18日
6月16日
论文09:44
OmniTraffic:面向时空交通推理的可控生成管道与基准测试想研究交通场景的多模态推理?OmniTraffic提供了大规模可控数据集和基准,还能用模拟数据微调小模型提升真实表现,很实用。
6月15日
6月5日
Benchmark Agent:全自动构建评测基准,无需人工干预
做 LLM 评测的团队终于有了自动化工具——Benchmark Agent 能持续生成新基准,避免模型性能饱和,建议做模型评估的开发者直接试试。
5月19日
ESI-Bench:具身空间智能基准,揭示感知-行动闭环关键缺陷
做具身智能、机器人或空间推理的团队,ESI-Bench 直接点出了当前 MLLM 在主动探索和行动决策上的致命短板,看完会重新思考你的感知-行动闭环设计。