#视觉语言模型
共 82 条 · 7 天 3 条 · 30 天 14 条
信息流里打上「视觉语言模型」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
10月6日
10月1日
9月30日
9月29日
9月24日
AI Engineer World's Fair 2026 视觉与 OCR 议题上线
AI Engineer 把 2026 大会的视觉 OCR 场次全放出来了,LlamaIndex 和 Hugging Face 的人都来讲实战,做文档和视觉应用的很值得刷一遍。
9月18日
研究揭示视觉语言模型抗干扰能力与提示词冗长的关系
这个研究挺有意思的,它发现给AI模型问问题的时候,用更详细、更啰嗦的描述,能让模型在处理有问题的图片时更不容易出错,比如把‘有猫吗?’改成‘请仔细看并回答:有猫吗?’。
9月11日
InclusionAI 发布 Ling 3.0 Flash VL,语言表现更强,新增视觉感知和高级视觉代理能力
InclusionAI 新出的 Ling 3.0 Flash VL 模型,语言能力更强,还能处理图片,可以做更复杂的视觉任务,比之前的版本好用。
9月10日
9月9日
9月6日
9月3日
9月2日
9月1日
8月28日
8月27日
论文09:53
TAU-Agent:交通异常理解代理检索增强框架TAU-Agent 是一款用于交通异常理解的新框架,通过结合视频字幕和跟踪工具,实现了对交通视频的异常检测和解释,其在基准测试中的表现值得一看。
8月25日
8月24日
论文09:52
基于视觉语言模型的心脏消融规划LGE-MR图像质量评估这篇论文提出了一种基于视觉语言模型的心脏消融规划LGE-MR图像质量评估方法,通过两个阶段的模型预测图像质量,有助于提高消融过程的安全性。与现有方法相比,InternVL2和DeepSeek在准确性和临床可用性方面表现出色。
8月18日
论文15:33
InstaBind-Lite:量化视觉语言模型密集同类属性错绑想测多模态模型在拥挤场景里会不会张冠李戴?这个新基准InstaBind-Lite能精准量化,开源模型错绑率近20%,比想象中严重。
8月14日
8月13日
Cohere 发布 North Micro Vision,最小视觉语言模型
Cohere 出了个超小的视觉模型 North Micro Vision,专门用来读懂复杂文档,而且开源了,直接去 Hugging Face 就能下载权重。
8月11日
8月10日
8月7日
8月5日
论文11:41
CARE-X:统一辅助监督与奖励对齐的胸片视觉语言模型医学影像领域的小伙伴可以看看这篇,CARE-X 把胸片分类、定位、报告生成整合到一个模型里,还靠工具调用做解剖测量,临床实用性比纯生成模型强不少。
8月4日
7月27日
7月22日
7月14日
7月9日
论文09:16
创造力源自摩擦:探索性结构设计中的人机交互这篇研究说AI一味追求“省事”反而帮倒忙——结构设计需要“摩擦”来激发灵感。他们用视觉语言模型做了个交互系统,帮设计师边想边改,保留思考摩擦,去掉重复劳动。