#视觉推理
共 17 条 · 7 天 2 条 · 30 天 5 条
信息流里打上「视觉推理」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
论文06:25
CVPR 2026 ReLearn 工作坊:机器还能向人类学什么Efros、Damen、Manling Li 三个人在 CVPR 2026 聊机器还能从人类学什么,从数据增广聊到空间推理缺口,观点挺尖锐。
10月2日
10月1日
9月26日
Epoch AI 发布家具组装基准 FAB,OpenAI GPT-6 Astra 准确率达 80%
Epoch AI 搞了个新基准,让 AI 看照片对照说明书找宜家家具装错的地方,GPT-6 Astra 拿了 80 分,还顺带测出了各家模型的不同毛病。
8月6日
8月3日
7月13日
论文10:50
十年视觉语言AI模型进化:准确性与视觉认知错误分析这篇论文用新数据集CSB系统地测了十年间视觉语言模型的进化,发现最新模型在复杂社交场景上已经跟人类顶级描述差不多准了,只有空间依赖错误还没完全解决。
6月25日
论文11:01
TriViewBench:多视图结构推理的受控复杂度基准这篇论文用TriViewBench测了18个多模态模型,发现它们都在多视图推理上崩得厉害,CoT也救不了。想了解当前MLLM的结构推理极限,可以看看。
6月23日
6月17日
NVIDIA 发布 SpatialClaw:用代码作为空间推理智能体的动作接口
SpatialClaw 不用额外训练,靠写代码搞定复杂视觉任务,在 20 个基准上平均提升 11.2 分,还兼容多种模型。
6月12日
6月3日
6月1日
NVIDIA 发布 Cosmos 3:首个全开放物理 AI 全能模型
做机器人或自动驾驶的团队终于有了一个全开源的物理世界模型——Cosmos 3 原生支持视觉推理和动作生成,32B 和 8B 两个版本覆盖不同算力场景,值得直接上手试试。
5月30日
论文16:45
斯坦福SAIL发布VAGEN:强化学习训练VLM智能体构建内部世界模型VAGEN解决了VLM智能体在复杂环境中缺乏内部世界模型的问题,做机器人或自动驾驶研究的团队值得关注,它可能让AI的决策更接近人类推理。
5月15日