H-Company 聊了怎么用 NVIDIA Dynamo 优化跑 Computer Use 智能体的 VLM 服务,做 agent 推理部署的可以看看他们的实践。
#VLM
微调 VLM 的朋友看这个:不同能力峰值时间不同,挑 checkpoint 的标准可能让你丢掉可迁移能力,SSR 方法能改善 name-free 检索。
写论文的都懂流程图换个画布比例多痛苦,这篇把它做成智能体流水线,输出还是 draw.io 能直接编辑的,比图生图和文生图靠谱多了。
研究员做了 Knossos 基准加 Ariadne 框架,让 VLM 能把流程图、架构图完整转成节点和边组成的图,代码开源可试。
Sakana AI 和东大搞了个给机器人“先在模拟器里彩排再上场”的方法 SAIL,成功率能从 25% 拉到 73%,做机器人方向的可以看看。
一个自动驾驶推理数据集,41 万多帧标注把视觉证据和驾驶决策串成思维链,多个骨干模型实测轨迹误差明显下降,做自动驾驶 VLM 的可以看看。
朋友,这是篇挺有意思的论文,研究的是临床预测中 VLM 模型如何利用 ECG 数据。他们发现模型虽然能处理多模态信息,但可能没真正用到 ECG,然后提出了一种叫视觉提示词调优的方法来解决这个问题。
LlamaIndex 这个团队做了个挺有意思的事,他们把 100 种文档解析方法都测了一遍,结果发现 LlamaParse 在图表处理上特别强,而且成本还低,0.38 美分一页就能拿到 80 多分,比很多大模型都划算。
想用文档提取API?先看ExtractBench的溯源评测。多数工具给不出出处,LlamaExtract Agentic Plus在长文档上还挺得住。
LlamaParse搞了个ExtractBench,测出来商业VLM处理长文档会漏数据;他们新出的Agentic Plus准确率95.6%,成本还低。做文档提取的可以看下。
空间推理一直是视觉语言模型的硬伤,SCOUT 用新的训练方法把 3D 理解做得更准,7B 规模直接超过 GPT-4o,还能迁移到视频上。
NAS 用户看过来,威联通 Qsirch 升级了,本地跑 VLM 和 LLM,搜文件视频不用传云端,隐私和速度都照顾到。
做文档抽取的团队看过来,LlamaIndex 出了个新基准,测了14个系统在370份企业文档上的表现,发现超过50页商业模型召回率就崩了,赶紧看看你的抽取方案中招没。
这篇论文提出了HyGAE方法,让VLM智能体在多个回合的决策任务里表现更好,平均成功率91%,比别的方法高了10%,值得搞强化学习和多模态的研究者看看。
腾讯开源了三个具身模型,像搭积木一样分层解决机器人从看懂到动起来的难题,VLA 能做到毫秒级反应,做机器人开发的一定要看看。