有人实测 DeepSeek 后感叹 Visual Primitives 帮了大忙,虽然视觉能力还差点意思,讨论挺有意思。
#视觉模型
共 17 条 · 7 天 0 条 · 30 天 3 条
信息流里打上「视觉模型」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月26日
DeepSeek 展现出色表现,Visual Primitives 带来明显提升
9月22日
9月18日
9月2日
8月22日
Deepseek发布实验性Flash视觉模型,在智能体基准测试中与Opus 4.8匹敌
Deepseek新推出的V4-Flash-Vision-Exp模型,将图像理解能力与文本处理结合,在多模态智能体基准测试中表现优异,与Opus 4.8不相上下,值得一试。
8月13日
Cohere 视觉模型 North Micro Vision 支持 Axolotl 微调
想微调 Cohere 的视觉模型 North Micro Vision?现在用 Axolotl 就能跑,不用自己买显卡,直接上手试试吧。
7月17日
商汤开源统一视觉模型SenseNova-Vision,登顶HuggingFace排行榜
商汤把检测、分割、深度预测、3D重建全塞进一个开源模型,还在HuggingFace拿了第一,做视觉的兄弟可以试试。
7月15日
7月7日
蚂蚁集团LingBot-Vision 1.1B参数模型超越Meta 7B DINOv3
蚂蚁用1.1B参数的视觉模型干翻了Meta的7B DINOv3,空间感知能力更强,参数少这么多还拿下12个第一,值得看看细节。
6月24日
5月28日
5月25日
人类视觉对齐的甜点:生成式与判别式学习的平衡
这项研究解决了计算机视觉中一个长期争论:人类视觉更接近生成式还是判别式模型?答案是两者平衡。对视觉AI研究者和模型设计者来说,这是一个值得关注的结论,建议在模型训练中尝试混合目标。
5月20日
超越预测精度:目标空间恢复轮廓评估模型-大脑对齐
做视觉模型与脑科学交叉研究的团队,终于有了一个能诊断模型到底恢复了大脑哪些维度的工具,而不是只看一个精度数字。建议做fMRI或视觉编码模型的点开,看完会重新理解什么才是真正的模型-大脑对齐。
5月17日
5月16日
5月13日
Interfaze混合架构:专精任务吊打Gemini/Claude/GPT
做 OCR、视觉或音频处理的团队,终于有了一个又准又快又便宜的替代方案——Interfaze 用混合架构把通用大模型的痛点解决了,建议直接看博客跑一下自己的用例。