8月22日
03:38
03:38官方账号Decoder@Matthias Bastian
Deepseek推出V4-Flash-Vision-Exp,一个实验性多模态模型,为V4-Flash的文本能力添加图像理解。在公司自己的多模态智能体基准测试中,其性能接近Opus 4.8,有时甚至超越它。

推荐理由:Deepseek新推出的V4-Flash-Vision-Exp模型,将图像理解能力与文本处理结合,在多模态智能体基准测试中表现优异,与Opus 4.8不相上下,值得一试。
8月13日
17:54
17:54官方账号Cohere@cohere
精选
Cohere 宣布其视觉模型 North Micro Vision 已集成至开源微调框架 Axolotl。用户无需自备 GPU 或服务器,即可直接开始训练该模型。Axolotl 官方文档已提供 Cohere 模型的配置说明,地址为 docs.axolotl.ai。这降低了视觉模型微调的门槛。
推荐理由:想微调 Cohere 的视觉模型 North Micro Vision?现在用 Axolotl 就能跑,不用自己买显卡,直接上手试试吧。
7月15日
01:36
01:36Fireworks AI@FireworksAI_HQ
Fireworks AI举办免费月度DevRel网络研讨会,主题为微调开放视觉模型从杂乱收据图片中提取结构化JSON。活动将于本周四上午10点(太平洋时间)开始,全程在Fireworks平台上管理。研讨会包括近期发布介绍和微调入门指导。
推荐理由:想学怎么用Fireworks微调视觉模型处理收据数据?这个免费直播手把手教你,还能了解最新工具。
7月7日
16:36
16:36官方一手pandaily@contact@pandaily.com (Pandaily)
蚂蚁集团发布LingBot-Depth 2.0空间感知模型,其LingBot-Vision基础模型仅1.1B参数,在12项世界首次基准测试中超越Meta的7B DINOv3。模型在深度估计、3D重建等任务上取得领先性能。该成果展示了小参数模型在特定领域通过优化实现大模型效果的可能性。

推荐理由:蚂蚁用1.1B参数的视觉模型干翻了Meta的7B DINOv3,空间感知能力更强,参数少这么多还拿下12个第一,值得看看细节。
6月24日
03:42
03:42官方一手marktechpost@Asif Razzaq
精选
Datalab发布了lift,一个9B参数的开源视觉模型。该模型能将PDF与图像转换为符合给定schema的JSON结构。它使用schema约束解码确保输出有效,并训练弃权机制避免幻觉,在225份文档的基准上达到90.2%的字段准确率。
推荐理由:Datalab的lift模型能自动把PDF转成你需要的JSON格式,准确率90.2%,还不会瞎编字段。
5月25日
5月17日
09:35