有人拿 OpenAI 的 Decisions API 做了个手势识别 demo,视频里精度和速度都吊打他之前的 Jev 版本,玩多模态的可以看看怎么实现的。
#视觉理解
共 16 条 · 7 天 1 条 · 30 天 3 条
信息流里打上「视觉理解」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
开发者用 OpenAI Decisions API 实现手势识别,精度超过 Jev 方案
9月10日
8月27日
Qwen3.8 Flash from Alibaba_Qwen on OpenRouter
Alibaba_Qwen新发布的Qwen3.8 Flash模型,支持多种功能,是编码助手和视觉理解的好帮手,值得一试。
8月21日
8月12日
7月19日
6月29日
6月18日
6月11日
Claude Fable 5 在 Vision Arena 综合排名第二,OCR 单项第一
Claude Fable 5 在视觉评测中拿下 OCR 第一,做文档处理、教育或图表分析的团队可以重点关注这个模型的实际表现。
6月2日
5月31日
5月23日
5月19日
SGT:用语义生成调优统一多模态模型的视觉理解与生成
做多模态模型训练的团队终于有了一个能同时提升理解和生成的后训练方法——SGT用分割任务对齐表征空间,比解耦训练更高效,做视觉AI的开发者可以直接参考代码实现。