千问开源的多模态插件集,用 MCP 把读图、看视频、3D 建模塞进任意 Agent,纯文本 Agent 直接升级,想给 Agent 加眼睛的可以试试。
Qwen 团队开源 Qwen-MM-Plugins,一套原生多模态插件集,通过 Skill 加 MCP 双层解耦,把读图、读视频、读文档、听音、建模等能力注入任意 Agent harness。项目包含七大模块:core 视觉基础支持动态分辨率读取、OCR、SAM3 分割、ASR;video-memory 用层次化图记忆支撑 2 小时级长视频问答;omni-av 基于 Qwen-Omni 做带时间戳的 ASR 与时序定位;video-edit 覆盖图视频音频生成与剪辑;blender 和 freecad 分别提供 22 个和 14 个工具驱动 3D 建模与参数化 CAD;edu-agent 纯 Skill 把理科题转成中文讲解视频。
[开源推荐] Qwen-MM-Plugins 千问团队开源的「原生多模态插件集」,把"读图 / 读视频 / 读文档 / 听音 / 建模"等视觉与多模态能力,以 MCP 形式注入任意 Agent ha...
[开源推荐] Qwen-MM-Plugins 千问团队开源的「原生多模态插件集」,把"读图 / 读视频 / 读文档 / 听音 / 建模"等视觉与多模态能力,以 MCP 形式注入任意 Agent harness,让纯文本 Agent 一键升级为多模态原生 Agent github.com/QwenLM/Qwen-MM… # 项目核心理念:Skill + MCP 的双层解耦 一个能力 = 一个 Skill + 一个可选 MCP server · Skill:写给模型看的 SKILL.md,告诉模型"存在这套工具、何时该用",本质是模型侧的提示词资产。 · MCP server:工具本体,由 uvx 在首次调用时按需拉起,进程隔离、依赖隔离。 # 七大能力模块 1. core - 视觉基础 动态分辨率读取(图/视频/文档/3D)、OCR、grounding、SAM3 分割、ASR、视觉对话、Serper 联网搜索 2. video-memory - 长视频记忆 层次化图记忆 + 语义检索,支撑 2 小时级超长视频问答,首次提问自动构建 memory 3. omni-av - 音视频原生理解 基于 Qwen-Omni,带时间戳/说话人标签的 ASR、时序定位、事件计数、音乐标签 4. video-edit - 生成与剪辑 图/视频/音频生成 + 剪辑工作流 5. blender - 3D 建模瘦客户端 22 个工具驱动正在运行的 Blender(Python thin client),建模/材质/灯光/渲染 6. freecad - 参数化 CAD 瘦客户端 14 个工具驱动 FreeCAD,含 STEP/STL 导入导出与 FEM 分析 7. edu-agent - 讲题视频生成 纯 Skill,把数学/理科题转成中文逐步讲解视频(基于 HyperFrames) Qwen @Alibaba_Qwen 👀 Seeing is just the beginning. With Qwen-MM-Plugins, turn your favorite agent harness multimodal-native — read images, videos & documents, edit videos, work with 3D/CAD, and more. From multimodal models → multimodal agents. 🚀 Watch it in action: https://t.co/C2jQObXryM Your browser does not support the video tag. 🔗 View on Twitter 🔗 View Quoted Tweet 💬 2 🔄 0 ❤️ 0 👀 377 📊 2 ⚡