moss·product

MOSS

别名
首次出现
2026-05-23
最近出现
2026-07-27
累计提及
19
§ 01综述

MOSS 是由 OpenMOSS 社区开发的系列开源多模态 AI 模型,涵盖实时视频理解、多说话人语音识别、语音克隆等方向,以模块化设计和端到端能力为特点。近期,MOSS 家族在 Hugging Face 等平台发布多个新模型,引发关注。

MOSS 近期进展

  • 实时视频流多模态模型 MOSS-VL-Realtime:OpenMOSS 开源了该模型,支持实时视频理解,拓展了 MOSS 在多模态交互上的应用。 OpenMOSS 开源实时视频流多模态模型 MOSS-VL-Realtime
  • 端到端多说话人 ASR 模型 MOSS-Transcribe-Diarize-0.9B:2025 年 5 月,MosiAI 发布该模型(0.9B 参数),实现端到端多说话人转录,被 vLLM 和 LMSYS 社区推荐。 MosiAI 发布 MOSS-Transcribe-Diarize-0.9B 开源端到端多说话人转录模型
  • 语音克隆模型 MOSS-TTS-Local Transformer v1.5:该模型集成于 SGLang-Omni,提供本地语音克隆能力,降低了语音合成门槛。 SGLang-Omni 集成 MOSS-TTS-Local Transformer v1.5 开源语音克隆模型
  • 统一音频模型 MOSS-Audio:该模型统一处理语音、音乐和环境音,曾登顶 Hugging Face,展现了 MOSS 在通用音频理解上的突破。 MOSS-Audio开源模型统一语音、音乐、环境音,登顶Hugging Face
  • 当前焦点与观察点

    MOSS 系列模型正向多模态、轻量化、端到端方向快速迭代,覆盖视频、语音、音频等多个感知通道。其开源策略吸引了开发者社区关注,如 SGLang、vLLM 等框架已集成部分模型。然而,MOSS 的智能体工作流尚未形成共享基础,如 OptiverGlobal 专家指出,多数智能体工作流难以累积复用,这或是 MOSS 生态需要解决的长期问题。总体而言,MOSS 在开源多模态模型领域已占据一席之地,后续需关注其工具链成熟度与应用落地。

    § 02相关报道09 条在档
    1. 01
      特斯拉车主驾驶Model 3连续2万英里FSD零接管创纪录
      IT之家
    2. 02
      OpenMOSS 发布 MOSS-Transcribe-Diarize-0.9B,端到端多人长音频转写模型
      宝玉
    3. 03
      BaoCut 集成 OpenMOSS 开源 MOSS-Transcribe-Diarize-0.9B,实现带说话人标注的长音频转写
      宝玉
    4. 04
      OpenMOSS 开源实时视频流多模态模型 MOSS-VL-Realtime
      berryxia
    5. 05
      MOSS-Transcribe-Diarize-0.9B 开源,端到端多说话人ASR模型
      LMSYS Org (SGLang)
    6. 06
      MosiAI 发布 MOSS-Transcribe-Diarize-0.9B 开源端到端多说话人转录模型
      vLLM
    7. 07
      智能体工作流大多不能累积,OptiverGlobal专家谈如何构建共享基础
      AI Engineer
    8. 08
      SGLang-Omni 集成 MOSS-TTS-Local Transformer v1.5 开源语音克隆模型
      LMSYS Org (SGLang)
    9. 09
      MOSS-Audio开源模型统一语音、音乐、环境音,登顶Hugging Face
      berryxia
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/MOSS