16:07宝玉@dotey精选宝玉将 OpenMOSS 开源的 MOSS-Transcribe-Diarize-0.9B 集成到剪映工具 BaoCut 中,可直接输出带精确时间戳和说话人标注的结构化转写结果。该模型无需专用发言人识别模型,但转录速度比 Qwen3-ASR-0.6B 慢,且不支持标点符号,自定义 Prompt 与热词也未生效。项目地址为 github.com/OpenMOSS/MOSS-Transcribe-Diarize。AI模型BaoCutOpenMOSSMOSS-Transcribe-Diarize-0.9B推荐理由:宝玉给 BaoCut 集成了 MOSS-Transcribe-Diarize-0.9B,能一次搞定长音频转写和说话人标注,省去额外模型,适合做字幕或会议记录。原文稍后读已读值得跟进有用关注 BaoCut
16:06宝玉@dotey精选OpenMOSS 开源了 MOSS-Transcribe-Diarize-0.9B 模型,参数规模 0.9B,支持 128K 上下文,最长可一次处理约 90 分钟音频。该模型采用 Whisper-Medium 编码器 + Qwen3-0.6B 风格 decoder,端到端完成转写、说话人分离和时间对齐,无需级联流程。在单张 4090 显卡上,RTF 为 0.017,5-10 分钟录音约 30 秒转完,并支持热词增强。模型以 Apache 2.0 协议开源,可商用。AI模型OpenMOSSMOSS-Transcribe-Diarize-0.9BWhisper推荐理由:OpenMOSS 开源了一个 0.9B 参数的端到端模型,能一次搞定 90 分钟多人音频,告诉你谁说了什么、什么时候说的,单卡 4090 跑得飞快。原文稍后读已读值得跟进有用关注 OpenMOSS
08:41berryxia@berryxia精选72°OpenMOSS 发布 MOSS-VL-Realtime,一个 11B 参数的多模态模型,支持实时视频流交互,可边接收视频边生成回复。采用 Cross-Attention 架构和 XRoPE 位置编码,支持 256K 上下文窗口,兼容文本、单图/多图、视频及图文交错输入。在流式视频理解基准上达到开源模型领先水平,主动预警和及时响应能力突出。同时开源 MOSS-VL-0708 Instruct,在细粒度感知和长视频理解任务上有明显提升。所有模型以 Apache-2.0 协议开源,支持本地部署和实时推理。AI模型OpenMOSSMOSS-VL-Realtime多模态推荐理由:OpenMOSS 发了能边看视频边聊天的实时多模态模型,11B 参数开源可部署,适合做监控、直播等持续视频理解应用。原文稍后读已读值得跟进有用关注 OpenMOSS