OpenAI 出了两款转录模型,GPT-Live-Transcribe 实时转录延迟低,GPT-Transcribe 批量处理更便宜,错误率比 Whisper 低一半多。
OpenAI 推出 GPT-Live-Transcribe 和 GPT-Transcribe 两种转录模型,已开放 API 调用。GPT-Live-Transcribe 专为低延迟实时转录设计,费用每分钟 0.017 美元;GPT-Transcribe 用于异步转录,费用每分钟 0.0045 美元。在 Context Aware ASR 基准上,GPT-Transcribe 语义准确率从无上下文的 41.6% 提升至有上下文的 45.2%。在 Common Voice 22 种语言上,GPT-Transcribe 转录错误率为 19.27%,低于 Whisper(whisper-1)的 40.37%。在真实世界音频九种语言上,其转录错误率 8.98%,Whisper 为 15.21%。
IT之家 7 月 29 日消息,OpenAI 公司今天(7 月 29 日)在 X 平台发布公告, 宣布推出 GPT-Live-Transcribe 和 GPT-Transcribe 两种转录模型,并支持通过 API 方式调用。 调用费用方面 GPT-Live-Transcribe 转录费用为每分钟 0.017 美元(IT之家注:现汇率约合 0.12 元人民币) GPT-Transcribe 转录费用为每分钟 0.0045 美元(现汇率约合 0.03 元人民币) OpenAI 官方表示相比公司此前模型,上述两种转录模型可以更好地理解上下文,并能在各种口音和语言的真实世界音频上提供更准确的转录,包括短语、数字、专业术语以及带有响亮背景噪音的语音。 GPT-Live-Transcribe 是专为低延迟实时转录而构建;而 GPT-Transcribe 可以优化已完成音频文件和批量工作负载的异步转录。 在 Context Aware ASR 基准测试上,GPT-Transcribe 语义准确率从无自由形式上下文的 41.6% 提高到有上下文的 45.2%。 在 Common Voice 的 22 种语言上,GPT-Transcribe 的转录错误率为 19.27%,而 Whisper (whisper-1) 为 40.37%。在真实世界音频录制基准的九种语言上,它实现了 8.98% 的转录错误率,而 Whisper (whisper-1) 为 15.21%。