主要来源Together AI
查看原文事件专题 · 多源确认
DecagonAI 借助 Together AI 将语音代理成本降低近6倍
DecagonAI 通过与 Together AI 合作,将语音代理每轮对话成本降低近6倍,同时保持实时语音所需的低延迟。他们从闭源模型迁移到微调的开源模型,实现 p95 模型延迟低于400ms。采用自定义投机解码和提示缓存技术,并在 NVIDIA Blackwell 上优化服务部署。模型更新频率达到每周甚至每日,体现了从封闭 API 到开放模型的转变。
当前结论
DecagonAI 把语音成本砍到原来的1/6,延迟还压到400ms以下,实时语音项目可以参考他们迁移开源模型的做法。
7 个信源67° AI 热度最后更新 2026/6/19 10:38:52
证据链
相关来源 1vLLM
查看原文相关来源 2Gary Marcus
查看原文相关来源 3Decoder
查看原文相关来源 4pandaily
查看原文相关来源 5Nous Research
查看原文相关来源 6marktechpost
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。