全部 AI 动态 · AI 热点

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

6月2日

09:39

09:39

arXiv cs.AI@Sicheng Yang, Shulan Ruan, Shiwei Wu, Yu Liu, Lu Fan, Zhi Li, You He

72°

PolySpeech-100 是一个大规模语音理解基准，覆盖 110 种语言变体，包括 19 种中文方言和 80 多种低资源语言。它采用混合构建流程，结合人工录音和指令驱动合成语音，解决了现有基准偏重高资源语言、仅关注 ASR 而非语义推理、忽视方言的问题。评估 22 个模型（如 Gemini-3、GPT-Audio、Qwen2.5-Omni）后发现：开源端到端模型在重方言上优于级联系统，但低资源语言上性能严重下降；链式思维提示在零样本设置下反而降低大多数模型的语音理解能力。该基准为下一代包容性语音大模型建立了严格标准，数据和代码已开源。

论文语音理解基准测试多语言/方言端到端模型开源/仓库

推荐理由：语音理解基准终于覆盖了方言和低资源语言，做多语言语音模型或方言应用的团队可以直接用这个基准来评估自己的模型，避免只测英语的偏科问题。

5月29日

10:01

10:01

小互@imxiaohu

76°

ElevenLabs 发布了 Dubbing V2，这是一款端到端的 AI 配音模型，彻底改变了传统配音流程。它不再依赖“先转写、再翻译、最后合成”的三段式拼接，而是直接基于原始表演建模声音，将音色、情绪和演绎风格完整保留并穿越到每一种目标语言中。这意味着同一个人开口讲六国语言，听上去仍是本人，连呼吸节奏和情绪都对得上。该模型支持 90 多种语言和口音，可输入音频、视频或文字，自动完成声音克隆、同步感知翻译和措辞本地化，无需手动设置。官方演示展示了在荒岛求生、财务对白和童话故事等场景下的无缝切换效果。

AI产品 ElevenLabs AI配音端到端模型多语言声音克隆

推荐理由：做视频本地化、游戏配音或跨国内容创作的团队，终于有了能保留原片表演灵魂的配音工具——不用再忍受机械翻译和音色断裂，直接上传视频就能出成品，建议立刻试一下。