8月21日
17:53
8月11日
00:35
00:35官方一手Hugging Face: Blog博客/媒体
精选
NVIDIA发布Magpie TTS,一个开放权重的多语言语音合成模型。该模型针对低延迟场景专门优化,适合部署实时语音代理。开发者通过开放权重可以完全控制部署流程,包括自定义推理配置。Magpie TTS支持多种语言,能用于构建跨语言交互系统。
事件专题

推荐理由:NVIDIA把Magpie TTS开放权重了,能自己控制部署,低延迟跑多语言语音代理,比闭源API灵活。
8月6日
23:14
18:43
18:43官方账号Microsoft Research@MSFTResearch
微软研究发布了三份AI设计手册,内容针对语言、文化、人群与社区适配。手册覆盖设计、部署和评估三个环节,帮助团队构建更具包容性的AI系统。该推文目前已有900次浏览。

推荐理由:微软研究出了三本AI设计手册,教你做AI时怎么照顾不同语言和文化背景的人,做全球业务的团队可以当参考。
7月24日
11:36
11:36IT之家博客/媒体
77°
Anthropic 将 Claude Opus 和 Sonnet 模型纳入语音模式,此前仅 Haiku 支持语音对话。Sonnet 和 Opus 专为复杂问题设计,能给出深入回答并执行任务,例如将对话整理成推介方案或重新安排日历行程。语音模式新增支持法语、德语、西班牙语等 9 种语言。用户可在同一对话中自由切换文字与语音,也能随时更换模型。
事件专题

推荐理由:Anthropic 这次把 Opus 和 Sonnet 的语音模式开了,以前只有 Haiku 能用,现在能跟更强的模型聊复杂问题,还能让它帮你整理方案、改行程,支持多国语言,挺实用的。
7月23日
21:33
21:32
21:32OpenRouter@OpenRouterAI
Deepgram推出Aura-2多语言文本转语音模型。该模型基于Deepgram的规范Aura-2语音目录,支持英语、西班牙语、德语、法语、荷兰语、意大利语和日语共7种语言。用户可通过OpenRouter平台使用此服务。
推荐理由:Deepgram发布了Aura-2多语言TTS,能生成7种语言的语音,现已上架OpenRouter,适合需要多语种语音合成的场景。
7月22日
7月20日
16:08
16:08官方一手Pandaily@contact@pandaily.com (Pandaily)
76°
ByteDance Seed 团队发布 Seed Audio 1.0 音频生成模型,支持语音、音效和环境声的统一编排。该模型提供逐帧精度的时间轴控制,可精细调整每个音频元素的起止和混合。支持超过 20 种语言,面向电影级声音创作场景。
事件专题

推荐理由:字节跳动新出的 Seed Audio 1.0,能对音频做精确到帧的控制,做电影级音效、语音、环境声都行,还支持20多种语言。
7月17日
22:13
7月14日
19:54
19:54官方账号Decoder@Tomislav Bezmalinović
精选
Anthropic发布新研究,分析了Claude模型在不同语言中的价值表达。研究将数千个术语映射到四个核心维度。结果显示Claude在印地语中表现出更多温暖,在俄语中表现出更多严谨。这揭示了语言对AI回答的塑造作用,并提出了方法论问题。
事件专题

推荐理由:Anthropic发现Claude说印地语时更暖心,说俄语时更较真。有趣的研究,看看你的语言会影响AI怎么对你。
7月8日
09:55
09:55官方账号arXiv cs.AI@Andrea Alfarano, Andrea Bacciu, Saab Mansour, Amin Mantrach, Marcello Federico
该研究首次在22种语言(涵盖高、中、低资源)上系统评估了9种不确定性估计方法。发现用英文推理(即使问题为低资源语言)能显著提升UE性能,并缩小与高资源语言的性能差距。研究还指出,小规模模型下基于概率的开放盒方法更优,大规模模型下封闭盒的自我表述不确定性更有效。论文提供了多语言选择性预测中阈值选择的指导。
推荐理由:这篇论文用22种语言、9种方法实测发现:让模型用英文思考能大幅改善低资源语言的不确定性估计,选方法还得看模型大小。
7月3日
09:57
09:57官方账号arXiv cs.AI@A. Seza Doğruöz, Xixian Liao, Verena Blaschke, Jakob Prange, Senyu Li, David Ifeoluwa Adelani
该论文分析了ACL Anthology中650篇提及LLM-as-a-Judge的论文,发现仅33篇关注低资源或多语言场景。研究发现存在不一致的评价结果、对LLM判断过度信任以及普遍依赖单一评判模型的问题。作者基于分析提出了针对多语言和低资源环境下使用LLM-as-a-Judge的具体建议。
推荐理由:这篇论文很实在,直接指出LLM-as-a-Judge在多语言场景下不靠谱,只找出33篇相关研究还一堆问题。做NLP评估的朋友建议看看。
6月24日
07:34
6月19日
11:31
11:31官方账号arXiv cs.AI@Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev
LiveCodeBench (LCB) 是广泛采用的代码生成基准,但仅限Python。新基准Multi-LCB将LCB任务转化为12种编程语言,包括Python、C++、Java等,保持原始污染控制和评估协议。研究者在Multi-LCB上评估了24个LLM,发现模型存在Python过拟合、语言特定污染和跨语言性能差异。Multi-LCB为多语言代码评估提供了严格的新基准,直接暴露了当前LLM在Python之外的短板。
推荐理由:想测AI写代码的真本事?别只看Python了。Multi-LCB覆盖12种语言,一测就知道模型是不是只会Python,结果可能让你意外。
6月16日
09:11
09:11官方账号ElevenLabs@elevenlabsio
ElevenLabs 推出 Music v2 SDK,开发者可通过文本提示生成音乐,人声、乐器和编曲质量相比 v1 显著提升。新版本支持参考匹配现有音轨,实现风格或结构复制。多语言输出功能增强,支持非英语语言生成更自然的音乐。

推荐理由:ElevenLabs 的 Music v2 SDK 让开发者直接用文字生成音乐,还能参考现有曲子做匹配,多语言效果也不错,做音视频应用很实用。
6月12日
02:32
02:32官方账号Pika Labs@pika_labs
Pika Labs 通过 MCP 接口推出 Language Swap 技能,允许用户将视频中的语音替换为其他语言,同时保留原声的音色和口型。该功能支持 40 多种语言,可自动生成字幕并选择多种样式。创作者只需一条指令即可让视频中的自己说任何语言,极大降低了多语言内容制作的门槛。目前该功能已在 Pika MCP 中可用。
推荐理由:做多语言视频内容的创作者终于可以省去重新录制和配音的麻烦——Pika 的 Language Swap 直接克隆你的声音并换语言,还带字幕,做短视频或跨国营销的团队值得立刻试试。
6月10日
01:33
01:33官方账号Decoder@Matthias Bastian
Google 发布了 Gemini 3.5 Live Translate,这是一个音频模型,支持超过70种语言的实时语音翻译。系统无需等待句子结束即可连续翻译,并声称能保留说话者的语调、语速和音高。在 Google Meet 中,语言支持从5种跃升至70多种。这标志着实时翻译技术的重要进步,尤其对跨国会议和多语言沟通场景有重大影响。
事件专题

推荐理由:跨国团队和频繁开会的用户终于有了靠谱的实时翻译工具——Gemini 3.5 不仅支持70+语言,还能保留说话者的语气和节奏,建议在 Google Meet 中直接体验。