17:53Hunyuan@TXhunyuan腾讯混元推出Hy-MT2-1.8B和Hy-MT2-30B-A3B翻译模型,支持33种语言,适用于结构化、上下文和风格引导的多语言任务。AI产品腾讯混元翻译模型OpenRouterAI推荐理由:腾讯混元翻译模型上线OpenRouterAI,支持多种语言,比传统翻译更精准。原文稍后读已读值得跟进有用关注 腾讯混元
05:12HeyGen@HeyGen_OfficialHeyGen推出Translate应用,能把房地产经纪人的市场更新视频翻译成多种语言。经纪人可通过app.heygen.com/apps/translate使用该功能。翻译后的视频能触达不熟悉英语的潜在买家,扩大受众范围。同一段视频无需重拍,即可覆盖更多客户群体,提升成交机会。AI产品HeyGenTranslate视频翻译推荐理由:HeyGen的Translate能把你的视频自动翻成多语言,做海外房产的经纪人不愁语言不通了,一个视频吃遍所有买家。原文稍后读已读值得跟进有用关注 HeyGen
12:58AK@_akhaliq精选SWE-Bench ProMax 是一个新基准,用于评估 AI 智能体在大规模多语言代码重构任务上的表现。该基准基于 SWE-Bench 扩展,覆盖多种编程语言,任务规模更大。论文已在 Hugging Face 发布,旨在测试智能体处理复杂重构的能力。初步数据显示,现有模型在该基准上仍有较大提升空间。论文SWE-Bench ProMax代码重构智能体推荐理由:想测测你的 AI 编程助手在多语言重构上到底行不行?这个新基准 SWE-Bench ProMax 就是干这个的,比原来的 SWE-Bench 更狠。原文稍后读已读值得跟进有用关注 SWE-Bench ProMax
00:35官方一手Hugging Face: Blog(博客/媒体)精选NVIDIA发布Magpie TTS,一个开放权重的多语言语音合成模型。该模型针对低延迟场景专门优化,适合部署实时语音代理。开发者通过开放权重可以完全控制部署流程,包括自定义推理配置。Magpie TTS支持多种语言,能用于构建跨语言交互系统。AI模型Magpie TTSNVIDIA语音合成10 个信源在谈事件专题推荐理由:NVIDIA把Magpie TTS开放权重了,能自己控制部署,低延迟跑多语言语音代理,比闭源API灵活。原文稍后读已读值得跟进有用关注 Magpie TTS
23:14Fish Audio@FishAudioFish Audio的多语言AI配音功能支持80余种语言。创作者可将视频内容配音为多种语言,面向全球观众分发。该功能基于其TTS技术,专为内容本地化设计。AI产品Fish AudioAI配音TTS推荐理由:Fish Audio现在能给你视频配上80多种语言的AI配音,想做海外市场的话,这个工具挺实用。原文稍后读已读值得跟进有用关注 Fish Audio
18:43官方账号Microsoft Research@MSFTResearch微软研究发布了三份AI设计手册,内容针对语言、文化、人群与社区适配。手册覆盖设计、部署和评估三个环节,帮助团队构建更具包容性的AI系统。该推文目前已有900次浏览。技巧Microsoft Research包容性AIAI设计指南推荐理由:微软研究出了三本AI设计手册,教你做AI时怎么照顾不同语言和文化背景的人,做全球业务的团队可以当参考。原文稍后读已读值得跟进有用关注 Microsoft Research
11:36IT之家(博客/媒体)77°Anthropic 将 Claude Opus 和 Sonnet 模型纳入语音模式,此前仅 Haiku 支持语音对话。Sonnet 和 Opus 专为复杂问题设计,能给出深入回答并执行任务,例如将对话整理成推介方案或重新安排日历行程。语音模式新增支持法语、德语、西班牙语等 9 种语言。用户可在同一对话中自由切换文字与语音,也能随时更换模型。AI产品Claude OpusSonnetAnthropic10 个信源在谈事件专题推荐理由:Anthropic 这次把 Opus 和 Sonnet 的语音模式开了,以前只有 Haiku 能用,现在能跟更强的模型聊复杂问题,还能让它帮你整理方案、改行程,支持多国语言,挺实用的。原文稍后读已读值得跟进有用关注 Claude Opus
04:34Claude@claudeaiClaude AI 的语音模式(Voice mode)新增支持西班牙语、法语、印地语和日语。该功能在免费版和所有付费计划中均可使用。更新于今日以公开测试版形式在移动端、桌面端和网页端推出。用户可下载 Claude 移动应用,点击声波图标开始对话。AI产品Claude语音模式多语言推荐理由:Claude 语音现在能说西班牙语、法语、印地语和日语了,而且所有用户都能用,快去 app 上试试。原文稍后读已读值得跟进有用关注 Claude
04:33Claude@claudeai72°Claude 语音模式现已基于更强大的模型运行,支持用户在对话中途调用已连接的工具(如代码解释器、搜索等)。该功能支持更多语言,可边说话边解决复杂问题。Anthropic 在 X 平台宣布此更新,获得 3229 次点赞。AI产品ClaudeAnthropic语音模式10 个信源在谈事件专题推荐理由:Claude 的语音模式现在能边聊边调用工具,还支持更多语言,解决复杂问题更顺手了。原文稍后读已读值得跟进有用关注 Claude
21:58官方账号阿里通义 Qwen@Alibaba_Qwen71°阿里发布Qwen-Audio-3.0-TTS文本转语音模型,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签(如whisper、angry、breaths、laughs)和自由自然语言控制(如“读慢点像睡前故事”)。支持16种语言,能从嘈杂参考音频中生成干净输出。支持一次生成长达3分钟的语音。在Artificial Analysis TTS排行榜上位列第一。AI模型Qwen-Audio-3.0-TTS阿里TTS推荐理由:阿里出了个TTS新模型,能用标签控制笑声耳语,还能自然语言调语速,排行榜第一,支持16语言。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
21:33OpenRouter@OpenRouterAIDeepgram 推出 Nova-3,一款通用语音转文字模型,支持单语和多语转写。该模型在 OpenRouter 平台上可用,提供高精度转录能力。Nova-3 延续了 Deepgram 在语音识别领域的优势,适用于多种场景。AI模型DeepgramNova-3语音转文字推荐理由:Deepgram 出了 Nova-3,语音转文字更准了,还支持多语言,做转录工具很实用。原文稍后读已读值得跟进有用关注 Deepgram
21:32OpenRouter@OpenRouterAIDeepgram推出Aura-2多语言文本转语音模型。该模型基于Deepgram的规范Aura-2语音目录,支持英语、西班牙语、德语、法语、荷兰语、意大利语和日语共7种语言。用户可通过OpenRouter平台使用此服务。AI模型DeepgramAura-2OpenRouter推荐理由:Deepgram发布了Aura-2多语言TTS,能生成7种语言的语音,现已上架OpenRouter,适合需要多语种语音合成的场景。原文稍后读已读值得跟进有用关注 Deepgram
17:43官方账号阿里云 Alibaba Cloud@alibaba_cloud81°阿里巴巴发布 Qwen-Image-3.0 图像生成模型,可处理长达4.5k tokens的提示词,实现复杂布局(如报纸、考卷、3×3信息图)的一次生成。该模型支持10px级文字清晰渲染、完整 LaTeX 论文页面输出,并能生成逼真的皮肤纹理和发丝细节。内置12种语言原生渲染、100多种艺术风格,具备世界知识和实时网页检索能力。AI模型Qwen-Image-3.0阿里巴巴图像生成推荐理由:阿里新图模型 Qwen-Image-3.0 能一次生成复杂图文排版,文字小到10px也清晰,考卷报纸都能画,实用性强。原文稍后读已读值得跟进有用关注 Qwen-Image-3.0
21:56官方账号阿里通义 Qwen@Alibaba_Qwen78°Qwen-Image-3.0 是阿里巴巴第三代基础图像生成模型,支持最长 4.5k token 的复杂布局生成,可一次性输出报纸、故事板、试卷、3x3 信息图网格及画中画 UI。模型实现 10px 可读文本、完整 LaTeX 论文页面、毛孔发丝级细节。原生支持 12 种语言、100+ 艺术风格,并集成实时网络检索能力。AI模型Qwen-Image-3.0阿里巴巴图像生成推荐理由:阿里新出的 Qwen-Image-3.0 能直接生成带看懂文字的报纸和试卷,细节连毛孔都清晰,做设计或电商配图很实用。原文稍后读已读值得跟进有用关注 Qwen-Image-3.0
03:01官方账号Cohere@cohereCohere 宣布其开源语音识别模型 Cohere Transcribe 月下载量突破100万,自发布以来总下载量达到237万。该模型专注于多语言和全球适用性,采用开源模式。这一数字反映了开源语音识别模型的强劲需求。AI产品CohereCohere Transcribe语音识别推荐理由:Cohere Transcribe 用237万总下载量证明开源语音模型真香,月活破百万说明大家都在用。原文稍后读已读值得跟进有用关注 Cohere
16:52小互@imxiaohu76°通义推出 Qwen-Audio-3.0-TTS 语音模型,支持 16 种语言和 20 种方言。首包延迟仅 300 毫秒级。同一段参考音可跨 16 种语言保持音色一致。在 CV3-Eval 基准上,说话人相似度 16 个语种全部排第一,Plus 平均得分 82.75 分(百分制)。AI模型Qwen-Audio-3.0-TTS通义语音合成推荐理由:通义新出的语音模型,一段音就能说16种语言,还能保持音色,延迟才300毫秒,挺实用的。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
11:32官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里云发布最新语音合成模型Qwen-Audio-3.0-TTS,提供Flash和Plus两个版本。Flash针对实时交互场景优化,Plus侧重高质量生成。该模型支持16种语言的多语言覆盖,并引入自然语言风格控制功能。通过细粒度标签可控制非语言细节,如呼吸、停顿等。语音克隆能力增强,能从含噪或不完美音频中提取声音特征。AI模型Qwen-Audio-3.0-TTSAlibaba Cloud语音合成推荐理由:阿里云新TTS模型有两个版本,一个快一个精,支持16种语言,还能用自然语言调风格,语音克隆也更强了。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
16:08官方一手Pandaily@contact@pandaily.com (Pandaily)76°ByteDance Seed 团队发布 Seed Audio 1.0 音频生成模型,支持语音、音效和环境声的统一编排。该模型提供逐帧精度的时间轴控制,可精细调整每个音频元素的起止和混合。支持超过 20 种语言,面向电影级声音创作场景。AI模型Seed Audio 1.0ByteDance音频生成1 个信源在谈事件专题推荐理由:字节跳动新出的 Seed Audio 1.0,能对音频做精确到帧的控制,做电影级音效、语音、环境声都行,还支持20多种语言。原文稍后读已读值得跟进有用关注 Seed Audio 1.0
07:58Ethan Mollick@emollick用户以中文请求 Kimi K3 挑选两首不陈腐且适用于 LLM 的诗,但模型在思维链中 95.5% 的字符(88% 的单词)使用英文,即便它明确考虑的是面向中文读者的中文诗歌。这一比例揭示模型在处理中文任务时可能依赖英文推理空间。测试基于单次交互,未涉及更大规模统计。AI模型Kimi K3思维链多语言10 个信源在谈事件专题推荐理由:Kimi K3 回应中文请求时,思维链几乎全英文,挺有意思的观察,适合好奇模型内部机制的朋友。原文稍后读已读值得跟进有用关注 Kimi K3
22:13小互@imxiaohuGemma 4支持140多种语言,开箱即用即可使用35种以上语言,包括中文。在LiveKit Agents中切换至Gemma 4 31B只需一行配置,调整模型指向即可。该模型专为多语言语音Agent场景优化,提供广泛的覆盖能力。AI模型Gemma 4LiveKit Agents多语言3 个信源在谈事件专题推荐理由:用LiveKit搭语音Agent?改一行配置就能切到Gemma 4 31B,支持140多种语言,中文也在内。原文稍后读已读值得跟进有用关注 Gemma 4
19:54官方账号Decoder@Tomislav Bezmalinović精选Anthropic发布新研究,分析了Claude模型在不同语言中的价值表达。研究将数千个术语映射到四个核心维度。结果显示Claude在印地语中表现出更多温暖,在俄语中表现出更多严谨。这揭示了语言对AI回答的塑造作用,并提出了方法论问题。论文ClaudeAnthropic多语言10 个信源在谈事件专题推荐理由:Anthropic发现Claude说印地语时更暖心,说俄语时更较真。有趣的研究,看看你的语言会影响AI怎么对你。原文稍后读已读值得跟进有用关注 Claude
15:48小互@imxiaohuAnthropic分析了30万段Claude对话,发现使用英语时Claude最谨慎也最深入,俄语最严格(挑战假设、纠正细节),印地语最温暖,荷兰语最坦率(承认错误)。中文对话中,Claude的偏移很小,最突出的三个行为是指出竞争因素、反驳错误假设、不带评判地提供安慰,体现了一种中庸风格。论文ClaudeAnthropic价值观10 个信源在谈事件专题推荐理由:Anthropic用30万段对话告诉你:中文Claude不讨好也不冷硬,像个讲道理的顾问,挺有意思的。原文稍后读已读值得跟进有用关注 Claude
03:36官方账号Anthropic@AnthropicAI精选Anthropic发布推文称,Claude在不同语言对话中表达的价值观差异显著,主要体现在温暖性与严谨性维度。在印地语和阿拉伯语对话中,Claude更倾向于温暖回应;在俄语对话中则偏向严谨,常要求用户提供支持证据。该发现基于Claude实际对话行为分析。AI模型ClaudeAnthropic多语言10 个信源在谈事件专题推荐理由:Anthropic发现Claude在不同语言里性格还不一样,印地语温暖,俄语较真,挺有意思的发现原文稍后读已读值得跟进有用关注 Claude
07:21@koltregaskes@koltregaskes字节跳动今日推出Seedream 5.0 Pro,一款侧重设计理解的图像生成模型。它可一次性生成含正确布局、图表和密集准确文本的信息图,支持点选/套索编辑、素描渲染、十六进制颜色替换及自动图层分离。模型原生支持超过10种语言,并遵循相应排版规则。在光照、材质和皮肤纹理处理上有显著提升,能捕捉运动模糊和自然光交互等细节。AI模型Seedream 5.0 ProByteDance图像生成2 个信源在谈事件专题推荐理由:想生成带精准文字和复杂布局的图片?ByteDance新模型Seedream 5.0 Pro能一次搞定,还能交互编辑,比多数模型更懂设计。原文稍后读已读值得跟进有用关注 Seedream 5.0 Pro
09:55官方账号arXiv cs.AI@Andrea Alfarano, Andrea Bacciu, Saab Mansour, Amin Mantrach, Marcello Federico该研究首次在22种语言(涵盖高、中、低资源)上系统评估了9种不确定性估计方法。发现用英文推理(即使问题为低资源语言)能显著提升UE性能,并缩小与高资源语言的性能差距。研究还指出,小规模模型下基于概率的开放盒方法更优,大规模模型下封闭盒的自我表述不确定性更有效。论文提供了多语言选择性预测中阈值选择的指导。论文不确定性估计多语言MCQA推荐理由:这篇论文用22种语言、9种方法实测发现:让模型用英文思考能大幅改善低资源语言的不确定性估计,选方法还得看模型大小。原文稍后读已读值得跟进有用关注 不确定性估计
14:43IT之家(博客/媒体)72°阿里千问升级Fun-ASR-Realtime语音识别模型,单模型支持30种语言和16种方言。在覆盖八大方言区的16种方言测试中,字符准确率平均为88.62%,12类方言上领先火山与腾讯。首字延迟控制在百毫秒级别,流式识别准确率接近离线。针对泰语等东南亚语言优化,识别准确率提升20%。离线版Fun-ASR-Flash在Artificial Analysis上字错率1.7%,位列全球第一。AI模型阿里千问Fun-ASR-RealtimeFun-ASR-Flash推荐理由:阿里千问发了新语音模型,支持30种语言+16种方言,方言准确率干过火山腾讯,离线版字错率全球最低。原文稍后读已读值得跟进有用关注 阿里千问
09:57官方账号arXiv cs.AI@A. Seza Doğruöz, Xixian Liao, Verena Blaschke, Jakob Prange, Senyu Li, David Ifeoluwa Adelani该论文分析了ACL Anthology中650篇提及LLM-as-a-Judge的论文,发现仅33篇关注低资源或多语言场景。研究发现存在不一致的评价结果、对LLM判断过度信任以及普遍依赖单一评判模型的问题。作者基于分析提出了针对多语言和低资源环境下使用LLM-as-a-Judge的具体建议。论文LLM-as-a-Judge低资源语言多语言推荐理由:这篇论文很实在,直接指出LLM-as-a-Judge在多语言场景下不靠谱,只找出33篇相关研究还一堆问题。做NLP评估的朋友建议看看。原文稍后读已读值得跟进有用关注 LLM-as-a-Judge
14:35IT之家(博客/媒体)OpenAI发布2026年Q1消费级产品使用报告。注册6个月的用户日均消息量比注册时增加50%,尝试任务类型翻番。女性特征用户占比超50%,35岁以上用户消息占比提升。非英语用户占活跃用户半数以上,西班牙语、葡萄牙语、阿拉伯语为前三。非洲和亚洲周活跃用户增速最快,人类发展指数较低国家增长领先。消费级工作用途中视觉设计成为增长最快任务类型。行业OpenAIChatGPT用户增长10 个信源在谈事件专题推荐理由:OpenAI用真实数据告诉你ChatGPT到底谁在用:非洲和亚洲用户暴增,非英语用户已过半,35岁以上用户越来越多。原文稍后读已读值得跟进有用关注 OpenAI
10:40官方一手arXiv: DeepSeek@Camilo Chacón SartoriEMPATH是一个多语言审计-法官基准,用于评估情感支持聊天机器人的安全性。该基准使用审计模型模拟求助用户,基于140个种子指令和34个人设生成多轮对话,法官模型从19个指标(分属五个维度)评分。基准在墨西哥西班牙语和美国英语上构建,研究发现标准评分在19个指标中的10个上存在膨胀,校准后恢复了区分度。在三个前沿模型(含一个开源模型)上测试,聚合分数差异在0.74分内,但具体指标差异可达6分。运行间可靠性差,deepseek-v4-pro在温度0下每次运行生成不同对话。AI模型EMPATH情感支持聊天机器人AI安全推荐理由:这个新基准EMPATH专测情感支持聊天机器人的安全漏洞,用AI模拟求助者进行多语言多轮对话,发现主流模型评分虚高且不稳定,值得一做。原文稍后读已读值得跟进有用关注 EMPATH
22:45官方账号Runway ML@runwaymlRunway 在 API 中推出了 Localize ads Recipe,支持通过单一 API 调用翻译静态广告和图形资产。用户只需输入一张广告图像,即可获得任意语言版本的输出。该功能旨在简化多市场广告素材的本地化流程,无需手动重新设计。目前该功能已可通过 Runway API 使用。AI产品RunwayAPI广告本地化推荐理由:Runway 新出的本地化广告功能,一张图像丢进去,API 直接吐出多语言版本,省去挨个翻译的麻烦。原文稍后读已读值得跟进有用关注 Runway
07:34官方账号Mistral AI@MistralAIMistral 推出 OCR 4,独立标注员对600多份真实文档进行盲评,涵盖12种以上语言。在所有对比系统中,OCR 4 被优先选择,平均胜率达72%。该结果基于随机排序的双盲测试,标注员无法识别系统来源。AI模型MistralOCR 4OCR推荐理由:Mistral 的 OCR 4 盲测赢了所有对手,处理多国语言文档很稳,平均胜率72%,值得试试。原文稍后读已读值得跟进有用关注 Mistral
11:31官方账号arXiv cs.AI@Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii BabaevLiveCodeBench (LCB) 是广泛采用的代码生成基准,但仅限Python。新基准Multi-LCB将LCB任务转化为12种编程语言,包括Python、C++、Java等,保持原始污染控制和评估协议。研究者在Multi-LCB上评估了24个LLM,发现模型存在Python过拟合、语言特定污染和跨语言性能差异。Multi-LCB为多语言代码评估提供了严格的新基准,直接暴露了当前LLM在Python之外的短板。AI模型Multi-LCBLiveCodeBench代码生成推荐理由:想测AI写代码的真本事?别只看Python了。Multi-LCB覆盖12种语言,一测就知道模型是不是只会Python,结果可能让你意外。原文稍后读已读值得跟进有用关注 Multi-LCB
09:11官方账号ElevenLabs@elevenlabsioElevenLabs 推出 Music v2 SDK,开发者可通过文本提示生成音乐,人声、乐器和编曲质量相比 v1 显著提升。新版本支持参考匹配现有音轨,实现风格或结构复制。多语言输出功能增强,支持非英语语言生成更自然的音乐。AI产品ElevenLabsMusic v2音乐生成推荐理由:ElevenLabs 的 Music v2 SDK 让开发者直接用文字生成音乐,还能参考现有曲子做匹配,多语言效果也不错,做音视频应用很实用。原文稍后读已读值得跟进有用关注 ElevenLabs
16:25IT之家(博客/媒体)精选微信支付 AI 接入工具箱 2.0 全面支持中、英、日、韩、法等 9 种语言,全球开发者可用母语对接。2.0 版本覆盖微信支付全线产品知识,新增技术专家与金融级研发专家能力,实现报错定位修复闭环及代码质量审查。新增 CLI 动态排障,开发者可通过自然语言实时查询支付单状态,无需切换环境。文档转为 Mermaid 格式后,Token 消耗比原始 HTML 文档降低 50%,并支持自动同步官网更新。AI产品微信支付AI 接入工具箱支付接入1 个信源在谈事件专题推荐理由:微信支付更新了 AI 接入工具箱,现在能直接用中文等9种语言对接,Token 省一半,还加了自动排障和代码审查,开发接入更方便。原文稍后读已读值得跟进有用关注 微信支付
02:32官方账号Pika Labs@pika_labsPika Labs 通过 MCP 接口推出 Language Swap 技能,允许用户将视频中的语音替换为其他语言,同时保留原声的音色和口型。该功能支持 40 多种语言,可自动生成字幕并选择多种样式。创作者只需一条指令即可让视频中的自己说任何语言,极大降低了多语言内容制作的门槛。目前该功能已在 Pika MCP 中可用。AI产品PikaMCP/工具语音克隆推荐理由:做多语言视频内容的创作者终于可以省去重新录制和配音的麻烦——Pika 的 Language Swap 直接克隆你的声音并换语言,还带字幕,做短视频或跨国营销的团队值得立刻试试。原文稍后读已读值得跟进有用关注 Pika
04:32官方一手Hugging Face: Blog(博客/媒体)ServiceNow AI 发布了一项针对前沿自动语音识别(ASR)模型在代码切换语音上的基准测试。代码切换指说话者在同一句话中混合使用两种语言,这在多语言用户中很常见。测试发现,当前最先进的ASR模型在处理这种混合语言时表现不佳,错误率显著高于单语言场景。该研究强调了构建能理解双语用户的语音代理的挑战,并提供了公开基准供开发者评估和改进模型。这对于开发面向多语言市场的语音助手和客服系统至关重要。论文语音代理ASR代码切换1 个信源在谈事件专题推荐理由:做语音助手或客服系统的团队会发现,当前ASR模型在双语用户面前漏洞百出——代码切换场景的错误率远高于单语言,这个基准测试直接暴露了痛点,建议点开看看你的模型能否过关。原文稍后读已读值得跟进有用关注 语音代理
03:08官方账号Jeff Dean@JeffDeanGoogle 在语音翻译领域长期投入,最新推出 Gemini 3.5 Live Translate 模型,支持超过 70 种语言的语音到语音实时翻译。该模型旨在让跨语言对话更自然,已集成到 Google Translate 和 Google AI Studio 的 Live API 中。合作伙伴 Grab 正在利用该技术帮助司机与乘客沟通,展示了实际应用场景。这是 Google 在语音翻译领域的最新进展,有望提升日常应用中的多语言交流体验。AI产品语音翻译Gemini 3.5实时翻译推荐理由:Google 把语音翻译推进到新阶段,70+ 语言实时互译对跨国出行、客服、会议场景的团队是直接利好,开发者可以立刻通过 Live API 接入试试。原文稍后读已读值得跟进有用关注 语音翻译
01:33官方账号Decoder@Matthias BastianGoogle 发布了 Gemini 3.5 Live Translate,这是一个音频模型,支持超过70种语言的实时语音翻译。系统无需等待句子结束即可连续翻译,并声称能保留说话者的语调、语速和音高。在 Google Meet 中,语言支持从5种跃升至70多种。这标志着实时翻译技术的重要进步,尤其对跨国会议和多语言沟通场景有重大影响。AI产品实时翻译语音模型Google Meet3 个信源在谈事件专题推荐理由:跨国团队和频繁开会的用户终于有了靠谱的实时翻译工具——Gemini 3.5 不仅支持70+语言,还能保留说话者的语气和节奏,建议在 Google Meet 中直接体验。原文稍后读已读值得跟进有用关注 实时翻译
00:46Philipp Schmid@_philschmid83°Google 发布了基于 Gemini 3.5 的实时翻译功能,支持 70 多种语言和 2000 多个语言对。该功能能够自然翻译语音,在嘈杂环境中也能正常工作,并且与说话者保持同步,无延迟和尴尬停顿。它还能自动检测正在使用的语言。目前已在 Google Translate(Android 和 iOS)、Gemini API(公开预览)和 Google Meet(私人预览)中可用。这被认为是消除语言障碍的重要一步。AI产品Gemini 3.5实时翻译Google Translate推荐理由:Google 用 Gemini 3.5 把实时翻译做到了实用级别,70+语言、无延迟、抗噪,跨语言沟通的团队和旅行者可以直接在 Google Translate 里体验,语言障碍的终结可能真的开始了。原文稍后读已读值得跟进有用关注 Gemini 3.5
23:36IT之家(博客/媒体)76°谷歌发布实时语音互译音频模型 Gemini 3.5 Live Translate,可自动识别70多种语言并生成保留说话者语调、语速和音高的自然翻译语音。该模型在等待上下文和即时翻译之间取得平衡,避免传统轮流翻译的尴尬停顿,仅比说话者慢几秒。即日起陆续登陆谷歌翻译App、Gemini Live API、Google AI Studio和Google Meet等产品。普通用户通过Android和iOS版谷歌翻译即可使用,Android还将推出“聆听模式”,用户可像接电话一样将手机贴耳收听翻译。AI产品谷歌Gemini 3.5 Live Translate实时语音翻译推荐理由:跨语言交流的痛点终于被解决了——Gemini 3.5 Live Translate 让实时翻译不再尴尬停顿,做国际会议、多语言直播或海外业务的团队可以直接在谷歌翻译 App 里体验,建议试试。原文稍后读已读值得跟进有用关注 谷歌