#多语言
共 80 条 · 7 天 1 条 · 30 天 9 条
信息流里打上「多语言」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月3日
10月1日
9月29日
9月25日
BRIDGE ASR 2.0 发布:18 种印度语言加西语葡语越语的真实对话语音识别基准
humynlabs 出了个语音识别新基准,专测真实对话和混语言场景,23 个模型已上榜,做语音方向的可以拿来自测。
9月16日
谷歌推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 实时对话模型,支持 97 种语言切换
谷歌出了两个新的实时对话模型,支持 97 种语言切换,能自动检测语言,还能在对话中调用工具,比之前的模型更智能。
IT之家原文
9月11日
研究评估英语-约鲁巴语代码切换语音的ASR和音频语言模型
这个研究很实用,它详细分析了不同AI模型在处理英语和约鲁巴语混合语音时的表现差异,特别是那些切换点错误率的数据,对做相关研究或评估模型的人很有参考价值。
9月10日
9月9日
9月2日
8月21日
8月18日
8月11日
SWE-Bench ProMax:大规模多语言代码重构智能体基准
想测测你的 AI 编程助手在多语言重构上到底行不行?这个新基准 SWE-Bench ProMax 就是干这个的,比原来的 SWE-Bench 更狠。
8月6日
7月24日
Claude Opus、Sonnet 模型现已支持语音模式
Anthropic 这次把 Opus 和 Sonnet 的语音模式开了,以前只有 Haiku 能用,现在能跟更强的模型聊复杂问题,还能让它帮你整理方案、改行程,支持多国语言,挺实用的。
7月23日
模型21:32
Deepgram Aura-2 发布,支持7种语言文本转语音Deepgram发布了Aura-2多语言TTS,能生成7种语言的语音,现已上架OpenRouter,适合需要多语种语音合成的场景。
Qwen-Image-3.0 发布:阿里第三代图像生成模型,支持4.5k tokens长提示和10px清晰文字
阿里新图模型 Qwen-Image-3.0 能一次生成复杂图文排版,文字小到10px也清晰,考卷报纸都能画,实用性强。
7月22日
7月21日
7月20日
7月19日
7月17日
7月14日
7月9日
字节跳动发布Seedream 5.0 Pro图像模型,侧重设计理解与文本渲染
想生成带精准文字和复杂布局的图片?ByteDance新模型Seedream 5.0 Pro能一次搞定,还能交互编辑,比多数模型更懂设计。
7月8日
7月6日
单模型支持30种语言+16种方言,阿里千问升级Fun-ASR-Realtime语音识别模型
阿里千问发了新语音模型,支持30种语言+16种方言,方言准确率干过火山腾讯,离线版字错率全球最低。
IT之家原文
7月3日
论文09:57
LLM-as-a-Judge在多语言和低资源语言中的挑战与建议这篇论文很实在,直接指出LLM-as-a-Judge在多语言场景下不靠谱,只找出33篇相关研究还一堆问题。做NLP评估的朋友建议看看。