8月3日
09:19
09:19官方一手arXiv: DeepSeek@Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi
精选
TwT(Translation with Thought)是一个难度自适应的多领域机器翻译框架,通过强化学习在直觉与深思推理间动态切换。该模型先利用DeepSeek-R1蒸馏并由GPT-4o重写的长思维链进行监督微调,再通过混合奖励优化翻译质量与推理效率。在15个基准、3种已见语言和59种未见语言上,TwT-7B和TwT-14B的翻译质量超过更大的SOTA推理模型,同时token用量减少32%至60%。
推荐理由:这个TwT框架让翻译模型根据难度动态调整思考量,7B和14B的小模型打过大模型,token还省了30%到60%,做多领域翻译的可以看看。
7月23日
11:28
11:28官方账号arXiv cs.AI@Yiming Wang, Jiayuan Di
本研究系统评估了大型语言模型(LLM)在文化负载翻译中的表现。使用《红楼梦》构建了500条中-日双语数据集,覆盖多种文化类别。发现前沿LLM对文化负载内容存在显著性能差距。人工评估中,不同文化背景的评估者导致明显分歧。常用自动评估指标如BLEU无法可靠评估翻译质量。
推荐理由:这篇论文用《红楼梦》测了LLM翻译文化内容的能力,结果发现GPT-4也不好使,连人工打分都吵起来了。适合关注翻译质量的人看。
5月30日
13:34
13:34官方账号Cohere@cohere
Cohere 宣布其 Command A+ 模型在机器翻译方面取得新突破,性能显著超越开源对手如 Mistral Medium 3.5、DeepSeek 和 OpenAI 的 gpt-oss,甚至优于专业翻译系统 Google Translate。与 RWS 合作开发的系统表现更佳,但 A+ 已拉开明显差距。这标志着 Cohere 在翻译领域的竞争力大幅提升,尤其对需要高质量翻译的企业用户意义重大。
事件专题

推荐理由:做多语言内容或翻译服务的团队值得关注——Cohere 的 A+ 模型在翻译质量上已经超过主流开源和专有方案,可以直接用于生产环境,省去自研或调优的麻烦。