主要来源arXiv: OpenAI
查看原文事件专题 · 官方一手
BrahmicTokenizer-131K:替代o200k_base的印度语言分词器
研究者发布了BrahmicTokenizer-131K,一个131072词汇量的字节级BPE分词器,专门优化了印度婆罗米系语言的压缩效率,同时保持与OpenAI o200k_base相当的英语、欧洲语言和代码压缩性能。它通过两阶段改造实现:先裁剪o200k_base中不相关的书写系统,再为9个婆罗米Unicode区块分配2372个词汇槽位。在2700万印度语预训练文本上,它比同词汇量的Mistral-Nemo Tekken/Sarvam-m少产生26.7%的token,其中奥里亚语压缩比达4.31倍。在非印度语内容上,其英语词元率(1.235 vs 1.232)与o200k_base持平,并在HumanEval、MBPP和GSM8K上优于Tekken/Sarvam-m 4.0-14.2%。该分词器是131K词汇量下唯一同时在婆罗米语、英语、欧洲语言、代码和数学上表现均衡的方案,已以Apache 2.0协议开源。
当前结论
做多语言NLP或印度语AI应用的团队终于有了一个不牺牲英语和代码性能的专用分词器——直接替换o200k_base就能获得印度语26.7%的token节省,建议做LLM训练或推理优化的开发者试试。
9 个信源62° AI 热度最后更新 2026/5/28 05:29:12
证据链
相关来源 1IT之家
查看原文相关来源 2Cohere
查看原文相关来源 3marktechpost
查看原文相关来源 4OpenAI Blog
查看原文相关来源 5shao__meng
查看原文相关来源 6宝玉
查看原文相关来源 7Decoder
查看原文相关来源 8Gary Marcus
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。