论文多源确认精选13:59BrahmicTokenizer-131K:替代o200k_base的印度语言分词器做多语言NLP或印度语AI应用的团队终于有了一个不牺牲英语和代码性能的专用分词器——直接替换o200k_base就能获得印度语26.7%的token节省,建议做LLM训练或推理优化的开发者试试。#分词器#多语言NLP#印度语#BPE8 个信源在谈事件专题aarXiv: OpenAI@Rohan Shravan9 个信源在谈原文稍后读已读值得跟进有用关注 分词器