论文10:07Tokenizer Tax:量化并解释印度语言子词分词的跨语言代价这篇论文用数据证明印度语言在LLM中平均被吃掉8倍token,马来语更高达13倍,还分析了原因和修复方向,做多语言应用的朋友值得看看。#Tokenizer Tax#FLORES-200#XLM-R#o200k_baseaarXiv: OpenAI@Priyansh Srivastava原文稍后读已读值得跟进有用关注 Tokenizer Tax