AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

Tokenizer Tax

共 1 条相关 AI 资讯
7月28日
10:07
10:07官方一手arXiv: OpenAI@Priyansh Srivastava
该研究使用FLORES-200平行语料库,量化了六种分词器下十四种印度语言的Tokenizer Tax。在GPT-3.5和GPT-4使用的cl100k_base分词器中,印度语言平均token化代价是英语的8.0倍,马拉雅拉姆语高达13.0倍,有效上下文窗口缩减至英语用户的12%。主要机制是失败的字节对合并导致单字节token碎片化,merge失败率与代价高度相关(Pearson r=0.89)。多语言分词器如XLM-R和o200k_base可将平均代价降低73%,表明该问题可通过设计修复。固定上下文预算下,印度语言文档保留的原始内容显著少于英语,Belebele基准上的阅读性能差异主要由语言资源丰富度而非分词器行为解释。
论文Tokenizer TaxFLORES-200XLM-R

推荐理由:这篇论文用数据证明印度语言在LLM中平均被吃掉8倍token,马来语更高达13倍,还分析了原因和修复方向,做多语言应用的朋友值得看看。
原文
精选全部日报登录