09:50向阳乔木@vista8Tokenizer是AI模型处理文本的前置步骤,将句子切成子词单元。主流模型如GPT-4使用BPE算法,单词'hello'可能被分成'hel'和'lo'两个token。这解释了为什么大模型在要求数'strawberry'中的r时会数错。本教程通过实例演示,帮助理解tokenizer机制。技巧TokenizerBPE分词推荐理由:想搞懂大模型数不对数的原因?这个视频讲得特别清楚,几分钟就懂了。原文稍后读已读值得跟进有用关注 Tokenizer
11:20官方账号arXiv cs.AI@Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyde, Maxime Labonne, Alexander Amini, Mathias Lechner固定分词器在预训练后对新语言无效,导致每个词被拆成更多token,增加延迟和计算。论文提出原地扩展方法,在现有BPE合并基础上继续添加新token,每个新token可精确分解为源token。将该方法应用于LFM2-8B-A1B(8B参数MoE模型),得到LFM2.5-8B-A1B,词汇量从原tokenizer扩展至128K。扩展后,印地语和越南语的token数分别减少约2.4倍和2.6倍,泰语减少高达4.0倍。结合大词汇量的每token成本,估计参考设备上这些语言的每字解码速度提升2.2-3.7倍。论文分词器扩展LFM2-8B-A1BLFM2.5-8B-A1B推荐理由:想给模型加新语言但不想从头训?这篇论文的原地分词器扩展办法,让LFM2.5在印地语和越南语上token数砍半,解码快3倍,代码和权重都开源了。原文稍后读已读值得跟进有用关注 分词器扩展
13:59官方一手arXiv: OpenAI@Rohan Shravan精选研究者发布了BrahmicTokenizer-131K,一个131072词汇量的字节级BPE分词器,专门优化了印度婆罗米系语言的压缩效率,同时保持与OpenAI o200k_base相当的英语、欧洲语言和代码压缩性能。它通过两阶段改造实现:先裁剪o200k_base中不相关的书写系统,再为9个婆罗米Unicode区块分配2372个词汇槽位。在2700万印度语预训练文本上,它比同词汇量的Mistral-Nemo Tekken/Sarvam-m少产生26.7%的token,其中奥里亚语压缩比达4.31倍。在非印度语内容上,其英语词元率(1.235 vs 1.232)与o200k_base持平,并在HumanEval、MBPP和GSM8K上优于Tekken/Sarvam-m 4.0-14.2%。该分词器是131K词汇量下唯一同时在婆罗米语、英语、欧洲语言、代码和数学上表现均衡的方案,已以Apache 2.0协议开源。论文分词器多语言NLP印度语8 个信源在谈事件专题推荐理由:做多语言NLP或印度语AI应用的团队终于有了一个不牺牲英语和代码性能的专用分词器——直接替换o200k_base就能获得印度语26.7%的token节省,建议做LLM训练或推理优化的开发者试试。原文稍后读已读值得跟进有用关注 分词器