07:42elvis@omarsar0精选72°TokTier提出有状态分词方法,解决智能体场景下代码转录重复提交导致的分词不可复用问题。在153,951次真实智能体调用中,提示缓存命中率94.1%时,分词仍占用首token时延的64%。该方法只对追加位置附近的小窗口重新分词,并通过稳定边界检查拼接,在17个分词器家族的1.5e10次分割检查中零偏差。增量修复100K到3M字符耗时0.5至1.1毫秒,比HuggingFace快最多437倍;在vLLM下中位首token时延下降16%至34%。论文TokTiervLLM智能体推荐理由:做智能体服务的朋友看下,TokTier把长记录重复分词干掉了,vLLM下首字延迟降16%-34%,省GPU。原文稍后读已读值得跟进有用关注 TokTier
09:50向阳乔木@vista8Tokenizer是AI模型处理文本的前置步骤,将句子切成子词单元。主流模型如GPT-4使用BPE算法,单词'hello'可能被分成'hel'和'lo'两个token。这解释了为什么大模型在要求数'strawberry'中的r时会数错。本教程通过实例演示,帮助理解tokenizer机制。技巧TokenizerBPE分词推荐理由:想搞懂大模型数不对数的原因?这个视频讲得特别清楚,几分钟就懂了。原文稍后读已读值得跟进有用关注 Tokenizer
16:10官方一手marktechpost@Asif RazzaqGigatoken是一款MIT许可的Rust BPE分词器,在144核AMD EPYC 9565上实现GPT-2分词速度24.53 GB/s。相比HuggingFace分词器快989倍,比tiktoken快681倍,且这些基线本身已用多线程Rust实现。性能提升来自手写SWAR预分词器和预缓存技术,而非更快的BPE合并循环。该工具可大幅加速文本编码流程。AI产品GigatokenRustBPE分词器4 个信源在谈事件专题推荐理由:想给大模型训练或推理提速?这个HuggingFace分词器速度近千倍的开源Rust工具值得一试。原文稍后读已读值得跟进有用关注 Gigatoken
03:07Ate-a-Pi@svpino精选一本包含50个动手项目的书籍,用Python、PyTorch、Scikit-Learn等工具教你理解大型语言模型内部机制。项目覆盖分词、嵌入、输出logits、Transformer输出、注意力、MLP等核心主题。每个项目配有解决方案,如运用HellaSwag评估模型、用cosine相似度分析嵌入、实现logit lens等方法。完成全部项目可进入该领域前0.01%的水平。技巧LLMPyTorch实战项目推荐理由:想扎实掌握LLM原理?这50个实战项目从基础分词到高级注意力分析,用PyTorch一步步搭出来,比看论文快多了。原文稍后读已读值得跟进有用关注 LLM
10:04官方一手marktechpost@Sana Hassan精选本教程演示如何使用FineWeb数据集进行流式采样(无需下载TB级全量数据),检查模式与元数据(如URL、语言、语言得分、token数量)。复现了FineWeb质量过滤管道的简化版本。涉及去重与分词操作。适合大规模网络语料分析的学习。技巧FineWeb流式处理过滤推荐理由:手把手教你用FineWeb做数据清洗原文稍后读已读值得跟进有用关注 FineWeb
11:18官方账号arXiv cs.LG@Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel精选当前主流分词算法(如BPE、Unigram)本质上是贪心算法,只做局部最优决策,无法保证整体词汇表质量。研究者将分词器构建形式化为线性规划问题,利用凸优化工具求解,提出新算法ConvexTok。实验表明,ConvexTok在内在分词指标和语言模型的bits-per-byte(BpB)上持续优于现有方法,下游任务性能也有提升但不够稳定。更重要的是,ConvexTok能给出一个下界,证明其分词器在常见词汇表大小下距离最优解不超过1%。论文分词凸优化NLP推荐理由:分词是NLP的基础环节,贪心算法长期占据主流——ConvexTok用凸优化给出了可证明接近最优的方案,做分词器优化或语言模型预训练的团队值得关注。原文稍后读已读值得跟进有用关注 分词