11:41官方账号arXiv cs.LG@Clara MeisterTokEval是一个分词器评估框架,超越了标准的生育率和压缩率指标,捕捉语言和结构特性。研究人员通过控制预训练实验,仅改变分词器的训练数据混合、预分词策略和训练算法。他们在bits-per-byte和多个基准上评估模型,涵盖语言理解、数学推理和代码生成。实验表明不同内在属性对模型能力有不同影响:信息论指标预测语言建模能力(Spearman rho高达0.80),而结构敏感指标与任务准确率相关。论文TokEvaltokenizerlanguage model推荐理由:TokEval帮你更科学地评估分词器,实验显示不同特性影响不同能力,比盲目预训练更高效原文稍后读已读值得跟进有用关注 TokEval