11:41官方账号arXiv cs.LG@Clara MeisterTokEval是一个分词器评估框架,超越了标准的生育率和压缩率指标,捕捉语言和结构特性。研究人员通过控制预训练实验,仅改变分词器的训练数据混合、预分词策略和训练算法。他们在bits-per-byte和多个基准上评估模型,涵盖语言理解、数学推理和代码生成。实验表明不同内在属性对模型能力有不同影响:信息论指标预测语言建模能力(Spearman rho高达0.80),而结构敏感指标与任务准确率相关。论文TokEvaltokenizerlanguage model推荐理由:TokEval帮你更科学地评估分词器,实验显示不同特性影响不同能力,比盲目预训练更高效原文稍后读已读值得跟进有用关注 TokEval
12:10Stanford AI Lab@StanfordAILab精选斯坦福AI实验室的Tatsunori Hashimoto介绍了Gigatoken,一个超快速的tokenizer。它通过贴近硬件和编写状态机,将tokenization速度提升了数量级。研究者表示再也不需要等待tokenization完成再开始训练。AI产品Gigatokentokenizer斯坦福AI实验室1 个信源在谈事件专题推荐理由:Gigatoken解决了tokenization的瓶颈,训练前不用再傻等,速度提升非常明显。原文稍后读已读值得跟进有用关注 Gigatoken
04:25Stanford AI Lab@StanfordAILab79°Marcel Rød 发布了 Gigatoken,自称是世界上最快的 tokenizer 实现。该实现比 HuggingFace 快 500-1000 倍,比 OpenAI 的 tiktoken 快约 100 倍,而这些基线已经是多线程 Rust 实现。Gigatoken 适用于大多数 tokenizer 定义和机器。Marcel 也是斯坦福 CS 336 课程(从头实现 LLM)的合著者。AI产品GigatokenMarcel Rødtokenizer10 个信源在谈事件专题推荐理由:Marcel Rød 搞了个 Gigatoken,比 HuggingFace 快上千倍,比 tiktoken 快百倍,跑 tokenizer 的抓紧试试。原文稍后读已读值得跟进有用关注 Gigatoken
05:45官方账号Simon Willison’s Weblog(博客/媒体)Anthropic 发布了 Claude Sonnet 5,其性能接近 Opus 4.8 但价格更低。模型支持 1M 上下文窗口和 128K 输出 token,自适应思考默认开启。新 tokenizer 使英文文本 token 数增加约 30%,实际成本上升约 30%。定价保持 Sonnet 4.6 水平:$3/百万输入、$15/百万输出,8月31日前有折扣。AI模型Claude Sonnet 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic 刚发了 Sonnet 5,性能接近 Opus 4.8 但更便宜,不过新 tokenizer 会让你的账单多掏 30%,用之前先算好账。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
03:59Thomas Wolf@Thom_Wolf76°Hugging Face 团队发布了名为 Carbon 的 DNA 模型,其速度比当前最先进的 Evo2 快 275 倍,可在单 GPU 上两天内处理整个人类基因组。Carbon 的核心创新在于其独特的 tokenizer:将 DNA 序列切分为 6 碱基的块,同时保留单碱基分辨率,解决了 BPE 分词器在无空格序列上的低效问题。该模型支持 DNA 序列生成、基因结构分析、突变效应预测、蛋白质折叠以及生命树重建等任务。团队还提供了交互式 demo 供用户探索。AI模型DNA 模型CarbonHugging Face推荐理由:生物信息学研究者终于有了一个能跑全基因组的超快模型——Carbon 把处理时间从数周压缩到两天内,做基因组分析或蛋白质设计的团队可以直接用 demo 试效果。原文稍后读已读值得跟进有用关注 DNA 模型