AI模型精选72°

Perplexity AI 开源 Unigram 分词器,p50 延迟比 Hugging Face 低 5 倍

Perplexity AI Open-Sources Unigram Tokenizer That Achieves 5x Lower p50 Latency Than Hugging Face tokenizers Crate

精选理由

做搜索或 RAG 系统的团队终于有了更快的分词方案——Perplexity 开源的这个 Unigram 分词器直接降低 5 倍延迟和 6 倍 CPU 消耗,建议有高吞吐需求的开发者立刻试一下。

AI 摘要

Perplexity AI 开源了其重写的 Unigram 分词器,该分词器在 p50 延迟上比 Hugging Face tokenizers crate 低 5 倍,同时将生产环境的 CPU 利用率降低了 5-6 倍。这一改进主要针对重排序器(reranker)的延迟瓶颈,通过优化分词效率来提升整体推理性能。开源版本已在 GitHub 上发布,可供开发者直接使用。对于依赖大规模文本处理的 AI 团队来说,这能显著降低计算成本并加快响应速度。

图片来源 · marktechpost
AI 翻译 · 中文

Perplexity AI 开源了其重写的 Unigram 分词器,该分词器在 p50 延迟上比 Hugging Face tokenizers crate 低 5 倍,同时将生产环境的 CPU 利用率降低了 5-6 倍。这一改进主要针对重排序器(reranker)的延迟瓶颈,通过优化分词效率来提升整体推理性能。开源版本已在 GitHub 上发布,可供开发者直接使用。对于依赖大规模文本处理的 AI 团队来说,这能显著降低计算成本并加快响应速度。

marktechpostPerplexity AI open-sources a rewritten Unigram tokenizer that reduces reranker latency and cuts production CPU utilization by 5-6x. The post Perplexity AI Open-Sources Unigram Tokenizer That Achieves 5x Lower p50 Latency