跳到正文
北京时间
原文
Perplexity· @perplexity_ai · X·· 2026-05-27精选AI 评分68
AI 导读

我们开源了重新构建的Unigram分词器,可将CPU占用降低5-6倍。 小型重排序器和嵌入模型在GPU上运行时间仅为个位数毫秒,使得CPU分词成为总延迟的重要组成部分。 http://github.com/perplexityai/pplx-garden

推荐理由

Perplexity 开源的这个 tokenizer 能把 CPU 利用率砍掉五六倍,做实时推理的团队值得立马试试,对延迟敏感的场景是实打实的优化。

正文 · 原文

We're open-sourcing the Unigram tokenizer we rebuilt to reduce CPU utilization by 5-6x.

Small rerankers and embedders run in single-digit milliseconds on GPU, making CPU tokenization a meaningful share of total latency.

http://github.com/perplexityai/pplx-garden

来源:Perplexity · x.com