Hugging Face har udgivet en release candidate af tokenizers v1, et markant opdateret bibliotek til at omdanne tekst til tokens før den sendes til en sprogmodel. Ifølge Hugging Face koder v1 tekst 3 til 30 gange hurtigere end v0.23 med én tråd, målt på en Apple M4 Max, og skalerer med 76 procent af lineær hastighed på tværs af otte tråde. Biblioteket producerer stadig præcis de samme token-id'er som før.
Hastigheden kommer fra flere ændringer: opdelingen af tekst sker nu med SIMD-baserede bitstream-operationer i stedet for en regulær udtryksmotor, en trådlokal cache genbruger resultatet for gentagne ord, og BPE-mergeloopet er omskrevet til at bruge en forudallokeret buffer i stedet for at allokere hukommelse for hvert kald. Biblioteket understøtter fortsat samme modelfamilier som v0.23, herunder BPE, WordPiece og Unigram.
Release candidaten kan installeres via cargo add tokenizers --pre.