Tokenizers v1 fra Hugging Face gør tekst-encoding op til 30 gange hurtigere

Artikel21. september 2026 kl. 02.00 Martin S. Nielsen
Tokenizers v1 fra Hugging Face gør tekst-encoding op til 30 gange hurtigere
Foto: Hugging Face

Hugging Face har udgivet en release candidate af tokenizers v1, et markant opdateret bibliotek til at omdanne tekst til tokens før den sendes til en sprogmodel.

Hugging Face har udgivet en release candidate af tokenizers v1, et markant opdateret bibliotek til at omdanne tekst til tokens før den sendes til en sprogmodel. Ifølge Hugging Face koder v1 tekst 3 til 30 gange hurtigere end v0.23 med én tråd, målt på en Apple M4 Max, og skalerer med 76 procent af lineær hastighed på tværs af otte tråde. Biblioteket producerer stadig præcis de samme token-id'er som før.

Hastigheden kommer fra flere ændringer: opdelingen af tekst sker nu med SIMD-baserede bitstream-operationer i stedet for en regulær udtryksmotor, en trådlokal cache genbruger resultatet for gentagne ord, og BPE-mergeloopet er omskrevet til at bruge en forudallokeret buffer i stedet for at allokere hukommelse for hvert kald. Biblioteket understøtter fortsat samme modelfamilier som v0.23, herunder BPE, WordPiece og Unigram.

Release candidaten kan installeres via cargo add tokenizers --pre.

AI-genereret indhold
Annonce

Prisen er faldet

Faldet er målt af os på varens laveste pris inkl. fragt, ikke på butikkens egen førpris. Vi kan tjene provision, hvis du køber via et link.

Relaterede artikler