Ollama 0.31 gør Gemma 4 op til 90 procent hurtigere på Apple Silicon

Artikel29. juni 2026 kl. 02.00 Martin S. Nielsen
Ollama 0.31 gør Gemma 4 op til 90 procent hurtigere på Apple Silicon
Foto: Ollama

Ollama 0.31 introducerer multi-token prediction (MTP) for Gemma 4, hvilket ifølge Ollama gør modellen op til 90 procent hurtigere til tokengenerering på Apple Silicon, målt på Aider polyglot-benchmarken.

Ollama 0.31 introducerer multi-token prediction (MTP) for Gemma 4, hvilket ifølge Ollama gør modellen op til 90 procent hurtigere til tokengenerering på Apple Silicon, målt på Aider polyglot-benchmarken. En mindre draftmodel foreslår flere tokens ad gangen, som hovedmodellen derefter verificerer i ét hop. Ollama tuner selv, hvor mange tokens der foreslås, alt efter hvor ofte forslagene bliver accepteret. Til testen brugte Ollama en Gemma 4 12B-model i nvfp4-kvantisering på en M5 Max, hvor virksomheden desuden har bidraget med en ny matrix-multiplikationskerne til MLX, der gør de største beregninger 2 til 2,5 gange hurtigere. Opdateringen kræver ingen konfiguration og ændrer ikke modellens output. Gemma 4 er den første model i Ollama, der får forbedringen. Modellen kan hentes med ollama pull gemma4:12b-mlx og bruges direkte i kodeagenter via ollama launch.

AI-genereret indhold
Annonceplads

300 x 250

Relaterede artikler