Ollama 0.31 introducerer multi-token prediction (MTP) for Gemma 4, hvilket ifølge Ollama gør modellen op til 90 procent hurtigere til tokengenerering på Apple Silicon, målt på Aider polyglot-benchmarken. En mindre draftmodel foreslår flere tokens ad gangen, som hovedmodellen derefter verificerer i ét hop. Ollama tuner selv, hvor mange tokens der foreslås, alt efter hvor ofte forslagene bliver accepteret. Til testen brugte Ollama en Gemma 4 12B-model i nvfp4-kvantisering på en M5 Max, hvor virksomheden desuden har bidraget med en ny matrix-multiplikationskerne til MLX, der gør de største beregninger 2 til 2,5 gange hurtigere. Opdateringen kræver ingen konfiguration og ændrer ikke modellens output. Gemma 4 er den første model i Ollama, der får forbedringen. Modellen kan hentes med ollama pull gemma4:12b-mlx og bruges direkte i kodeagenter via ollama launch.
Ollama 0.31 gør Gemma 4 op til 90 procent hurtigere på Apple Silicon
Artikel29. juni 2026 kl. 02.00 Martin S. Nielsen

Foto: Ollama
Ollama 0.31 introducerer multi-token prediction (MTP) for Gemma 4, hvilket ifølge Ollama gør modellen op til 90 procent hurtigere til tokengenerering på Apple Silicon, målt på Aider polyglot-benchmarken.
Kilde: Ollama
AI-genereret indhold
Annonceplads
300 x 250
Relaterede artikler
- Kubernetes gør rootless mode (KubeletInUserNamespace) til beta i v1.37Kubernetes 1.37 løfter feature-gaten KubeletInUserNamespace, også kaldet rootless mode, fra alpha til beta.
- Raspberry Pi kan nu vise splash screens tidligt i boot på SPI og I2C skærmeRaspberry Pi har udviklet en funktion, der gør det muligt at vise et brugerdefineret opstartsbillede meget tid...
- NVIDIA RTX Spark-pc'er fra Lenovo og Acer klar i oktoberNVIDIA har vist nye Windows-pc'er med RTX Spark-platformen på IFA 2026.
- Nye open source-modeller udnytter Framework Desktops 32GB- og 64GB-hukommelse bedreFramework Desktop fås i tre hukommelseskonfigurationer bygget omkring AMD's Ryzen AI Max-processor, kodenavn S...