Ollama opdaterer MLX-motor til Apple Silicon med NVFP4 og hurtigere output

Artikel11. juni 2026 kl. 02.00 Martin S. Nielsen
Ollama opdaterer MLX-motor til Apple Silicon med NVFP4 og hurtigere output
Foto: Ollama

Ollama har opdateret sin MLX-motor til Apple Silicon for at øge ydelsen på Mac-hardware.

Ollama har opdateret sin MLX-motor til Apple Silicon for at øge ydelsen på Mac-hardware. Ved at udnytte Apples unified memory og det Metal-baserede MLX-framework giver den nye version ifølge Ollama højere svarkvalitet og hurtigere reaktionstid, samtidig med at hukommelsesforbruget falder. Motoren understøtter nu NVIDIA's NVFP4-format til 4-bit kvantisering. I målinger af perplexitet på modellen Gemma 4 12B halverede NVFP4 kvalitetstabet sammenlignet med det almindelige q4_K_M-format, samtidig med at ydelsen blev fastholdt. Nye optimeringer, herunder sammenlægning af flere operationer i enkelte Metal-kernels via MLX's just-in-time-compiler og en omarbejdet GPU-baseret sampling, gør output op til 20 procent hurtigere. Ollama introducerer desuden et snapshot-system, der gemmer modellens tilstand ved centrale punkter i en samtale, blandt andet ved forgreninger, gentagne forsøg og før hvert svar. Modeller køres med kommandoen ollama run gemma4:12b-mlx, mens ollama launch pi --model gemma4:12b-mlx bruges i en kodningsagent.

AI-genereret indhold
Annonceplads

300 x 250

Relaterede artikler