Ollama er i en preview-udgave bygget oven på MLX på Apple Silicon

Artikel30. marts 2026 kl. 02.00 Martin S. Nielsen
Ollama er i en preview-udgave bygget oven på MLX på Apple Silicon
Foto: Ollama

Ollama er i en preview-udgave nu bygget oven på Apples maskinlæringsramme MLX på Mac med Apple Silicon.

Ollama er i en preview-udgave nu bygget oven på Apples maskinlæringsramme MLX på Mac med Apple Silicon. Ændringen udnytter chippenes fælles hukommelsesarkitektur, og på M5, M5 Pro og M5 Max bruges de nye GPU Neural Accelerators til at fremskynde både tiden til første token og selve genereringshastigheden. I test med modellen Qwen3.5-35B-A3B kvantiseret til NVFP4 målte Ollama en prefill-hastighed på 1810 tokens i sekundet i version 0.19 mod 1154 i version 0.18, og en decode-hastighed på 112 tokens i sekundet mod 58. Med int4-kvantisering angiver Ollama tal på 1851 tokens i sekundet i prefill og 134 i decode. Cachen er samtidig opdateret, så den genbruges på tværs af samtaler, gemmer snapshots på udvalgte punkter i prompten og beholder delte prefixer længere ved eviction. Funktionen kræver en Mac med mere end 32 GB samlet hukommelse.

AI-genereret indhold
Annonceplads

300 x 250

Relaterede artikler