Ollama er i en preview-udgave nu bygget oven på Apples maskinlæringsramme MLX på Mac med Apple Silicon. Ændringen udnytter chippenes fælles hukommelsesarkitektur, og på M5, M5 Pro og M5 Max bruges de nye GPU Neural Accelerators til at fremskynde både tiden til første token og selve genereringshastigheden. I test med modellen Qwen3.5-35B-A3B kvantiseret til NVFP4 målte Ollama en prefill-hastighed på 1810 tokens i sekundet i version 0.19 mod 1154 i version 0.18, og en decode-hastighed på 112 tokens i sekundet mod 58. Med int4-kvantisering angiver Ollama tal på 1851 tokens i sekundet i prefill og 134 i decode. Cachen er samtidig opdateret, så den genbruges på tværs af samtaler, gemmer snapshots på udvalgte punkter i prompten og beholder delte prefixer længere ved eviction. Funktionen kræver en Mac med mere end 32 GB samlet hukommelse.
Ollama er i en preview-udgave bygget oven på MLX på Apple Silicon
Artikel30. marts 2026 kl. 02.00 Martin S. Nielsen

Foto: Ollama
Ollama er i en preview-udgave nu bygget oven på Apples maskinlæringsramme MLX på Mac med Apple Silicon.
Kilde: Ollama
AI-genereret indhold
Annonceplads
300 x 250
Relaterede artikler
- Kubernetes gør rootless mode (KubeletInUserNamespace) til beta i v1.37Kubernetes 1.37 løfter feature-gaten KubeletInUserNamespace, også kaldet rootless mode, fra alpha til beta.
- Raspberry Pi kan nu vise splash screens tidligt i boot på SPI og I2C skærmeRaspberry Pi har udviklet en funktion, der gør det muligt at vise et brugerdefineret opstartsbillede meget tid...
- NVIDIA RTX Spark-pc'er fra Lenovo og Acer klar i oktoberNVIDIA har vist nye Windows-pc'er med RTX Spark-platformen på IFA 2026.
- Nye open source-modeller udnytter Framework Desktops 32GB- og 64GB-hukommelse bedreFramework Desktop fås i tre hukommelseskonfigurationer bygget omkring AMD's Ryzen AI Max-processor, kodenavn S...