Ollama har opdateret sin model-scheduling. Den nye motor måler nu den præcise mængde hukommelse en model kræver, i stedet for at estimere som i tidligere versioner. Ifølge Ollama giver det færre nedbrud på grund af manglende hukommelse, bedre udnyttelse af GPU'en og forbedret ydelse ved brug af flere GPU'er, herunder ved uens GPU-konfigurationer. Værktøjer som nvidia-smi viser nu samme hukommelsesforbrug som ollama ps. I et testeksempel med gemma3:12b på et RTX 4090-kort og 128k kontekstlængde steg genereringshastigheden fra 52,02 til 85,54 tokens i sekundet, mens VRAM-forbruget gik fra 19,9 til 21,4 GiB. Med mistral-small3.2 på to RTX 4090-kort og 32k kontekstlængde steg hastigheden for prompt-evaluering fra 127,84 til 1380,24 tokens i sekundet. Funktionen er som standard aktiveret for modeller på den nye motor, herunder gpt-oss, llama4, gemma3, qwen3 og mistral-small3.2.
Ollama opdaterer model-scheduling og reducerer hukommelsesfejl
Artikel23. september 2025 kl. 02.00 Martin S. Nielsen

Foto: Ollama
Ollama har opdateret sin model-scheduling.
Kilde: Ollama
AI-genereret indhold
Annonceplads
300 x 250
Relaterede artikler
- Ollama opdaterer MLX-motor til Apple Silicon med NVFP4 og hurtigere outputOllama har opdateret sin MLX-motor til Apple Silicon for at øge ydelsen på Mac-hardware.
- Kubernetes gør rootless mode (KubeletInUserNamespace) til beta i v1.37Kubernetes 1.37 løfter feature-gaten KubeletInUserNamespace, også kaldet rootless mode, fra alpha til beta.
- Raspberry Pi kan nu vise splash screens tidligt i boot på SPI og I2C skærmeRaspberry Pi har udviklet en funktion, der gør det muligt at vise et brugerdefineret opstartsbillede meget tid...
- NVIDIA RTX Spark-pc'er fra Lenovo og Acer klar i oktoberNVIDIA har vist nye Windows-pc'er med RTX Spark-platformen på IFA 2026.