Ollama opdaterer model-scheduling og reducerer hukommelsesfejl

Artikel23. september 2025 kl. 02.00 Martin S. Nielsen
Ollama opdaterer model-scheduling og reducerer hukommelsesfejl
Foto: Ollama

Ollama har opdateret sin model-scheduling.

Ollama har opdateret sin model-scheduling. Den nye motor måler nu den præcise mængde hukommelse en model kræver, i stedet for at estimere som i tidligere versioner. Ifølge Ollama giver det færre nedbrud på grund af manglende hukommelse, bedre udnyttelse af GPU'en og forbedret ydelse ved brug af flere GPU'er, herunder ved uens GPU-konfigurationer. Værktøjer som nvidia-smi viser nu samme hukommelsesforbrug som ollama ps. I et testeksempel med gemma3:12b på et RTX 4090-kort og 128k kontekstlængde steg genereringshastigheden fra 52,02 til 85,54 tokens i sekundet, mens VRAM-forbruget gik fra 19,9 til 21,4 GiB. Med mistral-small3.2 på to RTX 4090-kort og 32k kontekstlængde steg hastigheden for prompt-evaluering fra 127,84 til 1380,24 tokens i sekundet. Funktionen er som standard aktiveret for modeller på den nye motor, herunder gpt-oss, llama4, gemma3, qwen3 og mistral-small3.2.

AI-genereret indhold
Annonceplads

300 x 250

Relaterede artikler