diff --git a/stacks/ollama.yml b/stacks/ollama.yml index 9d0fd6f..3acdf94 100644 --- a/stacks/ollama.yml +++ b/stacks/ollama.yml @@ -22,6 +22,12 @@ services: - TZ=Europe/Amsterdam - NVIDIA_VISIBLE_DEVICES=all - NVIDIA_DRIVER_CAPABILITIES=all + # Process requests sequentially to avoid batch overflow panics + - OLLAMA_NUM_PARALLEL=1 + # Keep models loaded in VRAM (don't unload after idle) + - OLLAMA_KEEP_ALIVE=-1 + # Load multiple models concurrently (mistral-nemo + nomic-embed-text) + - OLLAMA_MAX_LOADED_MODELS=2 deploy: resources: limits: